【Transformer 与注意力机制】46|多模态融合:CLIP、Flamingo、LLaVA、SAM
CLIP 靠 batch 负样本和温度做对比学习,不是拼 caption;projector、Flamingo cross-attention、LLaVA 指令微调三种接法各有幻觉、OCR、分辨率失败模式;SAM 的 promptable segmentation 与聊天 VLM 是两条产品线。
Linux 内核、存储与网络、可观测性、系统架构与大模型基础设施的工程笔记:机制拆解、踩坑复盘与可核对证据,少空谈。
共 1 篇文章 · 返回首页
CLIP 靠 batch 负样本和温度做对比学习,不是拼 caption;projector、Flamingo cross-attention、LLaVA 指令微调三种接法各有幻觉、OCR、分辨率失败模式;SAM 的 promptable segmentation 与聊天 VLM 是两条产品线。