Lazy loaded imageMM1技术小结(MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training)

建立一个有效的多模态模型需要: • 精心设计不同类型数据的占比。混合图文交错数据(interleaved image-text), 仅文本数据(text-only),image caption数据。作者文中推荐interleaved: caption: text-only = 45% : 45% : 10%。 • image encoder、image resolution、image token的大小对结果非常重要。 • vision language connector对performant的多模态模型不那么重要。
MM1技术小结(MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training)
🔥Lit: 进一步提升多模态模型Zero-Shot迁移学习的能力
YOLO-World技术小结

Lazy loaded imageData Filtering Network论文浅析

文本从data curation的方向研究如何提升CLIP的performance。本文核心是提出了一个二阶段的训练范式: • Stage1: 用高质量数据训练DFN。“high quality filter dataset → DFN”; • Stage2: 用DFN清洗后的数据训练induced model (即CLIP)。“data-pool → DFN (trained)→ induced dataset → induced model”。
Data Filtering Network论文浅析
SigLIP技术小结
多模态模型如何处理任意分辨率输入——Tiling与Packing技术详解

Lazy loaded image多模态模型如何处理任意分辨率输入:位置编码设计

本文围绕 decoder-only 多模态模型中的位置编码设计,讨论了视觉 token 从二维/三维结构被展平成一维序列后带来的位置表达问题。 Vanilla 1D RoPE 的优势是简单、兼容预训练 LLM,但它会把图像中的二维几何关系压缩到一维序列距离中。对于任意分辨率输入,同样的空间相对位置可能对应不同的一维相对距离,这会增加模型学习空间结构的难度。 3D RoPE / MRoPE 的核心思路,是让序列仍然保持一维输入形式,但为每个 token 分配三维 position id,即 $(t,h,w)$。这样既能兼容文本 token 的 1D RoPE 先验,又能让视觉 token 保留时间、高度、宽度方向上的几何相对关系。 MRoPE-I、MHRoPE 等方法在频率分配层面改进标准 MRoPE,使不同位置轴能更充分地利用 RoPE 的频谱。
多模态模型如何处理任意分辨率输入:位置编码设计
Qwen-VL系列解析(一)——Qwen2-VL
《MinerU2.5-Pro》 技术小结