技术报告-MiniCPM-V4.5
1. 介绍1.1 前置极简科普链接https://fairy-study.blog.csdn.net/article/details/162237140ViT 视觉编码器专门看图的 Transformer把一张图片切成无数小方块patch每一块变成一串数字向量视觉 token相当于把图片 “翻译成 AI 能看懂的数字语言”。一张 448×448 图片普通 ViT 会产出几百上千个 token越长越占显存、推理越慢。作为KVLLM 解码器文本 Transformer就是普通大语言模型只认文本 token看不懂图片 / 视频的向量必须靠中间模块做转换。作为QueryResampler重采样器图像和 LLM 之间的 “压缩中转站”。ViT 输出一大堆图片 tokenResampler-3D用交叉注意力筛选关键信息做压缩压缩成很少的固定长度 token送给 LLM大幅省显存、提速。旧版只有2D-Resampler只能压缩单张图片MiniCPM-V4.5 升级为3D-Resampler同时处理画面空间 视频时间维度。本质是一个单层的多头注意力 MLP1.2 简洁本文推出MiniCPM-V 4.5一款 8B 参数量、兼顾高性能与超高效率的多模态模型。我们从模型结构、训练数据、训练方案三个维度提出三大核心创新统一 3D 重采样器架构实现图片、视频的超高压缩编码文档知识 文字识别统一学习范式免去繁杂的数据预处理工作混合强化学习策略让模型既能快速简答也能复杂问题分步深度推理。效果在OpenCompass综合评测集上的大量实验证明仅 8B 参数的 MiniCPM-V 4.5性能超过 GPT-4o-latest 这类商用闭源模型也超越参数量大得多的开源模型 Qwen2.5-VL 72B。更关键的是它的性能优势建立在极低算力开销之上。例如在主流视频评测基准 VideoMME 中它是 30B 以下模型里效果最好的显存占用仅为 Qwen2.5-VL 7B 的 46.7%推理耗时仅为后者的 8.7%。其实指标高并没有什么好骄傲的本质就是找到了更牛逼的 SFT、RL数据集给到 Pretrain 那边混起来训效果变得更好嘛。2. 架构2.1 整体三层流水线从输入到输出完整流程图片 / 视频输入 → 视觉编码器 ViT → 统一 3D-Resampler 压缩 → LLM 文本 Transformer 解码输出第一层视觉输入预处理 轻量化 ViT 视觉编码器图像处理分支Image Partitioning输入分三类超高清大图、极端宽高比图片、普通图片。模型会自动把大图切成多个小切片适配 ViT 的训练尺寸避免图片变形丢失细节。切片全部送入ViT 视觉编码器SigLIP 轻量化 ViT你已知的基础模块把每一小块图片转换成视觉特征向量。比如 4096 x 4096 就会分成若干个小的 pile 然后把 pile 再给到 vit 这样就不会丢失原图像精度同样还能理解图像视频处理分支Video Packing输入高帧率、长视频模型会把连续几帧打包成一组video package同一组画面大部分内容重复冗余极高。每一帧分别走 ViT 编码输出每帧的图像特征。按时序 package 每帧数据然后 Query 向量进行加权融合得到视频向量第二层核心创新 —— 统一 3D-Resampler这是和普通多模态模型最大区别分两路复用同一个模块图片压缩逻辑继承旧版 2D 能力ViT输出大量图片特征3D-Resampler用少量可学习查询向量做交叉注意力筛选画面关键信息把几百个图片 token 压缩到固定 64 个最高 16 倍压缩率。只处理画面二维空间信息宽、高。文本和视觉 Token 点积完后会得到融合矩阵压缩冗余信息类似Lora视频压缩逻辑新增 3D 时空压缩同一组打包的多帧画面Resampler同时读取空间画面像素 时间帧先后顺序 两种信息识别帧之间重复内容并丢弃一组 6 帧视频只输出 64 个 token叠加时间维度额外 6 倍压缩整体最高 96 倍压缩。特点不需要设置阈值统一设计优势图片、视频共用一套Resampler权重不用分开训练图片学到的文字、物体知识能直接迁移到视频自带视频 OCR 能力无需额外视频文字数据训练。第三层LLM Decoder文本 Transformer你熟悉的基础模块压缩完成的图片 / 视频 token和文本提问 token 拼接在一起送入标准大语言 Transformer 解码器有两种输出模式长推理模式 Long Reasoning Mode开头带 标签模型分步写出思考过程适合数学、化学、图表、复杂文档难题短推理模式 Short Reasoning Mode直接输出答案无多余思考步骤看图闲聊、简单 OCR、短视频问答速度更快。2.2 3D-Resampler 怎么压缩组内冗余帧的帧分组是固定时序打包压缩依赖可学习交叉注意力自动完成不靠显式相似度打分、阈值过滤。(根据Query意图自己来)6 秒 2fps 视频共 12 帧固定按 4 帧一组打包[1-4]、[5-8]、[9-12]纯时间分割不对比画面内容。组内所有帧全部送入ViT每帧生成一堆空间视觉token输入一组固定数量、可学习的Query向量一共 64 个全程不变Query和整组所有帧特征做时空联合交叉注意力Query 自动学习哪些帧画面重复、信息冗余权重压低动作变化大、关键物体出现的帧权重拉高重点提取信息无论组内是 1 帧还是 10 帧最终统一输出固定 64 个视频 token。(加权求和)2.3 3D-Resampler 里的 64 个可学习 QueryQuery 向量背景介绍来源模型初始化出来的一组独立参数和 LLM、ViT 参数分开是模型自己 “学出来的提取器”没有任何文字含义作用充当「信息浓缩模板」去遍历所有帧的图像特征加权融合强制把海量图像信息压缩成固定 64 条向量身份Cross-Attention 里的 Query 端注意力机制标准三元组 Q/K/VQ 检索器K/V 待检索素材生命周期只在视觉压缩模块内部用压缩完输出 64 个视觉 token之后才会和用户文字提问拼接。如何可学习这些Query不是单纯随机向量只是初始化时随机训练全程会持续更新优化最终变成一套专门用来浓缩视觉信息的固定检索模板。不用视频特征当Q、不用文本当Q偏偏单独训练一组专属Q是为了实现固定长度压缩、统一图文处理、降低算力开销三大核心目标。3. 预训练整体预训练总 token 约 620B6200 亿多模态 token包含 5 大类混合多模态数据图文描述、图文交错网页、合成 OCR、PDF 文档、视频图文对。3.1 目标分阶段解冻模型三大组件ViT 视觉编码器、2D-Resampler、LLM 大语言底座用海量多模态原始数据让模型自学看懂图片、识别文字、理解视频时序、读懂 PDF 论文图表同时独创文档 OCR统一噪声训练解决传统 PDF 解析工具出错、模型文字幻觉两大痛点。采用Warmup-Stable-Decay升温 - 平稳 - 衰减学习率调度。3.2 阶段 1预热对齐只训 2D-ResamplerViT、LLM 全部冻结训练数据仅图文描述对image-caption。操作视觉编码器、语言大模型完全锁住不动只训练图片和文字中间的Resampler压缩层。作用极低算力成本建立「图片画面 ↔ 文字描述」基础对应关系先解决 “图和文字对不上” 底层问题。对 Resampler 训练的澄清真正的 GT 是人类写好的图片描述文本Caption。比如输入一张狗的图片Prompt 是“描述图片”GT 是“一只狗”。LLM 根据 Resampler 传来的 64 个向量去预测下一个词。如果它预测成了“一只猫”那么预测结果和 GT “一只狗”之间就会产生巨大的误差。3.2 阶段 1强化视觉感知解冻 ViTLLM 依旧冻结训练数据OCR 文字图 图文描述对操作放开ViT视觉编码器训练LLM 全程锁住不更新作用专门打磨看图、识别画面文字的能力不训练语言模型避免ViT识别出错后 LLM 强行编造文字圆谎减少早期幻觉。感觉冻结参数冻结的肯定不是随机参数不然没道理啊只感知不说话3.3 阶段 3全模块端到端打通ViT/Resampler/LLM 全部解冻训练数据全套高质量混合数据纯文本、多图混排网页、视频、精选文档以及前两阶段筛选后的优质样本操作全部参数一起训练正式学习复杂多图联动、视频动态时序、专业文档知识训练后期逐步加入高难度、高密度知识样本。作用打通视觉与语言完整链路模型同时具备图文、视频、专业知识理解能力。4. SFT 两阶段训练流程阶段 1通用指令对齐微调训练数据海量通用多模态对话数据额外掺入 10% 纯文本数据目的激活预训练学到的全部图文、视频、文档知识让模型听懂普通人日常提问掺入纯文本防止模型文字能力退化训练更稳定。阶段 2长 CoT 深度推理 升级 3D-ResamplerSFT 最重要阶段同步完成两件大事训练长分步推理能力输入带完整分步推导的难题样本引导模型遇到数理、图表、复杂文档时输出 思考过程培养逻辑拆解能力2D Resampler → 3D Resampler 架构升级仅用少量高质量视频数据即可完成升级图片、视频共用一套压缩权重图片上学到的文字、物体知识自动迁移到视频无需额外采集大量视频 OCR 数据天然具备视频文字识别能力。SFT 四大专项训练数据全部严格筛选错题、简单题所有样本两层校验先筛 “不看图就做不出” 的视觉依赖题目再人工 大模型双重校验答案正确性过滤无意义重复、错误推理。STEM 理工科图文数据初高中、大学数理化生、金融、计算机几何 / 图表题只保留必须看图才能解的样本生成干净分步推理过程。长尾冷门知识数据维基百科小众实体图文问答解决模型只认识常见物体、冷门内容答不出的短板。Long-CoT 深度思考数据来源OpenThought 开源集 内部自建标注流水线只挑早期模型做不对的难题训练跳过简单题推理答案多层校验验证答案对错、事实真实性、过滤无意义重复再改写扩充样本多样性。通用多模态对话数据覆盖小红书文案创作、日常看图问答、表格提取、短视频解读等生活化场景。