MiniCPM-o 2.6 全模态模型实战指南8B 端到端视觉、语音与多模态流式交互【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V本文基于 docs/minicpm_o2dot6_zh.md 整理归档时间 2026-02-02并结合当前仓库中的演示源码与依赖配置进行深度补充。MiniCPM-o 2.6 是 MiniCPM-o 系列中最新、性能最强的全模态Omni-modal大模型总参数量约 8B通过端到端方式连接并训练视觉、语音、文本各模态的编解码模块支持可配置声音的中英双语实时语音对话、连续视频/音频流的实时多模态交互以及单图、多图、视频的视觉理解。读完本文你将掌握该模型的整体架构原理、六大核心能力、各评测基准上的表现数据以及从 llama.cpp/vLLM 推理到本地 WebUI 演示、LLaMA-Factory 微调的一整套上手路径。模型概览MiniCPM-o 系列的最新成员MiniCPM-o 2.6 由四部分基础组件端到端构建而成SigLip-400M视觉编码器、Whisper-medium-300M音频编码器、ChatTTS-200M语音解码器与Qwen2.5-7B大语言模型基座合计8B 参数。模型完全以端到端方式训练和推理训练过程仅使用交叉熵CE损失。相比上一代 MiniCPM-V 2.6MiniCPM-o 2.6 在性能上有了显著提升并新增了两类能力实时语音对话与多模态流式交互——即模型可以持续接收视频和音频流随时与用户进行语音交流而不是被动等待用户上传完整个文件再作答。视觉编码器 SigLip-400M 音频编码器 Whisper-medium-300M 语音解码器 ChatTTS-200M LLM 基座 Qwen2.5-7B MiniCPM-o 2.6约 8B 参数端到端训练仅 CE 损失核心能力全景MiniCPM-o 2.6 的能力可以归纳为以下六个方面对应官方文档中的六大特性。领先的视觉理解能力MiniCPM-o 2.6 在 OpenCompass 榜单上综合 8 个主流多模态评测基准平均得分70.2以 8B 量级的规模在单图理解上超越了 GPT-4o-202405、Gemini 1.5 Pro、Claude 3.5 Sonnet 等主流商用闭源多模态大模型在多图和视频理解上同样优于 GPT-4V 和 Claude 3.5 Sonnet并展现出良好的上下文学习In-Context Learning能力。出色的语音能力MiniCPM-o 2.6支持可配置声音的中英双语实时对话。在语音理解任务如 ASR 语音识别、STT 语音翻译上优于 GPT-4o-realtime在语音对话的语义与声学评估中展现了开源模型中最高水平的语音生成性能。此外还支持情绪/语速/风格控制、语音克隆、角色扮演等进阶能力。强大的多模态流式交互能力作为一项全新功能MiniCPM-o 2.6 能够接受连续的视频和音频流并与用户进行实时语音交互。在针对实时视频理解、全模态视音频理解、多模态上下文理解的综合评测基准 StreamingBench 上MiniCPM-o 2.6 取得开源社区最佳水平并超过了 GPT-4o-202408 和 Claude 3.5 Sonnet。强大的 OCR 能力及其他MiniCPM-o 2.6 继承了并进一步优化了 MiniCPM-V 2.6 的众多视觉理解能力可处理任意长宽比的图像像素数最高达180 万如 1344×1344在OCRBench上取得 25B 以下模型中的最佳水平超过 GPT-4o-202405 等商用闭源模型基于最新的 RLHF-V、RLAIF-V 与 VisCPM 技术具备可信的多模态行为在MMHal-Bench幻觉评测上超过 GPT-4o 与 Claude 3.5支持英语、中文、德语、法语、意大利语、韩语等30 多种语言。卓越的效率除模型本身大小对个人用户友好外MiniCPM-o 2.6 还表现出最先进的视觉 token 密度即每个视觉 token 编码的像素数量仅需 640 个 token 即可处理 180 万像素图像比大多数模型少 75%。这一特性直接优化了推理速度、首 token 延迟、内存占用与功耗使其可以在 iPad 等终端设备上高效支持多模态实时流式交互。易于使用官方文档给出了 6 种使用路径本文后续章节会逐一展开llama.cpp 支持在本地设备上进行高效的 CPU 推理int4 与 GGUF 格式的量化模型共提供16 种尺寸vLLM 支持高吞吐量、内存高效的推理通过 LLaMA-Factory 框架针对新领域和任务进行微调使用 Gradio 快速搭建本地 WebUI 演示部署于服务器的在线 demo。模型架构解析官方文档将 MiniCPM-o 2.6 的架构创新概括为三点端到端全模态架构、全模态流式机制、可配置的声音方案。端到端全模态架构不同模态的编码器/解码器通过端到端方式连接并训练以充分利用丰富的多模态知识。整个模型完全使用 CE 损失进行端到端训练无需分阶段或引入额外的对抗/重建损失训练范式简洁统一。全模态流式机制流式能力由两层设计共同支撑在线化改造将不同模态的离线编/解码器改造为适用于流式输入/输出的在线模块时分复用TDM机制针对大语言模型基座设计了时分复用的全模态流式信息处理机制把平行的不同模态信息流拆分重组为周期性时间片序列让 LLM 基座可以交替处理视觉、音频、文本信息从而实现边看、边听、边回答的实时体验。可配置的声音方案模型设计了一种新的多模态系统提示System Prompt包含传统的文本系统提示词以及用于指定模型声音的语音系统提示词。推理时用户既可以通过文字描述控制声音风格也可以通过语音样例指定声音从而支持端到端声音克隆和音色创建等高级能力。性能评估以下数据均来自官方文档详细表格可在 docs/minicpm_o2dot6_zh.md 中查看评测覆盖图像理解、多图/视频理解、语音理解、语音生成、声音克隆与多模态流式交互六个维度。图像理解能力下表对比了 MiniCPM-o 2.6 与闭源商用模型GPT-4o-20240513、Claude3.5-Sonnet、Gemini 1.5 Pro、GPT-4o-mini以及开源模型Cambrian-34B、GLM-4V-9B、Pixtral-12B、DeepSeek-VL2-27B、Qwen2-VL-7B、LLaVA-OneVision-72B、InternVL2.5-8B、MiniCPM-V 2.6的表现ModelSizeToken DensityOpenCompassOCRBenchMathVista miniChartQAMMVetMMStarMMEMMB1.1 testAI2DMMMU valHallusionBenchTextVQA valDocVQA testMathVerse miniMathVisionMMHal ScoreGPT-4o-20240513-108869.973661.385.769.163.92328.782.284.669.255.0-92.850.230.43.6Claude3.5-Sonnet-75067.978861.690.866.062.21920.078.580.265.949.9-95.2--3.4Gemini 1.5 Pro--64.475457.781.364.059.12110.673.979.160.645.673.586.5-19.2-GPT-4o-mini-20240718-108864.178552.4-66.954.82003.476.077.860.046.1----3.3Cambrian-34B34B182058.359150.375.653.254.22049.977.879.550.441.676.775.5---GLM-4V-9B13B78459.177651.1-58.054.82018.867.971.246.945.0-----Pixtral-12B12B25661.068556.981.858.554.5-72.779.051.147.075.790.7---DeepSeek-VL2-27B (4B)27B67266.480963.986.060.061.92253.081.283.854.045.384.293.3--3.0Qwen2-VL-7B8B78467.186658.283.062.060.72326.081.883.054.150.684.394.531.916.33.2LLaVA-OneVision-72B72B18268.174167.583.760.665.82261.085.085.656.849.080.591.339.1-3.5InternVL2.5-8B8B70668.382264.484.862.862.82344.083.684.556.050.179.193.039.519.73.4MiniCPM-V 2.68B282265.2852*60.679.460.057.52348.4*78.082.149.8*48.1*80.190.825.718.33.6MiniCPM-o 2.68B282270.2897*71.9*86.9*67.564.02372.0*80.585.850.4*51.982.093.541.4*23.1*3.8* 表示使用思维链Chain-of-Thought提示词评测其中 MME 仅在 Cognition 任务上使用了思维链。 Token Density 表示每个视觉 token 在最大分辨率下编码的像素数最大分辨率像素数 ÷ 视觉 token 数闭源模型的 Token Density 由其 API 收费方式估算得到。可以看到MiniCPM-o 2.6 在 OpenCompass70.2、OCRBench897、MathVista mini71.9、MME2372.0、AI2D85.8、MMHal Score3.8等多项指标上均为表中最佳而其 Token Density 高达 2822远高于多数对比模型。多图和视频理解能力ModelSizeBLINK valMantis EvalMIRBVideo-MME (wo / w subs)GPT-4o-20240513-68--71.9/77.2GPT4V-54.662.753.159.9/63.3LLaVA-NeXT-Interleave 14B14B52.666.430.2-LLaVA-OneVision-72B72B55.477.6-66.2/69.5MANTIS 8B8B49.159.534.8-Qwen2-VL-7B8B53.269.6*67.6*63.3/69.0InternVL2.5-8B8B54.867.752.564.2/66.9MiniCPM-V 2.68B5369.153.860.9/63.6MiniCPM-o 2.68B56.771.958.663.9/67.9* 表示对正式开源模型权重的评测结果。语音理解能力评测任务包括中文 ASRAISHELL-1、Fleurs zh、WenetSpeech test-net指标 CER↓、英文 ASRLibriSpeech test-clean、GigaSpeech、TED-LIUM指标 WER↓、语音翻译 ASTCoVoST en2zh / zh2en指标 BLEU↑与情绪识别MELD emotion指标 ACC↑TaskSizeASR (zh) CER↓ASR (zh) CER↓ASR (zh) CER↓ASR (en) WER↓ASR (en) WER↓ASR (en) WER↓AST BLEU↑AST BLEU↑Emotion ACC↑DatasetAISHELL-1Fleurs zhWenetSpeech test-netLibriSpeech test-cleanGigaSpeechTED-LIUMCoVoST en2zhCoVoST zh2enMELD emotionGPT-4o-Realtime-7.3*5.4*28.9*2.6*12.9*4.8*37.1*15.7*33.2*Gemini 1.5 Pro-4.5*5.9*14.3*2.9*10.6*3.0*47.3*22.6*48.4*Qwen2-Audio-7B8B-7.5-1.6--45.224.455.3Qwen2-Audio-7B-Instruct8B2.6*6.9*10.3*3.1*9.7*5.9*39.5*22.9*17.4*GLM-4-Voice-Base9B2.5--2.8-----MiniCPM-o 2.68B1.64.46.91.78.73.048.227.252.4* 表示对正式开源模型权重的评测结果。语音生成能力SpeechQA评测基于 AudioEvals 框架官方文档中给出的评估方法与更多细节见开源项目 UltraEval-Audio包含 Speech Llama Q. / Speech Web Q. / Speech Trivia QA 三档问答准确率ACC↑、Speech AlpacaEval 的 G-Eval 评分10 分制↑以及 AudioArena 的语义/声学/综合 ELO 分数↑、UTMOS 自然度评分↑与 ASR-WER 可懂度↓TaskSizeSpeech Llama Q. ACC↑Speech Web Q. ACC↑Speech Trivia QA ACC↑G-Eval (10 point)↑Semantic ELO↑Acoustic ELO↑Overall ELO↑UTMOS↑ASR-WER↓GPT-4o-Realtime-71.751.669.77.41157120312004.22.3GLM-4-Voice9B50.032.036.45.1999114710354.111.7Llama-Omni8B45.322.910.73.99608788973.224.3VITA-1.58B46.728.123.32.0-----Moshi7B43.723.816.72.48718088752.88.2Mini-Omni1B22.012.86.92.59268038653.410.0MiniCPM-o 2.68B61.040.040.25.11088116311314.29.8端到端声音克隆能力在 Seed-TTS test-zh / test-en 两个测试集上以 SIMO 相似度指标↑对比MiniCPM-o 2.6 在端到端声音克隆任务上分别取得 57 / 47 分TaskSeed-TTS test-zh SIMO↑Seed-TTS test-en SIMO↑F5-TTS7667CosyVoice7564FireRedTTS6346MiniCPM-o 2.65747多模态流式交互能力StreamingBench从实时视频理解Real-Time Video Understanding、全模态视音频理解Omni-Source Understanding与多模态上下文理解Contextual Understanding三个子项衡量ModelSizeReal-Time Video UnderstandingOmni-Source UnderstandingContextual UnderstandingOverallGemini 1.5 Pro-77.467.851.170.3GPT-4o-202408-74.551.048.064.1Claude-3.5-Sonnet-74.041.437.859.7VILA-1.58B61.537.526.749.5LongVA7B63.135.930.250.7LLaVA-Next-Video-34B34B69.841.734.356.7Qwen2-VL-7B8B71.240.733.157.0InternVL2-8B8B70.142.734.157.0VITA-1.58B70.940.835.857.4LLaVA-OneVision-7B8B74.340.831.058.4InternLM-XC2.5-OL-7B8B75.446.233.660.8MiniCPM-V 2.68B72.440.233.457.7MiniCPM-o 2.68B79.953.438.566.0MiniCPM-o 2.6 在实时视频理解单项上取得所有对比模型中的最高分79.9综合分 66.0 为开源社区最佳并超过 GPT-4o-20240864.1与 Claude 3.5 Sonnet59.7。快速上手多种使用路径根据官方文档MiniCPM-o 2.6 提供了六种主流使用方式覆盖端侧 CPU、GPU 服务端与微调场景。基于 llama.cpp / Ollama / vLLM 的高效推理llama.cpp官方为 MiniCPM-o 2.6 提供了专用的本地分支minicpm-omni支持在本地设备如 Mac、低资源设备上进行高效的 CPU 推理量化模型官方发布 int4 与 GGUF 格式的量化版本共16 种尺寸方便不同显存/内存的设备按需选用vLLM支持高吞吐量与内存高效的 GPU 推理适合服务化部署Ollama可一键拉取官方镜像使用。注意由于模型仍在持续适配中建议优先使用仓库官方提供的分支/镜像运行避免因框架主分支尚未合入而出现兼容性问题。通过 LLaMA-Factory 微调针对新领域和新任务可以通过 LLaMA-Factory 框架对 MiniCPM-o 2.6 进行微调。该文档详细说明了数据准备、训练参数与推理验证的完整流程此外社区中 Align-Anything 框架也支持对 MiniCPM-o 2.6 在视觉与音频双模态上进行 SFT 与 DPO 对齐微调。本地 WebUI 演示与在线 Demo本地 WebUI使用 Gradio 快速搭建一条命令即可启动在线 demo官方在服务器上部署了在线演示方便不满足本地硬件条件的用户直接体验实时语音与流式交互。仓库实践Web 演示与依赖环境当前仓库在web_demos/minicpm-o_2.6/目录下提供了完整的 MiniCPM-o 2.6 交互演示实现包含服务端推理、WebSocket 流式通信、VAD 语音活动检测与前端页面四部分可以直接对照官方文档上手运行。依赖环境requirements_o2.6.txt仓库根目录的 requirements_o2.6.txt 给出了运行 MiniCPM-o 2.6 演示所需的核心依赖与版本约束关键项包括依赖版本用途torch / torchaudio / torchvision2.3.1 / 2.3.1 / 0.18.1深度学习框架与音频处理transformers4.44.2模型加载与推理trust_remote_codesentencepiece0.2.0分词器vector-quantize-pytorch1.18.5语音 token 向量量化vocos0.1.0语音解码器accelerate1.2.1多卡加载与 device maptimm / soundfile / librosa / decord / moviepy见文件视觉骨干、音频读写与视频解码fastapi / uvicorn / gradio 4.44.1 / modelscope_studio见文件Web 后端与前端组件onnxruntime / aiofiles / pydantic见文件VAD 推理与异步文件 IO服务端model_server.pyweb_demos/minicpm-o_2.6/model_server.py 是基于 FastAPI WebSocket 的流式服务端承担实时语音交互的核心逻辑通过命令行参数--model指定 HuggingFace 模型名或本地路径默认openbmb/MiniCPM-o-2_6--port指定服务端口默认 32550使用AutoModel.from_pretrained(..., trust_remote_codeTrue, torch_dtypetorch.bfloat16, attn_implementationsdpa)加载模型并显式调用init_tts()初始化语音生成模块内部的StreamManager类管理流式会话状态包括流式完成事件、会话超时900 秒、无流超时3 秒、VAD 设置vad_utils.VadOptions()、音频分块audio_chunk 200等参数引入 web_demos/minicpm-o_2.6/vad_utils.py 与 web_demos/minicpm-o_2.6/silero_vad.onnx 实现基于 Silero VAD 的语音活动检测用于判断用户何时开始/结束说话。前端与聊天演示chatbot_web_demo_o2.6.py 与 web_serverweb_demos/minicpm-o_2.6/chatbot_web_demo_o2.6.py 提供基于 Gradio 的聊天界面支持多图上传、视频对话与少样本Few-shot示例功能模型加载时使用init_audioFalse, init_ttsFalse先加载主模型并支持--multi-gpus参数通过 accelerate 的infer_auto_device_map将模型分布到多张 GPU 上示例配置为两张 10GB 显存卡并通过 device_map 将首尾层、视觉塔与重采样器固定在同一设备上web_demos/minicpm-o_2.6/web_server/ 是独立的 Web 前端工程Vue Vite pnpm提供包含语音通话、视频通话等更完整的交互页面其 README 说明了安装依赖pnpm install、开发模式pnpm run dev与生产构建pnpm run build的命令。典型示例官方文档给出了 MiniCPM-o 2.6 在 iPad Pro 上的实机演示实时多模态对话以及 Web 演示中的典型案例包括数学几何交点求解、神经网络结构图解与多图理解自行车场景等小结MiniCPM-o 2.6 以约 8B 的参数量通过端到端全模态架构、时分复用的流式信息处理机制与可配置语音系统提示设计把领先的单图/多图/视频理解、中英双语实时语音对话、多模态流式交互与高视觉 token 密度效率整合进同一模型。无论是个人开发者在本地搭建 WebUI 体验实时语音交互还是服务端借助 vLLM/llama.cpp 进行高效推理部署亦或是通过 LLaMA-Factory 针对新任务微调官方文档与当前仓库都提供了可直接运行的参考实现与完整依赖说明可作为研究全模态端侧大模型的重要范本。【免费下载链接】MiniCPM-VA Pocket-Sized MLLM for Ultra-Efficient Image and Video Understanding on Your Phone项目地址: https://gitcode.com/GitHub_Trending/mi/MiniCPM-V创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
