前言智谱AI又又又开源了个大模型说实话AI圈实在是太卷了特别是国内的大模型厂商几乎是贴身肉搏。今天你发布一个新功能明天我就开源一个新模型。作为AI领域的博主我打字的速度都快跟不上他们迭代的速度了…先说说智谱这次开源的模型叫GLM-4.1V-Thinking是首个9B级别的通用多模态语言模型VLM这应该是智谱目前开源的最小参数量的模型了。而且这个9B参数量的模型全面超越了传统的非推理式视觉模型在28项评测任务中有23项登顶10B级别模型最佳性能其中18项任务媲美、甚至超越其8倍参数量的Qwen-2.5-VL-72B。我心里其实点免疫了。毕竟现在各种模型满天飞“SOTA”、最强这些词我也快听出茧子了。但当我实测并研究了他们技术报告和开源资料后发现次好像真的不太一样。GLM-4.1V-Thinking在GUI Agents中的WebVoyageSom这一项测试中一骑绝尘这项测试中模型需要像人一样理解和操作网页界面来完成任务。GLM-4.1V-Thinking在这项得分高达69.0远超所有其他模型包括 GPT-4o (35.0)。这表明它在理解人类意图并将其转化为具体界面操作的能力上取得了重大进展。后续我感觉完全可以用GLM-4.1V-Thinking来搭建一个本地自动化操作浏览器的Agent。另外在VideoMME、MMVU、MVBench等多项视频理解评测中GLM-4.1V-Thinking同样全面领先。视频理解比静态图片更复杂要求模型具备时序理解能力特别是这个模型参数才9B我感觉以后可以在本地进行实时的视觉理解了。实测效果目前GLM-4.1V-Thinking可以在智谱开放平台在线体验https://www.bigmodel.cn/trialcenter/modeltrial/text?modelCodeglm-4.1v-thinking-flash首先给我的第一感觉就是爽因为非常快这样使用推理模型的感觉太爽了不用等它吭哧吭哧推理半天才有结果而且上面给的Fastgpt操作路径也完全没毛病我感觉后面可以让AI在本地自动帮我搭建知识库上传资料啥的了。然后我找出了一张周末打车遇到的一个外国车牌这个车这个车牌一看就相当nb当时滴滴司机为了想追上去看看差点跑错路…我把这张图丢给了GLM-4.1V-Thinking让它分析一下这个车来自什么国家车主人是什么身份。我感觉它除了车牌的含金量分析不太到位以外其他的完全没毛病哎这个车牌居然是泰国的我第一次见。也合理泰国离云南近整个分析也挺详细不错不错。随后我又找了一个真实的体检报告单丢给GLM-4.1V-Thinking进行识别和解读这张图清晰度也一般但下图识别的结果非常准确实际体验比GPT4o识别的还要更准。还给出了一些中肯的营养摄入建议作为一个只有9B参数量的小模型能做到这个程度可以说非常nb了。下面这张图是我上上周从北京飞回昆明时经过一个非常让我震感的地貌所拍摄的照片。前面还一直是平原到这里群山突然拔地而起而且是一条直线这种突然变换的地貌景观简直是一场视觉盛宴我当时就非常好奇这到底是哪儿啊。要是当时我电脑上有本地部署的GLM-4.1V-Thinking就好了下面是GLM-4.1V-Thinking给出的答案我觉得应该是对的因为前面一直都在一个黄沙遍地的平原上空飞行估计是黄土高原有知道的朋友麻烦评论区告知一下如果它推测正确的话就太强了大概率是对的我准备本地安装一个以后坐飞机带上哈哈哈接下来难度升级我把前几天爆火的谷歌gemini cli演示视频丢给它关键是这个视频完全没有声音而GLM-4.1V-Thinking作为一个9B模型能分析、总结的这么详细我还挺意外的。我还记得在今年2、3月份使用这种10B的小模型那时候体验真就是一tuo…但是现在最新发布的一些小参数模型总是能给我带来一些惊喜这导致我产生了一些好奇它为什么能以小博大只有9B参数量的模型视觉能力凭什么可以做到这么强技术解读带着这点疑问我花了不少时间翻看了它的技术报告和开源资料论文地址https://arxiv.org/abs/2507.01006最终发现这背后是智谱在模型架构和训练流程上的双重突破模型的底层架构其实决定了它的能力上限。GLM-4.1V-Thinking的架构基于视觉编码器ViT Encoder、**多层感知机适配器MLP Projector以及语言解码器Language Decoder**这三大核心部件。并做了一些巧妙的优化。/ 1. 强视频理解能力传统的视觉模型处理视频很多时候就像在快速翻阅一张张静态截图。而GLM-4.1V在视觉编码器中用3D卷积替换了传统的2D卷积。**这带来了质变**模型不再是孤立地看每一帧而是能捕捉帧与帧之间的时间动态实现了2倍的时间压缩极大提升了效率。为了让模型精准理解时间它还为每一帧画面都插入了时间戳标记。这让模型真正拥有了连贯的、带有时间概念的视频理解能力看懂长达2小时的视频成为可能。/ 2. 支持任意长宽比和4k的图像分辨率你应该遇到过想让AI分析一张超长的网页截图或4K高清大图结果它却处理不了或效果很差。GLM-4.1V通过两项技术解决了这个问题2D-RoPE位置编码能稳定处理超过200:1这种极端宽高比的图片 。动态位置嵌入插值无论输入图片被切割成多少块它都能通过双三次插值算法动态、平滑地为每个图像块分配合适的位置信息保留了原始ViT预训练的强大能力。/ 3. 更强的多模态空间理解不仅视觉能力强大智谱还将这种空间理解能力扩展到了语言端将语言解码器中的位置编码RoPE升级为3D-RoPE。这极大地增强了模型在处理图文混排这种复杂多模态内容时的空间感知能力同时完美保留了其纯文本处理的性能。/ 4. 训练阶段GLM-4.1V-Thinking 的训练过程分为三个阶段预训练Pretraining、监督微调SFT和强化学习RL。特别是在强化学习阶段采用了课程采样强化学习RLCS当中结合了两种方法基于可验证奖励的强化学习RLVR和基于人类反馈的强化学习RLHF并覆盖多个关键任务维度。就像是请了一个智能私教来进行考前辅导。私教不会胡乱塞题而是先从简单的题让你入手等你掌握了再逐渐增加难度针对性地让你刷更难的题。这种循序渐进的刷题方式效率最高能让模型在准确性和稳定性上获得最大提升「最后」测试完GLM-4.1V-Thinking我最大的感受是震撼且务实。震撼在于它只有9B的参数量却有超强的视觉能力核心是用更聪明的算法弥补算力的不足。务实在于它所强化的能力如视频理解、GUI Agent、图片理解等都是直指真实世界复杂应用的。这项能力让大模型不再是玩具而是真正能深入到各行各业解决具体问题的生产力工具。更大气的是智谱又又又选择了全面开源。这意味着从今天起任何一个开发者、AI爱好者或企业都可以免费本地部署这个强大的模型而且只需要少量算力成本。也可以在它的基础上进行二次开发、微调打造出属于自己的、适配特定业务的垂类应用最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】