引言当前主流具身智能研究存在一个根本性的方向误区试图给机器装上一个“完美的摄像头”再配一个“全知的模型”仿佛只要算力够强、数据够多机器就能看懂世界。但这条路忽略了一个最根本的事实——人眼的伟大不在于它能看清一切而在于它知道该忽略什么。人眼从来不是一部被动的摄像机。它是由眼睛和大脑共同组成的主动建模系统。摄像机忠实记录每一帧把信息一视同仁地写入存储而人眼只在中央凹那一小块区域保持高分辨率边缘视觉全是模糊的快速扫视时还会主动抑制视觉信号输入并在视线落定之前就预加载目标区域的预期信息。换句话说人眼不是“拍摄”世界而是在与大脑进行一场持续的“谈判”用有限的带宽、有限的注意力结合预装的世界模型实时建构出一个稳定且有意义的视觉体验。这正是主动感知的核心命题。具身智能若想真正走进物理世界就不该执着于“看得更全”而应该学会“看得更聪明”。一、眼脑协同的神经机制与计算模型1.1 中央凹视觉与非均匀采样策略生物视觉系统采用的中央凹视觉foveated vision策略是效率设计的精髓。视网膜中心区域具有高密度的感光细胞周边区域分辨率逐渐降低。这种非均匀采样大幅减少了需要处理的数据量同时保持了对关键区域的精细感知。这个设计有多极端黄斑区仅占视网膜面积的 0.01%却汇聚了约 70% 的感光细胞中央凹的极限分辨力相当于 600 dpi而周边视野只有约 15 dpi。如果把手指伸到眼角我们甚至只能感知到一个模糊轮廓。用每度像素数PPD来衡量时这种差异更加直观——传统上认为人眼分辨率约为 60 PPD但最新实验发现黑白图像的平均分辨率可达 94 PPD红绿相间图案降到 89 PPD而黄紫相间图案的极限更骤降至 53 PPD。这说明大脑其实并不擅长处理色彩细节眼睛更像一个普通传感器真正负责“后期渲染”的是大脑。在机器人实现中注视点控制通常通过云台相机、机械臂末端执行器或移动平台的运动来实现。Gaskett 等人开发的闭环注视控制系统使用 10 个自由度4 个眼部自由度、3 个头部自由度、3 个躯干自由度协同工作将目标维持在视野中心。它采用级联 PD 控制器网络基于视觉坐标与关节角度之间的简化映射关系而非完整的运动学模型。这种设计让系统对机械磨损和维护活动具有很好的鲁棒性——再一次印证好的主动感知不追求完美模型而追求在变化中持续可用。1.2 眼动模型扫视、平滑追踪与注视眼动模式可分为平滑追踪、扫视和注视三种基本类型。平滑追踪用于跟踪移动目标保持目标在视网膜上的稳定成像扫视是快速的视线跳跃把注视点从一个兴趣区域转移到另一个注视则是相对静止的观察状态用于详细分析目标特征。在具身智能体中这些眼动模式需要与身体运动协调形成层次化的感知策略。值得注意的是即使在我们“凝视”某个物体时眼睛也并没有真正静止。每秒 34 次的微小抖动幅度小于 0.2 度才是视觉清晰的关键。没有这种微眼动视网膜感光细胞会因为持续刺激而疲劳图像会在约 0.1 秒内褪色成灰影——这就是 20 世纪 50 年代被证实的 Troxler 效应。大脑需要不断用微眼动刷新图像否则我们看到的将是一片空白。这一点对机器人学的启发是主动视觉不是“把相机对准目标”就结束了而是要通过眼动、头动和身体移动持续获取信息。机器人学中的主动视觉系统通过控制相机位姿、调节光学参数或移动观察平台来实现类似功能。而这个“主动”二字恰恰是当前大多数 AI 视觉系统最缺乏的。1.3 信息论视角的主动感知信息论为主动感知提供了形式化的优化框架。在这个视角下感知动作的选择被建模为信息增益最大化问题智能体评估候选观察动作对降低状态估计不确定性的贡献然后选择最优感知策略。信息增益定义为当前状态不确定性与预期未来不确定性之差因此最大化信息增益等同于选择最能降低状态估计方差的观察动作。在主动定位任务中信息论方法已被证明优于基于几何启发式的策略。通过最大化 Fisher 信息或最小化熵机器人可以选择最优相机位姿来减少位姿估计的不确定性。这种方法特别适用于多机器人协作场景——团队成员需要协调各自的观察动作以最大化联合信息增益。它把“看哪里”从一个工程直觉问题变成了一个可以被形式化求解的优化问题。1.4 下一最佳视图规划下一最佳视图Next Best View, NBV规划是主动视觉在三维重建和物体识别中的具体应用。给定当前的部分观察NBV 算法需要确定下一个最优相机位姿以最大化重建质量或识别准确率。NBV 规划面临三个关键挑战候选视角的生成、信息增益的预测以及运动成本的权衡。在物体识别任务中McGreavy 等人提出的方法结合在线视角图和特征可见性分析在 82.5% 的情况下成功找到了能完成物体识别的视角并能在 85% 的试验中处理视觉遮挡。在抓取任务中Breyer 等人开发的闭环 NBV 规划框架与固定相机基线相比在保持相似成功率的同时将搜索时间缩短了约 40%。更有意思的是强化学习为主动视觉提供了端到端的学习框架。Shang 等人提出的 SUGARL 框架通过内在感知运动奖励解决感知策略与运动策略的协调问题。学习出的感知策略竟然展现出类似人类注视和追踪的主动视觉技能。这印证了一个道理与其硬编码“看哪里”的规则不如让机器在与环境的交互中自己学会“怎么看”。下面是主动感知闭环的整体示意当前观察状态估计不确定性评估候选观察动作信息增益预测执行最优观察动作二、注意力机制的计算范式2.1 自下而上与自上而下注意力注意力机制可分为自下而上刺激驱动和自上而下目标驱动两种类型。自下而上注意力由感知输入的显著性特征触发例如颜色对比、运动或纹理变化它自动、快速不依赖当前任务目标。自上而下注意力则由当前任务需求和内部目标引导主动搜索与任务相关的特征。传统观点将两者视为独立系统但最新研究提出了统一框架注意力选择源于单一系统在不同时间尺度上的表达可以识别出三个时间尺度的优先级——进化形成的生存需求、学习获得的价值偏置以及即时的任务需求。在具身智能体中注意力策略应当整合本能反应如对快速接近物体的警觉、学习到的关联如工具与任务目标的联系和当前意图如搜索特定物体。这种整合让智能体能够在动态环境中平衡反应性与目标导向行为。2.2 空间注意力与通道注意力空间注意力机制通过生成二维注意力图来强调图像中的关键区域使机器人能够聚焦于操纵目标、导航路标或交互对象忽略背景干扰。通道注意力则关注特征通道的重要性学习为不同通道分配权重增强与当前任务相关的特征通道。它在处理多模态感知时尤为重要能够自动选择最可靠的感知通道。空间注意力与通道注意力的结合形成了混合注意力机制典型的实现采用顺序或并行的方式应用两种注意力。以 CBAMConvolutional Block Attention Module为例它先通过通道注意力选择关键特征通道再应用空间注意力定位关键区域。这种混合策略在视觉导航、物体抓取和场景理解任务中均表现出优越性。2.3 自注意力与 Transformer自注意力机制通过计算特征之间的相互关系来捕获全局依赖。与卷积神经网络的局部感受野不同自注意力允许每个位置直接关注所有其他位置形成全局上下文感知。在具身智能中Transformer 被用于视觉导航、多智能体协作和视觉语言任务其优势在于能够建模长距离依赖例如房间之间的空间关系、时间序列中的动作依赖或多模态特征之间的对应关系。然而自注意力的计算复杂度与序列长度呈二次关系这对资源受限的具身系统构成挑战。近期的研究通过稀疏注意力、线性注意力或分层注意力来降低计算成本。在一个服务机器人导航项目中对相邻 patch 施加局部注意力约束——在计算 QKᵀ 时添加一个距离衰减系数——可以显著提升对连续墙面和走廊的识别稳定性。2.4 跨模态注意力跨模态注意力机制处理来自不同感知通道的信息融合。具身智能体通常配备多种传感器跨模态注意力让这些异构数据能够在共同的空间中交互。典型实现采用查询-键-值结构一个模态的特征作为查询另一个模态的特征作为键和值通过计算查询与键之间的相似度确定两个模态特征之间的对应关系再基于相似度加权融合值特征。在自动驾驶场景中跨模态注意力被用于融合相机图像和激光雷达点云。系统利用图像的高分辨率纹理信息增强点云的语义理解同时利用点云的精确深度信息补偿图像在远距离处的信息损失在远距离目标检测上显著优于单模态方法。三、多模态融合与脑体同构3.1 TVA从被动特征提取到主动决策核心系统传统机器人学的“感知-规划-控制”分块式架构从根本上违背了具身智能的脑体协同本质。AI 智能体视觉TVA的出现是对这一结构性鸿沟的彻底重构。TVA 不仅是视觉感知的升级更是贯穿感知、认知与动作的“主动决策核心系统”。TVA 的架构映射了具身认知理论。视觉输入不再被孤立地分类而是与语言指令、本体感受关节角度、力觉反馈共同输入到同一个 Transformer 网络中。视觉信息在 Self-Attention 机制下与其他模态深度交互其表征不再是静态的语义而是与当前任务和物理状态高度耦合的“具身状态”。TVA 不仅“看”到了物体更“懂”得如何与该物体交互。TVA 作为智能体具备主动感知能力。它不依赖固定的光照与视角而是能根据当前任务的不确定性预测误差主动驱动相机云台的角度、焦距甚至外部光源变化以获取关键信息。Transformer 的 Self-Attention 机制在其中扮演着“物理交互焦点转移”的角色——当机械臂接触物体的瞬间力觉 Token 的突变会瞬间提升相关视觉区域的权重使网络聚焦于接触点的微观形变。这种基于物理反馈的动态聚焦正是生物系统生存的核心机制。3.2 Thinker 模型的分层视觉编码上海人工智能实验室、香港中文大学和斯坦福大学联合发表的 Thinker 模型采用三级视觉处理架构像素级编码使用改进的 ConvNeXt 提取局部几何特征如物体边缘、纹理物体级编码通过可学习的 slot attention 机制动态分配视觉 token场景图编码实时构建以物体为节点、空间关系为边的图结构。这种分层处理让模型在抓取细小物体时能关注局部细节在导航时又能理解整体空间关系。其抓取成功率提升了 41%而计算开销仅增加 15%。Thinker 模型的核心突破在于语言理解和动作预测的共享表示空间。通过跨模态对齐损失视觉特征和语言嵌入在向量空间中保持几何一致性同时将动作空间分解为位移、旋转、抓取等子任务执行动作后通过残差连接调整后续预测。这种设计让模型在理解“把杯子移到桌子左侧”这类指令时能自动将“左侧”的语言描述转化为具体的移动方向和距离参数物体摆放位置精度达到 ±2cm。3.3 混合时序记忆陶大程的三层记忆结构陶大程在技术博客中提出的开悟世界模型引入了混合时序记忆Hybrid Temporal Memory机制这是针对长时具身任务的关键设计。他指出具身智能的长时任务关键从来不是“看过多少历史画面”而是持续维护好一个对控制充分的内部状态。它不需要完整保留每一刻的视觉像素细节只需要牢牢记住那些会影响后续动作选择、风险判断和任务推进的核心信息。这些控制相关的信息分布在截然不同的时间尺度上毫秒到秒级是接触、滑动、碰撞等瞬间交互的手眼协调控制秒到分钟级是子任务进度、物体位置、工具状态的中程维护分钟到小时级是全局任务计划、环境变化、用户偏好的长期统筹小时到天级是场景规律、失败历史、个体化经验的沉淀。单一扁平的记忆结构很难同时兼顾极致的响应速度、精准的状态跟踪和稳定的长期记忆。神经科学中的互补学习系统理论指出人类大脑通过多套功能各异的神经环路协同工作——新皮层沉淀通用语义与物理常识海马体编码具体情景事件小脑构建短时前向预测模型。这套多环路协同机制让大脑既能毫秒级响应环境变化又能稳定积累长期知识还能精准控制躯体动作。受此启发开悟世界模型将时间结构拆解为 SWA局部窗口注意力和 DSWA扩展窗口注意力等层次让不同时间尺度的控制信息各归其位、协同运转混合时序记忆SWA 局部窗口注意力DSWA 扩展窗口注意力短时前向预测毫秒~秒级情景记忆串联秒~分钟级长期统筹分钟~小时级经验沉淀小时~天级四、前沿趋势与挑战4.1 计算开销与轻量化Transformer 类注意力模型的计算量是当前最大的瓶颈。自注意力操作的时间复杂度随序列长度呈平方增长对实时性要求高的机器人应用构成挑战。在资源受限的嵌入式设备上部署注意力模型时已经探索出多种优化策略分组注意力将特征通道分组后分别计算注意力减少矩阵运算量空间下采样先在下采样后的特征图上计算注意力再上采样应用到原分辨率注意力共享对连续帧视频每隔 N 帧计算一次完整注意力中间帧通过运动估计推导注意力图。4.2 可解释性与注意力可视化注意力热图可视化是最直接的诊断工具。通过 Grad-CAM、Attention Rollout 等可视化方法开发者可以直观理解模型“在看哪里”。调试注意力模型时常见问题包括注意力过度集中在无关纹理、对遮挡物体的注意力衰减过快、多物体场景下的注意力分配不均。对应的解决方案包括在损失函数中添加注意力多样性约束对遮挡边界处的注意力进行特殊处理以及引入基于物体数量的注意力权重归一化。4.3 脉冲神经网络与生物可塑性注意力新兴的脉冲神经网络SNN为注意力机制带来了新思路。基于脉冲的注意力模型具有事件驱动的异步处理特性——仅对变化区域更新注意力更接近生物神经元的累积-发放机制并通过可塑性连接权重实现自适应注意力调整。在初步实验中这种模型在功耗敏感的应用场景如无人机视觉展现出优势处理动态场景的能效比传统方法高 3-5 倍。4.4 注意力机制的自我进化另一个有趣方向是让注意力机制能够自我进化。双时间尺度的学习框架——快速学习在单个任务中调整注意力参数慢速学习通过元学习优化注意力架构本身——使系统能逐步发展出适合特定场景的注意力模式。例如在长期部署的清洁机器人中系统逐渐学会了优先关注地板上的典型污渍类型而减少对固定家具的关注。这才是真正意义上的“越用越会用”。五、结语回到开篇的那句话真正的视觉不是“记录”而是“理解”不是“拍摄”而是“对话”。当前具身智能领域不少做 AI 视觉的工作以为给机器装个摄像头、跑个目标检测算法就算“看懂”了。但他们没有意识到人眼的伟大不在于它能看清一切而在于它知道该忽略什么。注意力机制本质上是动态权重分配系统它让机器人能够像人类一样“有的放矢”地处理信息。未来的具身智能不应该执着于打造一个全知全能的摄像头和世界模型。它应该学习的是人眼那种主动建模、动态聚焦、按需采样、随时丢弃的活系统。真正的效率不是来自无限的算力堆砌而是来自知道该把算力用在什么地方。人眼分辨率是有下限的它不会像摄像机那样均匀地记录画面中的每一个像素。当你看向一张照片时眼睛只捕捉其中最重要的几个点——人脸的表情、文字的轮廓、明暗的交界。至于那些平滑的渐变区域、均匀的色块、重复的纹理眼睛并没有“看清”它们而是大脑主动把它们补充了上去。那些细微的锯齿、传感器带来的噪点、边缘的模糊视觉系统会自动将它们无视。视网膜上还有一个没有感光细胞的盲点但我们从来不会感觉视野里破了一个洞因为大脑会自动用周围信息把它填上黄昏时分一张白纸在橙色灯光下物理上反射的是橙色光但大脑仍然把它“解释”为白色因为大脑知道这张纸是白的。你不是“看到”了一张完整的照片你是建构出了一张完整的照片。所以真正的效率不是把所有的信息都处理掉而是只处理那些最重要的信息然后把剩下的交给大脑去补完。参考文献具身智能原理、算法与系统第9章 主动感知与注意力CSDN 博客2026/02/21具身智能模型评测从感知到执行中国图象图形学报陶大程技术博客首发从像素复刻到行动控制具身世界模型的底层逻辑探索甲子光年2026/07/02TVA 与具身智能融合的内在必然性CSDN 博客2026/07/05具身智能中的注意力机制原理与应用2026/06/29融合认知科学与机器人学的具身智能计算范式探析2026/05/04Thinker 模型具身智能的视觉-语言联合建模突破2026/07/28具身智能中的视觉注意力机制原理与实践CSDN 博客2026/07/04具身智能的“火眼金睛”注意力机制全解析CSDN 博客2026/03/11