AGI起源揭秘:从1970年预言到大模型,我们离通用人工智能还有多远?
前阵子跟产品团队过需求小伙伴又抛出一个灵魂拷问“我们现在做的这个多模态Agent是不是就算AGI了”这个问题我在不同场合听到过好多次从刚入行的小朋友到带过多年项目的技术负责人都会问。回答之前我建议先把一个更基础的问题聊明白AGI这个词到底怎么来的二十年前它甚至还不是一个正式缩写为什么这两年突然火成这样以及它和大模型、多模态之间到底是什么关系。这篇文章就顺着“AGI术语的起源”这条线把来龙去脉、概念边界和落地时的判断方法一次讲清楚。适合所有被AGI这个词困扰过、又想搞清楚“我现在做的到底算不算AGI”的人。1. 翻老账藏在旧纸堆里的“通用智能”前身1.1 1970年那场预言的起点先声明很多科普文会把AGI的起源直接挂到图灵或达特茅斯头上这个说法不算错但不准确。真正让“通用智能”这个概念以接近今天形态进入公共视野的公认时间点要推到1970年。那年麻省理工学院的Marvin Minsky接受了《Life》杂志采访原话大意是在三到八年的时间内人类将会拥有一台具备普通人类智力水准的机器。这篇报道叫The intelligent machines在当年也算轰动了。更关键的是Minsky用的词是“a machine with the general intelligence of an average human being”——这是学界公认的、早期最接近今天AGI含义的公开表述之一。追溯更早认知心理学早在1904年就由Charles Spearman提出过“g因子”理论也就是人类存在一种跨领域的通用智力。AI先驱们把这个心理学概念借过来用本意很朴素如果机器像人一样拥有通用思维它就能跨领域处理问题而不是只会下棋、证明定理或识别图片。问题在于这个“野心”诞生得很早落地却姗姗来迟。Minsky预言后的八年间第一轮人工智能热潮就撞上了谷底整个AGI的概念跟预言一起被封进了故纸堆。这段历史是理解AGI术语的关键伏笔。1.2 为什么“通用智能”这个说法后来消声了这里有个很多人不知道的细节从1970年代中期到1990年代你几乎找不到任何主流学术期刊把“通用智能”当作系统研究目标来写标题。不是没人做而是这个词本身变成了一种“禁忌”。原因不复杂。1974年Minsky和Papert在《Perceptrons》里用严格的数学论证揭示了单层感知机的能力边界让当时热火朝天的神经网络研究当场熄火。同期Newell和Simon等人搞出的通用问题求解器General Problem SolverGPS理论上叫“通用”实际只能在“汉诺塔”“过河问题”这种小型谜题里耍得开一碰到真实的报纸、菜谱、驾驶场景就彻底抓瞎。冥冥之中所有人都意识到“通用”两个字太大大到每当前沿遭遇滑铁卢这个词就成了那个替罪羊。再加上英国Lighthill报告在1973年对AI大加讨伐政府资助大面积缩水。那个年代想拿“通用智能”这个题目去申请基金基本等于自杀。于是大家非常默契地改口做符号推理的只管叫“知识系统”做语音识别的就叫“模式识别”做机器人的就叫“工业自动化”。术语被拆分、贴上小标签通用的大目标被私下收藏了起来。2. AI照进现实专业系统盛行时期的“被搁置”2.1 专家系统为什么挤掉了AGI的叙事1980年代是专家系统Expert System的黄金十年。像DEC公司用的XCON系统能把几千种计算机配件按规则自动组合成可发货的配置单医疗领域也出现了MYCIN能根据症状规则开出抗生素建议。在当时这些系统确实在窄领域创造了真金白银而且看起来“很智能”。但从AGI的历史视角看专家系统的盛行其实是一种倒退。它把所有智能都建模成“if-then规则集”本质上依赖人类工程师把知识一句句“喂”进去。你给它换一个科室、换一个行业这套规则立刻作废。这跟今天的大模型形成了非常鲜明的对比专家系统是**“显式规则窄覆盖”大模型是“隐式统计宽覆盖”**。也正因为如此当年研究社区对“通用智能”的排斥不只是环境压力还有范式间的离心力。做规则的人靠的是逻辑完备性做感知的人靠的是特征工程两边谁也不觉得自己在“研究同一个智能问题”。2.2 第二次寒冬与“AI”一词被污名化进入1987年基于专家系统和专用硬件比如Lisp机的商业市场开始崩盘原因是通用PC的性价比快速反超专用AI设备。你花几十万美元买的Lisp机性能很快被几百块的新款芯片反杀。到1993年第二次AI寒冬正式结束大量AI公司倒闭部分研究者为了保住饭碗甚至在自我介绍里把“AI”三个字母隐去改称“信息科学”“统计学习”。这一段的讽刺点在于“Artificial Intelligence”这个总概念尚且如此更别提“Artificial General Intelligence”这个词还根本不存在。在那个阶段谁要是提“通用人工智能”大概率会被当成不计后果的乐天派。这个态度一直持续到颓势见底的1990年代末几乎每一位后来推动AGI概念复兴的人都在这场寒冬里“熬”过。3. 2002年重命名时刻Ben Goertzel与AGI的“再出发”3.1 一本书如何给赛道重新命名AGI这个首字母缩写能够得到今天的认可绕不开一个人Ben Goertzel。2002年他和Cassio Pennachin合作编辑了《Artificial General Intelligence》一书书名第一次把这个术语体系化地摆上桌面。书里不仅追溯了早期通用智能的理念还系统提出过去三十年大家做“窄AI”未来应该要“扩大智能系统的范围而不是继续在狭窄任务里死磕”。为什么说这是AGI术语的关键节点因为在此之前学界、工业界只有“AI”这个笼统概念没有单独讨论“通用性”的统一入口。2002年之后“AGI”的检索量、论文量慢慢爬升2006年第一届AGI会议AGI Conference组织起来2008年由Goertzel等创办了AGI期刊AGI才正式从一个说法变成一门学科。3.2 GOFAI、连接主义与AGI的正确关系谱讲AGI起源时有一个经常被踩的混淆点把符号主义的老旧AIGOFAI直接等同于AGI。GOFAI是John Haugeland在上世纪80年代给符号主义起的绰号全称是Good Old-Fashioned AI。它确实追求过“通用推理”但它依赖人工规则和符号操作不具备学习和自适应能力。严格说GOFAI是AGI历史中的一支“先驱设想”而不是AGI的完整形态。AGI的现代定义更接近即便没有事先见过某一类任务也能通过已有经验、推理和工具调用完成多步骤、跨领域目标的能力。这要求系统同时具备感知、推理、规划、学习、记忆和动作执行能力。所以用一句容易理解的话说AGI想造的不是一把什么都会干的“瑞士军刀”而是一个“能自己学会用新工具的成年人”。4. “大模型不是AGI吗”这个问题的坑在哪里4.1 LLM的长板是规模效应不是通用能力2023年左右大语言模型LLM横空出世ChatGPT类产品让世人第一次觉得“机器真的懂我”。微软研究院甚至发表了Sparks of AGI这篇论文抛出GPT-4展现出“AGI雏形”的论点。市场马上开始高呼“大模型就是AGI”很多非技术人员甚至把“AGI”直接等同于“GPT-5以后的产品”。但这里藏着概念陷阱。大模型的强项是在巨大语料上学习到人类文本的分布规律把它表达为“下一个单词的预测”。这种能力的本质是大规模泛化broad generalization。你可以让它写代码、做摘要、翻译、生成表格表现确实惊艳。可这种泛化依赖的是训练数据覆盖范围而不是真正的“理解”。换一种类比大模型像一个读万卷书、行万里路的“记忆大师”遇到以前见过或高度类似的问题时反应极快但一旦遇到训练语料中从未出现过的交互模式它就会退化成一本“概率极高的顺口溜大全”。AGI要求的能力是即便没见过也能通过试错摸索出方案——这是两者之间最大的分水岭。4.2 能力分层表为什么差一层就都不叫AGI为了帮团队做判断我常用下面这张“能力分层表”来评估一个系统到底处在什么水准。这张表同样适合你下次在讨论时直接引用能力层大模型现状AGI要求记忆容量强万亿参数级不需要这么高只需够用语言生成与理解强人工对话几乎以假乱真强但不必依赖文本入口跨任务泛化中高依赖训练数据的相似度高真正的举一反三因果推理弱到中混合统计相关与逻辑高能够基于因果反馈修正行为自主设定目标无需要用户给出明确指令有能自发拆解目标和子计划工具闭环操作中接API后可完成任务高主动寻找并操作陌生工具真实世界物理交互极低无身体或只有模拟环境高如果定位在物理世界AGI持续在线学习极低模型权重固定高边做边学经验终身累积一眼就看得出来大模型在许多单项上已经远超人类水平但“自主设定目标”“持续学习”“因果推理”仍然有大段空白。大模型是AGI拼图里的一个核心零件但离完整拼图还有好几块。这也是我建议的沟通话术不要问“是不是AGI”要问“它在哪些能力层达到AGI水准哪些还差”。4.3 用反事实测试检验“通用性”如果你实在想验证一套系统有没有AGI影子我推荐一个“反事实测试”思路。做法很简单找一个训练语料几乎不可能覆盖的场景。比如拿一套中文医疗问答模型突然让它去理解“一个没有监管的15人荒岛小组如何制定打渔、做饭、值夜班的最优排班表”看它是否需要实时推理、是否会用工具、是否能在反馈中逐步修正自己给出的建议。绝大多数大模型会一本正经地给出笼统建议但不会想起来“先确认岛上有多少资源”“是否有人会游泳”“有没有潮汐表”。这类任务不需要多高的专业门槛但每一次跨语境联动、每一个现实反例都是AGI检验的试金石。真正的AGI系统应当能在这种测试中把“世界常识”和“当前上下文”结合成行动计划而不是只会做文字游戏。5. “多模态AGI”是真突破还是营销拼盘5.1 多模态能解决什么感知通道的上限随着GPT-4V、Gemini等模型陆续支持图像、音频、视频输入自媒体已经开始把“多模态AGI”列为下一步热点。我理解这个情绪但还是要泼一盆冷水多模态解决的是感知通道问题而不是认知决策问题。人类之所以智识超群不只是因为拥有视觉、听觉、触觉更因为这些通道背后的整合与推理是连通的。你会看到一张荔枝的图片知道它是红色外壳听到“荔枝”一词能回忆起果肉质感甚至想象“冰镇荔枝”会带来一种清凉的愉悦。而大模型接入图像后更多是多了几个“嵌入向量”的入口道路把视觉特征映射到词向量对齐的空间再交给同一个Transformer解码。它的确能看图说话却未必能建立“看、听、尝、摸”之间完整的物理常识链条。5.2 理解与执行之间的鸿沟另一个很现实的问题多模态大模型经常在“看图找猫”上表现不错但在“看图并动手换轮胎”上完全溃败。原因在于多模态输入只是“感知”真正的AGI需要“感知-决策-行动”闭环。为了让模型能执行研究者不得不外挂各种框架比如给模型接搜索引擎、接代码解释器、接机器人指令集。当系统被“外部增强”得很强大时很多人误以为AGI到来了。但AGI一个核心特性是“内在统一性”它应当在一个认知系统内部完成从感知到行动的综合调度而不是靠若干插件像搭积木一样拼出一个“看起来像”智能的东西。这在工程上很微妙API调度再丝滑也只是工程缝合不是认知涌现。我遇到过不少团队把“多模态Agent”包装成“AGI”其实拆开看就是一个OCR识别组件 一个语音转写组件 一个大模型 一堆if-else路由。产品能力确实提升了但“AGI”这个标签只会透支用户对“自主性”的期待后续一翻车反噬更重。5.3 多模态模型的常识池与推理短板从实验数据来看多模态训练确实让模型获得更多“世界常识”。比如输入一张冰箱内部图片它能判断“缺牛奶”和“有西红柿”这对机器人规划很有用。但常识池扩大不意味着推理能力变强它可能只是“死记硬背”了更多图像-文字对。ARC-AGI这类强调抽象推理的基准即便换成多模态版本模型分数依旧远低于人类基线。这说明感知带宽上去了决策鲁棒性仍然停留在“记忆检索”层面。如果只看着多模态这个词就给AGI进度打高分那多半是被宣传带偏了。6. 用基准量一量AGI的尺子从图灵测试到ARC6.1 图灵测试的软肋欺骗不等于理解1950年图灵提出“模仿游戏”来检验机器智能如果一台机器能在对话中让一定比例的人误以为它是人类就算通过测试。在今天这个LLM时代图灵测试早就不再是AGI的门槛大多数高质量聊天机器人几轮对话下来就能骗过不少人。但图灵测试的软肋在于它测的是“模仿”而非“存在”。文本对话天然优势在欺骗——你可以输出一句无懈可击的“抱歉我暂时无法处理该请求”来掩盖无知而不必真正“经历”问题。因此很多研究者开始抛弃图灵测试转向更结构化的能力评估。6.2 用抽象推理测试绕开“背诵题库”2019年François Chollet提出了ARC-AGI基准。它用一系列网格图形变换任务考察系统能否从少量样例中抽象出变换规则。设计核心目的是避开大数据训练中普遍存在的“数据泄露”因为题目多数是需要在线推断的你很难在预训练语料里背到相同答案。ARC-AGI难到什么程度普通人稍加练习就能看懂规则但当今最强的LLM加上各种推理增强框架分数依然远低于人类基线。原因很简单大模型被训练成“从分布中采样”而ARC-AGI的每道题都是陌生的、分布外的“小规则提取任务”。这正是“算得极快但不真懂”的放大镜。此外还有GAIA这类基准专门提出“对普通人容易、对大模型极难”的现实问题比如结合日历、邮件、地图、代码多步骤规划。它们的目标都一样创造出难以被记忆广覆盖的测试面逼迫模型展现出真正的推理与工具使用能力。6.3 时间表与现实为什么“AGI几几年到来”都是玄学经常会有人问“AGI大概什么时候到来”甚至搬出各种专家的预测年份曲线。我的回答是这取决于你用哪套定义。如果定义是“多步骤对话工具调用代码生成”那两三年内出现高度成熟的AGI助理完全可能如果定义是“能够自主设定长期目标并在真实物理世界稳定运作的类人智能”那可能还需要非常久。定义不同评测集就不同结论自然南辕北辙。作为从业者与其争论“哪一年”不如把自己手头的任务指标和AGI能力层挂钩一块一块地清楚自己团队在哪个层级有真实突破口。7. 落地说话在产品和研发里该怎么正确使用“AGI”这个词7.1 区分“营销叙事”与“工程语言”站在应用开发者和产品经理的角度我有一条很实际的建议对外可以使用AGI这个口号但内部建设和对外文档里请老老实实换成分层指标。比如公司官网可以写“我们想打造通用人工智能助手”这是愿景叙事没有问题。但研发周报里如果也写“本周优化AGI智能”那基本等于什么都没说反而会让算法、产品、测试三个团队各自对“AGI”产生不同预期。正确的写法应该是“优化了跨域任务识别率”“提升了多模态对齐后的指令完成率”“固定了长尾case的反馈闭环”。7.2 一套可直接实操的能力评估框架在我们团队内部我们建立了一个“AGI能力地图”式的检查表每次讨论都能把概念争论变成可对照的细项。建议你直接复制套用任务广度系统能覆盖多少领域边界在哪换一个领域是否要从零训练目标拆解能力用户只给一个大目标“帮我规划周末旅行”系统能否自己拆分酒店、交通、天气、行程校验等子任务错误恢复系统在遇到工具报错、信息缺失、步骤中断时能否自己修正路径持续学习系统是否能从一次交互后的反馈中永久改进还是每次都要重训内外部一致性系统在不同入口文字、语音、视觉处理同一个问题时是否共用一套连贯的知识表征价值对齐与极限防护当目标与安全约束冲突时系统是否能主动拒绝并解释这套框架的好处是不把“AGI”当成一个虚词而是把它拆解成六张检查单。任何一个团队在推进产品时都能清晰地说出“我们做到了第3项第4项仍待验证”。7.3 给团队和个人的避坑清单最后按老规矩放几条踩过坑后的心得不要为了面试/融资讲故事而硬贴AGI标签。投资人里多的是见过大场面的人几次demo就会露馅透支信用的成本远超收益。在对外文案里避免把大模型与AGI划等号。一旦用户带着“全知全能”预期来使用你的产品任何一个常识错误都会被放大成“伪AGI”的嘲讽。把“AGI能力分层”作为一种通用沟通工具。无论跟算法、产品还是客户交流用能力层而不是术语标签能极大降低误解几率。多关注失败case而不是benchmark分数。厂商最喜欢挑一些又新又好的Benchmark来宣传但真正暴露系统短板的往往是长尾case停电后的任务恢复、表情符号造成的指令歧义、多轮对话里的否定指代。AGI与否不在分数清单里而在这些边缘场景中。老实说每次做项目复盘我都会回看一遍AGI术语的起源提醒自己别被流行词带节奏。Minsky在1970年立下的flag至今还在寻路但那一代先驱对“通用智能”的向往是真实的。今天大模型的出现让这个目标肉眼可见地接近了一大部分但“接近”不等于“实现”。与其天天争论“是不是AGI”不如把手头任务一个个拆开用能力地图把边界看清楚。先把该扫的障碍扫掉等那台机器真的拥有自己的“目标感”时我们再用“AGI”这个词也不算迟。