谁定义“AGI”,谁就定义未来
创始人
2026-09-08 15:31:00
0

2026年9月3日(美东时间),OpenAI发布了新一代旗舰模型GPT-6 Astra。联合创始人兼总裁Greg Brockman随即高调宣布:“欢迎来到AGI时代。”几天后(9月6日),英伟达CEO黄仁勋也在社交平台发文,称“AGI已经到来”。而就在发布两天前,OpenAI首席执行官Sam Altman还公开表示,AGI充其量只是“一个定义非常糟糕的术语”,“就像一个无关紧要的营销术语”。总裁与CEO在同一个问题上公开口径不一,这场面在硅谷并不多见。而比内部口径不一更耐人寻味的,是OpenAI宣称AGI已经到来的依据——他们在ARC-AGI-3基准测试中拿下了99.9%的分数。问题在于,当ARC Prize Foundation用统一的“标准测试环境”重新评估时,同一个模型的得分从99.9%骤降至62.7%。同一个模型,同一套题,差出37个百分点。评测机构的态度也很干脆:即便Astra在ARC-AGI-3上拿了近满分,他们也不认为这足以证明AGI已经实现。

这场争论揭示了一个比技术本身更深层的问题:我们到底用什么标准来判断AGI是否到来?

没有统一标准的“终点线”

AGI没有普遍认可的技术基准。这听起来有些荒谬——全世界最顶尖的实验室投入数百亿美元追逐一个目标,却没有人能说清楚到达终点时应该用什么来判定。图灵测试长期被大众视为衡量机器智能的标杆,但它本质上是一个1950年的思想实验,从未被设计为实用的评估标准。学术圈虽然有一个广为引用的定义——能够“理解、学习并执行任何人类所能完成的智力任务”的系统——但这个定义本身也有巨大的解释空间。

OpenAI自己的章程里写着一个定义:“在大多数具有经济价值的工作上超越人类的高度自主系统”。这个定义听起来很清晰,但细想之下全是模糊地带:什么叫“大多数”?哪些工作算“经济价值高”?“超越”的标准又是什么?OpenAI宣称已接近计算领域影响最深远的里程碑,但标尺却是自定的。

定义权的争夺从来不只是学术问题。2025年,微软与OpenAI重新调整了合作协议,规定OpenAI宣布实现AGI后需要经过独立专家小组验证。而到了2026年4月,双方再次修改协议,取消了此前与AGI挂钩的重要合同安排。AGI这个术语,既是合同触发条件,也是估值杠杆,还是营销说辞。谁掌握了AGI的定义权,谁就掌握了资本的定价权。

给AGI一把“尺子”

学术界并没有坐视这种混乱。2025年10月,图灵奖得主Yoshua Bengio联合全球多家研究机构发表论文《A Definition of AGI》,提出了一套可量化的AGI定义与测试框架。他们给出的标准是:AGI是“能够匹配或超越受过良好教育成年人的认知多功能性和熟练度的人工智能”。研究团队参照心理学领域实证检验最充分的卡特尔-霍恩-卡罗尔(CHC)理论,将通用智能拆解为10个可测量的认知领域,涵盖常识知识、阅读与写作、数学、即时推理、工作记忆、长期记忆的存储与检索、视觉与听觉处理、处理速度等。评估采用百分制,各领域权重相等(各占10%),总分100分对应论文定义中的AGI水平。按照这套标准,2023年的GPT-4总分只有27分,2025年的GPT-5提升到了57分——进步很快,但距离100分还有相当距离。

谷歌DeepMind在2026年3月也拿出了自己的方案。他们发表论文《Measuring Progress Toward AGI: A Cognitive Framework》,同样将AGI评估细化为10个关键认知领域,并配套一套三阶段评估协议。DeepMind还联合Kaggle拿出20万美元奖金,向全球研究者悬赏:谁能设计出真正有效的AGI测试?

吴恩达则在2026年1月提出了一个更贴近现实世界的思路:Turing-AGI测试。这个测试要求AI或专业人类在多天内通过计算机和互联网工具完成真实的专业工作任务,由裁判设计任务并全程评判。吴恩达认为,现有的AI基准测试过于狭窄、容易被针对性优化,而Turing-AGI测试更注重AI在实际经济工作中的表现,也更符合社会对AGI的普遍认知——能像人一样完成大多数知识型工作。

这些努力的方向是一致的:把AGI从模糊的哲学概念变成可测量、可验证的技术指标。

“定义之战”才刚刚开始

回到OpenAI的AGI宣言。Astra在ARC-AGI-3上99.9%的成绩并非毫无意义——ARC Prize Foundation表示,Astra在96%的测试关卡中操作效率已经达到甚至超过人类基准。但ARC Prize也提醒,ARC-AGI-3的谜题都经过防记忆化设计,考察的是模型在全新任务面前的探索与试错能力;在谜题上拿到高分,并不能证明AI在面对“没有标准答案的现实问题”时能够独立思考、自主创造。换句话说,会解谜题,不等于能在真实世界里解决未知问题。

更深层的问题在于,OpenAI的Astra引入了“循环深度”(recurrent depth)架构,将部分推理过程转入模型的隐藏状态。这意味着外界不仅看不到模型的推理链条,连它如何得出答案都无从核查。一个无法被透明验证的智能系统,如何被独立地判定是否达到了AGI?这不仅是技术问题,也是信任问题。

2026年秋天,通用人工智能竞赛的重心已经从模型能力悄然转向了定义权。当技术差距被压缩到以月计算,估值与叙事的分量反而在上升。谁能率先把“AGI”这个术语变成自己的资产,谁就掌握资本与市场的定价权。据多家媒体报道,OpenAI的IPO目标估值接近1万亿美元,而它最近一轮私募估值(8520亿美元)仍低于竞争对手Anthropic的9650亿美元。在这个节骨眼上宣布“AGI时代来了”,其商业动机不言自明。

或许,AGI从来就不存在一个客观的、等待被发现的“标准答案”。它更像一条不断移动的终点线——每当你觉得快要到达时,定义本身又被重新校准了。正如Altman自己所说,AGI在很大程度上是一个“营销术语”。但这并不意味着AGI没有意义。恰恰相反,围绕AGI标准的争论本身就是推动行业前进的动力。Bengio的量化框架、DeepMind的认知评估、吴恩达的Turing-AGI测试——这些努力正在把AGI从一个模糊的愿景变成可测量、可验证的技术里程碑。

谁定义AGI,谁就定义了下一个时代的游戏规则。而这场关于定义权的战争,才刚刚开始。

相关内容

热门资讯

深空矩阵完成亿元级新一轮融资,... 9月8日,北京深空矩阵科技有限公司宣布完成亿元级天使轮融资。本轮融资由鼎晖VGC、麟阁创投联合领投,...
检察机关依法办理一批涉黑涉恶案... 9月8日,自7月深化扫黑除恶专项斗争开展以来,全国检察机关依法办理一批重大黑恶案件,共受理审查逮捕涉...
存储芯片概念延续反弹,盈新发展... 9月8日,存储芯片概念延续昨日反弹势头,盈新发展直线涨停,强一股份、香农芯创、普冉股份、太极实业、雅...
沪深两市成交额突破1万亿,较上... 9月8日,数据显示,沪深两市成交额突破1万亿,较上一日此时放量超60亿,预计全天成交金额约1.95万...
昭衍新药:国内非人灵长类实验动... 9月8日,昭衍新药在今日举行的2026年半年度业绩说明会上表示,从需求端来看,2026年国内创新药融...
向新之翼 | 科创中国行·合肥... “墨子”号十周年!让光变身密码,让通信“绝对安全”,我国量子技术正奔跑在世界前沿。8月底,文汇报记者...
白露过后寒意渐增 如何科学穿衣... 今天我们迎来白露节气,这个时节,昼夜温差开始明显拉大。气温起伏之下,身体哪些部位最怕受凉?怎样穿衣兼...
第五届数贸会将打造集“展、会、... 9月7日电 9月7日下午3时,国务院新闻办公室举行新闻发布会,介绍第五届全球数字贸易博览会有关情况。...
人工智能如何赋能跨学科教学 辽宁省大连市中山区望海小学学生在大连市药品检测院研学中体验海洋生物涂色。 山东省实验中学人工智能基...
AI应用端反复活跃,当虹科技2... 9月8日,AI应用端反复活跃,当虹科技20cm涨停,佳创视讯、丝路视觉、万兴科技、视觉中国、凡拓数创...