首页 - 科技 - 科技要闻 - 正文

谁定义“AGI”,谁就定义未来

来源:证券之星财经 2026-09-08 14:14:12

2026年9月3日(美东时间),OpenAI发布了新一代旗舰模型GPT-6 Astra。联合创始人兼总裁Greg Brockman随即高调宣布:“欢迎来到AGI时代。”几天后(9月6日),英伟达CEO黄仁勋也在社交平台发文,称“AGI已经到来”。而就在发布两天前,OpenAI首席执行官Sam Altman还公开表示,AGI充其量只是“一个定义非常糟糕的术语”,“就像一个无关紧要的营销术语”。总裁与CEO在同一个问题上公开口径不一,这场面在硅谷并不多见。而比内部口径不一更耐人寻味的,是OpenAI宣称AGI已经到来的依据——他们在ARC-AGI-3基准测试中拿下了99.9%的分数。问题在于,当ARC Prize Foundation用统一的“标准测试环境”重新评估时,同一个模型的得分从99.9%骤降至62.7%。同一个模型,同一套题,差出37个百分点。评测机构的态度也很干脆:即便Astra在ARC-AGI-3上拿了近满分,他们也不认为这足以证明AGI已经实现。

这场争论揭示了一个比技术本身更深层的问题:我们到底用什么标准来判断AGI是否到来?

没有统一标准的“终点线”

AGI没有普遍认可的技术基准。这听起来有些荒谬——全世界最顶尖的实验室投入数百亿美元追逐一个目标,却没有人能说清楚到达终点时应该用什么来判定。图灵测试长期被大众视为衡量机器智能的标杆,但它本质上是一个1950年的思想实验,从未被设计为实用的评估标准。学术圈虽然有一个广为引用的定义——能够“理解、学习并执行任何人类所能完成的智力任务”的系统——但这个定义本身也有巨大的解释空间。

OpenAI自己的章程里写着一个定义:“在大多数具有经济价值的工作上超越人类的高度自主系统”。这个定义听起来很清晰,但细想之下全是模糊地带:什么叫“大多数”?哪些工作算“经济价值高”?“超越”的标准又是什么?OpenAI宣称已接近计算领域影响最深远的里程碑,但标尺却是自定的。

定义权的争夺从来不只是学术问题。2025年,微软与OpenAI重新调整了合作协议,规定OpenAI宣布实现AGI后需要经过独立专家小组验证。而到了2026年4月,双方再次修改协议,取消了此前与AGI挂钩的重要合同安排。AGI这个术语,既是合同触发条件,也是估值杠杆,还是营销说辞。谁掌握了AGI的定义权,谁就掌握了资本的定价权。

给AGI一把“尺子”

学术界并没有坐视这种混乱。2025年10月,图灵奖得主Yoshua Bengio联合全球多家研究机构发表论文《A Definition of AGI》,提出了一套可量化的AGI定义与测试框架。他们给出的标准是:AGI是“能够匹配或超越受过良好教育成年人的认知多功能性和熟练度的人工智能”。研究团队参照心理学领域实证检验最充分的卡特尔-霍恩-卡罗尔(CHC)理论,将通用智能拆解为10个可测量的认知领域,涵盖常识知识、阅读与写作、数学、即时推理、工作记忆、长期记忆的存储与检索、视觉与听觉处理、处理速度等。评估采用百分制,各领域权重相等(各占10%),总分100分对应论文定义中的AGI水平。按照这套标准,2023年的GPT-4总分只有27分,2025年的GPT-5提升到了57分——进步很快,但距离100分还有相当距离。

谷歌DeepMind在2026年3月也拿出了自己的方案。他们发表论文《Measuring Progress Toward AGI: A Cognitive Framework》,同样将AGI评估细化为10个关键认知领域,并配套一套三阶段评估协议。DeepMind还联合Kaggle拿出20万美元奖金,向全球研究者悬赏:谁能设计出真正有效的AGI测试?

吴恩达则在2026年1月提出了一个更贴近现实世界的思路:Turing-AGI测试。这个测试要求AI或专业人类在多天内通过计算机和互联网工具完成真实的专业工作任务,由裁判设计任务并全程评判。吴恩达认为,现有的AI基准测试过于狭窄、容易被针对性优化,而Turing-AGI测试更注重AI在实际经济工作中的表现,也更符合社会对AGI的普遍认知——能像人一样完成大多数知识型工作。

这些努力的方向是一致的:把AGI从模糊的哲学概念变成可测量、可验证的技术指标。

“定义之战”才刚刚开始

回到OpenAI的AGI宣言。Astra在ARC-AGI-3上99.9%的成绩并非毫无意义——ARC Prize Foundation表示,Astra在96%的测试关卡中操作效率已经达到甚至超过人类基准。但ARC Prize也提醒,ARC-AGI-3的谜题都经过防记忆化设计,考察的是模型在全新任务面前的探索与试错能力;在谜题上拿到高分,并不能证明AI在面对“没有标准答案的现实问题”时能够独立思考、自主创造。换句话说,会解谜题,不等于能在真实世界里解决未知问题。

更深层的问题在于,OpenAI的Astra引入了“循环深度”(recurrent depth)架构,将部分推理过程转入模型的隐藏状态。这意味着外界不仅看不到模型的推理链条,连它如何得出答案都无从核查。一个无法被透明验证的智能系统,如何被独立地判定是否达到了AGI?这不仅是技术问题,也是信任问题。

2026年秋天,通用人工智能竞赛的重心已经从模型能力悄然转向了定义权。当技术差距被压缩到以月计算,估值与叙事的分量反而在上升。谁能率先把“AGI”这个术语变成自己的资产,谁就掌握资本与市场的定价权。据多家媒体报道,OpenAI的IPO目标估值接近1万亿美元,而它最近一轮私募估值(8520亿美元)仍低于竞争对手Anthropic的9650亿美元。在这个节骨眼上宣布“AGI时代来了”,其商业动机不言自明。

或许,AGI从来就不存在一个客观的、等待被发现的“标准答案”。它更像一条不断移动的终点线——每当你觉得快要到达时,定义本身又被重新校准了。正如Altman自己所说,AGI在很大程度上是一个“营销术语”。但这并不意味着AGI没有意义。恰恰相反,围绕AGI标准的争论本身就是推动行业前进的动力。Bengio的量化框架、DeepMind的认知评估、吴恩达的Turing-AGI测试——这些努力正在把AGI从一个模糊的愿景变成可测量、可验证的技术里程碑。

谁定义AGI,谁就定义了下一个时代的游戏规则。而这场关于定义权的战争,才刚刚开始。

APP下载
广告
下载证券之星
郑重声明:以上内容与证券之星立场无关。证券之星发布此内容的目的在于传播更多信息,证券之星对其观点、判断保持中立,不保证该内容(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关内容不对各位读者构成任何投资建议,据此操作,风险自担。股市有风险,投资需谨慎。如对该内容存在异议,或发现违法及不良信息,请发送邮件至jubao@stockstar.com,我们将安排核实处理。如该文标记为算法生成,算法公示请见 网信算备310104345710301240019号。
网站导航 | 公司简介 | 法律声明 | 诚聘英才 | 征稿启事 | 联系我们 | 广告服务 | 举报专区
欢迎访问证券之星!请点此与我们联系 版权所有: Copyright © 1996-