北京时间9月8日,全新3D空间推理基准MazeBench公布评测结果:OpenAI最新旗舰模型GPT-6 Astra经过60多个小时的运算,在满分100分的测试中拿下14分,成为首个在该项测试中取得两位数得分的AI模型,超越此前所有智能体。就在几天前,OpenAI刚刚发布GPT-6 Astra,英伟达CEO黄仁勋随即公开发声,认定OpenAI已成为全球首个实现AGI的团队,一场围绕"AGI如何定义"的争论迅速升温。
空间推理:AI最后需要攀登的高峰
MazeBench是由Jonathan Pappas和David Pappas于2026年7月底推出的3D空间推理测试环境,包含200多个房间、100颗宝石及大量推箱子式谜题。模型需要面对电梯砖、可开关墙体、冰面滑行等多重机制,且只有11个可用动作(4个移动、4个视角旋转,外加撤销、重置和传送),每道题往往需要规划100步以上。
这一基准之所以备受关注,是因为空间认知能力长期被视为大模型"最后需要攀登的高峰"。此前,在不借助Python辅助的条件下,所有模型的得分均不足1%;即使开启Python辅助,上一代旗舰GPT-5.6 Sol也仅获13分,Claude Fable 5为11%,Gemini Opus 5为9%。而GPT-6 Astra直接将无辅助得分拉升至14%,实现了从"几乎为零"到"两位数"的跨越式突破。

30亿Token压缩至3.5亿:批量出招模式显威
值得注意的是,考虑到市场对Token应用效率日益关注,评测团队还要求模型采用"批量出招"模式以减少Token消耗。GPT-6 Astra将原本预估的30亿Token压缩至3.5亿,同时每次能前瞻10至20步,相当于用不到八分之一的Token消耗完成了同等难度的探索任务。
这种效率提升背后,是模型对长链条规划能力的显著增强。MazeBench的关卡机制复杂,墙体状态可动态切换、冰面滑行会改变运动轨迹,模型必须在每一步都综合空间关系做出决策。Astra能够以批量模式高效解题,说明其不仅能理解三维场景,还具备在复杂约束下进行长距离推理的能力,这对未来机器人控制、自动驾驶、具身智能等真实世界应用意义重大。

短板犹存:俯视视角下的"空气墙"误判
不过,此次评测也暴露出Astra在3D空间理解上的局限性。它更倾向于使用俯视视角观察关卡,导致部分仅在3D视角下可见的墙体被误判为"空气墙",这提示模型对"视角依赖信息"的处理仍有提升空间。
尽管存在短板,Astra在实际应用场景中展现出的三维空间构建能力已令开发者惊叹。有开发者仅凭一段4分钟的视频,让Astra通过计算机使用功能自主操作Fusion 360完成全参数化建模,设计出严丝合缝的地漏清理部件,并直接导入3D打印。从"看懂房间"到"动手建模",这种能力延伸正在打开想象空间。

"AGI已来"还是"赛道切换"?
就在GPT-6 Astra发布后,黄仁勋公开表示OpenAI已成为全球首个实现AGI的团队,OpenAI总裁格雷格·布罗克曼也在9月4日的发布会上直言"欢迎来到AGI时代"。但业内并非没有反对声音:若以"在所有经济价值任务上达到或超越人类水平"的传统定义审视,Astra在空间推理等任务中虽有突破,与人类的空间认知和操作能力相比仍有差距。
有业内人士指出,AGI不应被理解为"在所有维度同时超越人类"的静态终点,而更应视作智能体具备跨领域迁移和自主进化能力的阈值。据相关媒体报道,OpenAI下一代模型"Bel"及Anthropic的神秘"Model 2"已在酝酿中,头部厂商的竞争正从"谁先抵达AGI"向"谁能让智能实现自我递归进化"切换。无论定义之争如何收场,GPT-6 Astra在MazeBench上的纪录,已经为2026年下半年的AI竞赛写下了新的注脚。



