屏幕上的画面定格在《传送门》第17个测试室。地面上散布着传送门出口的蓝色光圈,远处的高台上一扇门若隐若现。这不是一个人类玩家在思考下一步——在游戏暂停的瞬间,一个AI模型正在读取屏幕截图、解析玩家角色的三维坐标,并根据当前的物理环境规划下一步的移动指令。几秒后,游戏恢复运行,角色精确地朝目标走去。
这不是科幻电影。这是2026年9月,AI爱好者CozyBlaze用OpenAI最新旗舰模型GPT-6 Astra,让AI自主通关了Valve的经典3D解谜游戏《传送门》。整个过程耗时约24小时,模型调用工具3336次,API费用571.18美元。
现象:一个AI在《传送门》里的24小时
发生了什么
2026年9月,AI社区被一段视频彻底点燃。CozyBlaze(在X/Twitter上活跃的AI研究员)发布了一段长约2小时的剪辑视频,展示GPT-6 Astra如何从零开始,一步步打通《传送门》的全部关卡——从测试室00到最终与GLaDOS的对决。这不是人类在遥控:每一步都是AI自己观察、决策、执行的结果。
实验的技术架构并不复杂,但足够巧妙。CozyBlaze通过Model Context Protocol(MCP)——这个由Anthropic在2024年底提出、如今已被OpenAI、Google DeepMind、微软等巨头广泛采用的AI工具连接标准——连接了一个名为SourcePauseTool的定制化工具。该工具利用了Valve Source引擎的暂停功能:游戏暂停时,AI接收当前帧的截图和玩家角色的精确位置;经过分析推理后,AI在游戏恢复的瞬间发出键盘和鼠标指令。
这套“暂停—分析—执行”的循环,构成了AI通关《传送门》的核心机制。每完成一次循环,模型就完成一次“观察—思考—行动”的完整闭环。3336次,一次都没有少。
关键数字
3336次工具调用。约24小时总时长。571.18美元API费用。
这些数字各自对应一个维度的突破。工具调用次数代表决策链条的长度——此前AI在3D环境中的最长连续决策从未达到这个量级。总时长反映模型的耐心和稳定性——不间断运行一整天,没有出现目标漂移或崩溃。API成本则说明了一个更现实的问题:这种能力的“燃料”依然昂贵。GPT-6 Astra的标准API定价为每百万输入token 10美元、每百万输出token 50美元,约为上一代GPT-5.6 Sol的两倍。好在CozyBlaze的Codex Pro订阅覆盖了这笔费用。
而《传送门》本身,是一个远非“简单”的挑战。这款2007年由Valve推出的经典解谜游戏,要求玩家利用“传送枪”在两个空间坐标之间建立传送门,利用动量守恒、物体搬运、重力感应平台等物理机制穿过一个个精心设计的测试室。人类玩家的平均通关时间约为3到4小时,而AI花了24小时——但从另一个角度看,AI没有“直觉”,它需要在每一次暂停中从头理解三维空间的拓扑结构。
为什么这不一样
这不是人类第一次让AI玩游戏。2013年,Google DeepMind用深度强化学习学会了Atari游戏——《打砖块》《乒乓球》《太空入侵者》。2025年,各种Agent框架开始在《我的世界》中搭建简单建筑。但《传送门》的难度不在一个量级。
Atari游戏是2D的,状态空间有限,动作空间只有几个按钮。《传送门》是完全3D的,每帧画面包含复杂的几何信息、光影和深度线索,而且解谜需要跨越多步骤的因果推理——把传送门放在A点、走到B点触发机关、再回到A点穿过传送门到达C点。这要求模型维持一个“心智模型”:理解空间中那些没有直接可见的部分。
更关键的是,AI没有使用任何游戏内部API或内存读取工具。它只能像人类玩家一样——看屏幕,理解画面,然后操作键盘鼠标。没有后门,没有作弊。这恰恰是GPT-6 Astra Computer Use能力的核心卖点:像人一样使用电脑。
分析:从“说话”到“操作”的质变
干什么都得先看懂屏幕
GPT-6 Astra凭什么能打通《传送门》?答案藏在它的能力底座里。
2026年9月3日,OpenAI发布了GPT-6 Astra,定位为“全球最智能、最符合人类意图的模型”。根据OpenAI官方数据,在OSWorld 2.0——衡量AI自主操作桌面计算机能力的基准测试——上,Astra取得了72.6%的完成率,比上一代旗舰GPT-5.6 Sol高出6.9个百分点。更重要的是时间效率:Astra每项任务平均耗时约40分钟,而Sol需要75分钟,快了47%。
在ScreenSpot-Pro(屏幕界面元素定位测试)上,Astra达到92.7%,Sol仅为76.9%。这意味着Astra“看懂屏幕”的能力有了质的飞跃——不仅仅是识别图像中有哪些元素,而是精确知道每个按钮、每个文本框在哪一个像素位置。
这些能力的组合,让GPT-6 Astra第一次具备了“看—理解—动手”的闭环。OpenAI官方演示中,Astra可以操作KiCad进行PCB电路板设计,在Blender中建模并导入Unreal Engine 5生成三维场景,还可以像人类一样打开浏览器、填写表单、管理文档。CozyBlaze的实验,只是将这套能力延伸到了游戏领域——一个对视觉理解、空间推理和长链条决策要求更高的测试场。
MCP让AI长出“双手”
实验中的一个关键角色是Model Context Protocol。它的功能本质上是一个标准化接口:让AI模型可以调用外部工具,而无需为每个工具单独开发适配器。SourcePauseTool被封装成一个MCP服务器,对GPT-6 Astra暴露两个核心能力:读取游戏截图和位置信息,以及发送键盘/鼠标指令。
模型不需要理解Valve Source引擎的底层架构,也不需要为《传送门》写任何定制代码。它只需要通过MCP的标准接口调用工具。
这正是MCP设计的核心理念——让AI的能力边界不再受限于模型本身。模型不需要提前训练如何操作Photoshop、Excel或游戏引擎;只要有人把这些工具通过MCP暴露给模型,模型就能尝试使用。从浏览网页到操作软件,从读取数据库到控制游戏,MCP正在把AI从一个“聊天机器人”变成一个“数字操作员”——或者说,让AI从“会说话的脑袋”长出了“可以动手的身体”。
3336次调用背后的“目标一致性”
对于任何做过AI Agent的人而言,3336次工具调用这个数字传递的信号极其明确。
AI模型在单次推理中的表现越来越好——写一段代码、解一道数学题、分析一张图表,这些单步任务在GPT-6 Astra上已经接近或超越了人类专家的水平。但真正的挑战在于“长链条任务”:一个需要数百步、数千步连续决策的任务,AI能否保持目标的连贯性?
这个问题有一个专业术语——目标漂移。常见的现象是:AI在第一步做出正确决策,但到了第50步开始忘记初始目标,或者陷入某个中间状态的局部最优解,不断重复同样的无效操作。如果观察过早期AI Agent的日志,你会发现大量类似的“死循环”——不是因为模型不够强,而是因为它缺乏“回头看”和“自我调整”的能力。
CozyBlaze实验中最值得关注的不是AI打通了《传送门》,而是它在24小时内、3336次调用中、面对不断变化的游戏状态,始终保持着“通关《传送门》”这个目标的觉醒状态。关卡难度上升后,它会在一个关卡上反复尝试不同的传送门位置,分析失败原因,调整策略,再试——这种“试错—学习—调整”的模式,呈现了人类式的解题韧性。
从虚拟传送门到物理世界的传送门
有人可能会问:让AI打游戏,除了炫技还有什么意义?
这个问题的答案,藏在GPT-6 Astra能力的另一个维度里。在ExploitBench上,Astra拿到100%的分数,甚至自主发现了两个零日漏洞。在FrontierMath Tier 4上达到97.6%。在ARC-AGI-3上达到99.9%。在Terminal-Bench 4.0(编程能力测试)上达到57.7%,远超Sol的37.3%。
这些数字指向同一个方向:GPT-6 Astra的“理解—推理—行动”链条正在全面收敛。
《传送门》实验的特殊之处在于,它把AI的“聪明”从文本和代码领域,意外地带到了三维物理空间的模拟环境中。理解一个传送门出口和入口的空间对应关系,本质上和“理解一个机械臂应该以什么角度抓取一个物体”是同一类问题。在3D场景中规划一条路径穿过多个传送门,和“在一个仓库中规划一条路径绕过障碍物”是同一种空间推理能力的不同应用。
这正是为什么多家机器人公司——包括Figure AI(估值约390亿美元)、1X Technologies、Skild AI(估值约140亿美元)——都在基础模型的三维理解能力上投入巨额赌注。如果AI能理解《传送门》中看似反直觉的动量守恒和空间折叠逻辑,它距离理解物理世界中的空间逻辑就已经迈出了关键一步。
结论与展望
CozyBlaze本人也承认:“这不是一个标准化的基准测试。”但恰恰是这种“非标准化”,赋予了实验独特的信息密度。《传送门》的设计者从未考虑过AI会来通关它——每一关都是对人类空间智力的考验,而不是对AI的测试。当AI通过这些关卡时,信号的真实性远超任何精心构建的基准测试套件。
对于OpenAI而言,这是一次天时地利的能力展示。GPT-6 Astra刚刚发布,企业客户还在评估是否值得为两倍的API定价买单,一个社区实验就用最直观的方式证明了新模型的代际跃升。OpenAI总裁Greg Brockman在发布时说:“尽管AGI至今仍是一个灰色、模糊的概念,但未来回望时,人们或许会将GPT-6 Astra视为AGI时代开启的标志性模型。”这句话在《传送门》通关的镜头下,多了几分具体的分量。
对于AI Agent赛道,这是一个里程碑。当AI能在完全3D的游戏环境中自主导航、规划和解谜时,它在2D桌面环境中的操作能力只会更强。数字员工、自动化软件测试、远程IT运维等场景,将直接受益于这种从“会看”到“会做”的能力跃迁。
对于游戏行业本身,一个更深刻的问题正在浮现:如果AI能通关《传送门》,那么AI能通关多少游戏?它能替代人工游戏测试员吗?它能自主探索开放世界、发现隐藏内容吗?这些问题没有标准答案,但每一个都指向一个正在加速的行业变革。
571美元和24小时,换来的不是一个游戏通关记录,而是一扇门被推开。那扇门后面,是AI从“理解世界”到“操作世界”的质变序列——而《传送门》,不过是这条路上第一个真正意义上的3D路标。






快报