7月23日,Google DeepMind研究员fofrAI在X上转发了一条消息,配文只有一句话:“Very nice. And playing billiards well is quite a flex.”打台球打得好,本身就是件很酷的事。
这条推文的主角,不是谷歌的某个新产品,也不是OpenAI的下一代模型,而是一家只有2个人的YC创业公司。Induction Labs刚刚发布的模型Photon-1,而fofrAI点赞的那个打台球能力,恰恰是Photon-1最令人惊讶的副产物。一个只看过电脑屏幕的模型,在被微调后,竟然能比谷歌、OpenAI的通用大模型更准确地模拟台球物理碰撞。
这听起来像是一个技术趣闻。但当你看到背后的数字,就不会这么觉得了。
一个人看了18年的屏幕,能学会什么
先看事实。
7月23日,Induction Labs正式发布“imagination model”(想象模型),一种全新的基础模型架构。其首款模型Photon-1是一个稀疏106B参数(激活5B)的MoE Transformer,训练数据来源于18年时长的电脑屏幕录像,总计5.75亿帧画面、5520亿个token。
关键不同在于这些数据没有任何动作标签。Photon-1不是通过“人在某个状态下点击了某个按钮”这样的监督信号学会操作电脑的,它只是看。看人类怎样使用电脑,看屏幕上的画面如何从一个状态变化到另一个状态。然后,它自己学会了想象,预测下一帧画面应该是什么样。
在内部计算机使用基准测试中,Photon-1的性能超过了Gemini 3.1 Flash-Lite,谷歌最新一代的轻量级生产模型。代价呢?Photon-1的预训练算力仅为Gemini 3.1 Flash-Lite的三十分之一,部署成本仅为其三分之一。
三十分之一的算力,三分之一的成本,表现更好。
这就是为什么fofrAI,一个在Google DeepMind工作的研究员,会公开表示打台球打得好是件很酷的事。他说的不是台球,他说的是技术范式的碾压。
为什么猜下一帧比记住标签更聪明
要理解Photon-1的反直觉之处,需要先理解传统AI学习路径的瓶颈。
目前主流的计算机使用模型,几乎都采用“人类示范+行为克隆”的训练范式。先录制大量人类操作视频,再由人工标注每个时间点的动作(鼠标点击、键盘输入、滚动),然后让模型模仿这些动作。这听起来合理,但存在一个根本性局限。你需要人类先做一遍,然后标注一遍,然后才能训练。数据的规模和质量,完全取决于人类标注的速度和精度。
Induction Labs选择了一条完全不同的路。
Photon-1的核心创新在于“representation space prediction”(表征空间预测)。传统的视频生成模型试图预测下一帧的像素,RGB值,这极其昂贵且效率低下。Photon-1则先用一个视觉编码器,将每一帧画面压缩为960个离散的潜在token,每个token仅2.2KB大小,仅需要8个维度、每个维度4比特的编码空间。相比现有视觉大模型的表示方法,压缩率提升了100倍。
然后,Photon-1的任务是基于当前帧的潜在表示,预测下一帧的潜在表示。它不生成像素,它只想象状态的变化。
这种做法的精妙之处在于两点。第一,压缩率让长序列预测变得可行。100倍的空间节省意味着,同样长度的视频,Photon-1可以处理的信息量远超传统模型。第二,在不生成像素的前提下预测未来状态,模型被迫学习的不是像素层面的变化,而是概念层面的变化。它不需要理解每一颗像素的颜色,只需要理解屏幕上的内容从A变成了B,中间发生了什么。
正是这种概念学习,让Photon-1在仅仅看过电脑屏幕的情况下,学会了物理世界的规律。
没有见过台球桌,却学会了台球物理
Induction Labs在发布中展示了Photon-1几项令人惊讶的泛化能力。
第一个是台球物理模拟。在少量台球视频上微调后,Photon-1能够准确模拟台球碰撞后的物理轨迹,球的位置、速度、碰撞角度,全部由模型预测。对于一个只看过浏览器窗口、代码编辑器、Excel表格的模型来说,这完全是跨领域的能力跃迁。它没有见过真实的台球桌,没有见过三维物理世界,但它从屏幕录像中学会了物体碰撞和运动的底层概念。
第二个是国际跳棋。Photon-1在仅2万局锦标赛棋谱的微调后,就能下国际跳棋,表现超过了基于同样数据训练的通用大模型。
第三个更加微妙。Induction Labs发现,Photon-1从预训练数据中学会了人类使用AI工具的方式。它会在完成任务时主动调用ChatGPT,检查输出结果,然后反复调整提示词,直到得到满意的答案,就像人类做的那样。
一个模型,学会了使用另一个模型。
这不是程序员教它的功能,这是它从18年的屏幕录像里自己看会的。
30倍算力差的秘密,从工程量级到范式革命
Photon-1的预训练仅消耗了约3万H200 GPU小时,对应4.4x10^22 FLOPs。作为对比,训练一个类似规模的通用大模型,通常需要数百万GPU小时。30倍的算力差距,意味着什么?
从成本角度看,Photon-1的预训练成本可能在数十万美元量级,而同等能力的传统模型可能需要数千万美元。对于一家只有2个人的创业公司来说,这不仅是可行性的问题,更是生存的问题。
从技术路线看,Induction Labs押注的是一条完全不同的scaling law。传统LLM的scaling law依赖的是更多数据乘以更多参数再乘以更多算力的线性增长。而imagination model的scaling law,依赖的是更多视频数据乘以更高压缩率再乘以更好的表征学习。这是一条更陡峭但也更经济的曲线。
Induction Labs在技术博客中披露了一个关键细节。他们的预训练数据来自一个内部索引的20亿个公开视频,经过筛选后只保留了约200万个电脑屏幕录制视频。这意味着数据获取的门槛远低于传统方法。不需要购买标注数据,不需要雇佣标注团队,只需要从互联网上已有的视频中筛选。
这恰好呼应了Imagination Model的核心宣言:“我们相信超级智能将来自以同样方式工作的模型,通过自己的观察学习,边学边更新,不断扩展所知。”
小团队的大赌注,YC背景与好奇心驱动的AI哲学
Induction Labs由David Li和Jonathan Li于2025年创立,入选Y Combinator S25批次,目前只有2名员工,base在旧金山。在YC每年数百家创业公司中,他们是最小也最激进的团队之一。
在他们的官网上,这家公司写下了这样一段话:“我们正在扩展对世界充满好奇的基础模型。我们见过通用智能只出现了一次,它的标志是好奇心:对已知世界的不满,从经验中学习的能力,以及与他人分享知识的倾向。”
这段文字列举了启发了他们的七个人名。Shannon、Darwin、Borges、Erdos、Chopin、Lovelace、Escher,信息论、进化论、文学、数学、音乐、计算、艺术。这是一个跨学科的宣言,也是一份技术路线图。
Imagination model的核心理念(从观察中学习)直接呼应了人类学习的方式。人类不需要被明确标注每一步动作才能学会骑自行车,我们通过观察他人、通过试错、通过想象下一个状态来学习。Induction Labs试图把这种能力赋予AI。
值得注意的是,他们的技术路线与当前AI行业的主流方向形成了鲜明对比。当OpenAI、Google、Meta、Anthropic都在疯狂堆算力、堆参数、堆标注数据时,Induction Labs选择了一条更轻的路径:用更聪明的架构,从更原始的数据中学习。
这让人想起当年DeepMind的Atari游戏论文。仅仅通过观察屏幕像素和游戏分数,AI就能学会玩49款游戏,其中一半超过了人类职业玩家。那是一个少即是多的时代。而Imagination model,似乎是这个理念在2026年的重新登场。
观察学习时代的开端
Photon-1的意义远不止于一个2人公司的技术demo。它可能正在开启一个全新的AI训练范式。
回顾过去两年AI行业的演进,有一条清晰的脉络。2024年,业界焦点是推理增强(Scaling Test-Time Compute),OpenAI的o1系列模型开辟了“思考越久越聪明”的路径。2025年,焦点转向了Agent能力,模型开始学会调用工具、执行多步任务。而到了2026年,一个更深层的命题正在浮现:模型到底需要什么样的训练数据?
传统答案是需要最多的、最干净的、标注最精确的数据。但Photon-1给出了另一个答案:需要最多的、最真实的、最原始的数据。标注不是必需品,观察才是。
这个区别的影响是深远的。互联网上的文本数据已经接近耗尽,各大模型公司都在争夺剩下的语料库,甚至开始合成数据来填补缺口。但视频数据远远没有被充分利用。YouTube上每分钟上传500小时以上的视频,桌面录屏软件每天产生海量的操作记录,这些数据天然包含人类智能的完整行为轨迹,却被大多数AI公司忽视了,因为它们太脏,没有标签、没有结构化、没有清洗。
Induction Labs证明了,只要架构设计得足够聪明,脏数据反而比干净数据更有价值。因为脏数据是真实的,而真实数据中包含了人类智能的全部细节。
这意味着什么
Photon-1的发布,正在传递几个清晰的信号。
AI的“数据效率”正在取代“算力规模”,成为新的竞争焦点。当GPT-5.5、Claude Opus 4.7、Gemini 3.5 Pro这些模型在参数规模和训练算力上不断创下新高时,Photon-1用三十分之一的代价证明了更好的学习方法比更多的学习数据更重要。这对整个AI行业的资源配置方式提出了挑战。如果一家2人小公司能做到,那大公司每年数百亿美元的算力支出,有多少是有效的?
同时,视频数据正在成为比文本数据更丰富的预训练燃料。互联网上的视频数据量级远超文本,而且包含了人类行为的完整记录。操作、交互、决策、创造,全部体现在画面中。Imagination model证明了,只要架构设计得当,模型可以从这些原始视频中提取出比结构化的文本数据更丰富的知识。这可能会引发一轮视频数据竞赛,谁拥有最大、最丰富的视频数据集,谁就能训练出最聪明的模型。
但最重要的信号或许在于,计算机使用Agent的商业化路径正在被重新定义。当前市场上的Computer Use Agent产品(如Anthropic的Claude Computer Use、OpenAI的Operator)几乎都依赖行为克隆加人工标注的范式,成本高、扩展慢。Photon-1的观察学习加强化学习范式,理论上可以大幅降低Agent的训练成本,同时提升泛化能力。如果这条路能够走通,我们可能在2026年下半年看到大量基于Imagination model的Agent产品涌现。
Photon-1目前还只是一个研究验证,不是商业产品。Induction Labs只有2个人,他们需要从研究走向产品,从产品走向规模化。这中间的距离,可能比他们目前走过的路还要长。
但至少在这一刻,一家旧金山的2人YC公司,让Google DeepMind的研究员在X上公开说了句:“打台球打得好,真的很酷。”
在AI这个行业,能让对手为你鼓掌,本身就是一种胜利。






快报