Induction Labs推出Photon-1 实现单次预训练即可模拟桌面操作、棋局对弈与台球物理
•2 阅读•4分钟•前沿
MoEInduction LabsPhoton-1FSQ
•2 阅读•4分钟•前沿
背景与创新
在视频强化学习领域,传统代理往往需要为每帧标注对应的动作,这成为规模化学习的瓶颈。Induction Labs在上周提出“想象模型”(imagination model)概念,主张在无动作标签的原始视频上进行预训练,让模型通过预测未来潜在表示学习隐式策略。Photon-1是该理念的首个落地实现。
模型架构与压缩技术
- 稀疏 MoE Transformer:106B 参数的主干加上 5B 参数的专家网络(A5B),采用 mixture‑of‑experts 设计,实现计算资源的动态路由。
- Finite Scalar Quantization (FSQ):每帧视频被压缩为 960 个离散 token,单 token 为 8 维向量,仅取 {-1, -0.5, 0, 0.5, 1} 五值之一,编码后约 2.2 KB。官方称压缩率比现有 OCR 与多模态表示高出 100 倍。
- 差分潜编码:模型对相邻帧的差异进行编码,而非完整帧内容,进一步降低冗余信息,提高了时序建模效率。
训练规模与计算成本
- 数据来源:从内部索引的 20 亿公开视频中筛选出约 200 万电脑屏幕录制,经过关键帧检测后得到 5.75×10⁸ 帧(约 18 年视频),采样率 1 fps。
- 预训练:在单轮训练中使用 32K 上下文,耗时约 30,000 小时的 NVIDIA H200 GPU,等效 4.3×10²² FLOPs,MFU 达 40%。
- 成本对比:内部 benchmark 显示,Photon-1 的加权推理成本约为 $0.11/1M token,远低于 Gemini 3.1 Flash‑Lite($0.36/1M token),算力差距约 27‑30 倍。
实验评估与结果
- 桌面基准:在自研的电脑使用基准上,Photon-1 超越 Gemini 3.1 Flash‑Lite,同时保持显著的成本优势。
- 棋盘游戏:在 Open Checkers Archive 2.0 的 20,000 场对局中,Photon-1 在局面模拟与落子质量上均领先两大基线(同结构视觉编码器、LLM 基线 Ling‑flash‑2.0)。
- 台球物理:对 10,000 场合成台球模拟,Photon-1 的平均绝对误差为 0.47,远低于 LLM 基线(1.15)和视觉基线(1.44),说明模型已捕获细粒度的运动动力学。
- 跨域迁移:在微调后,模型还能调用内部 ChatGPT 克隆完成文档生成与知识问答,表现出类似人类的策略规划能力。
影响与展望
Photon-1 的成功证明,无标签视频预训练配合高效压缩与 MoE 结构即可学习隐式策略,这为通用人工智能的感知‑决策统一提供了新路径。虽然当前评测仍局限于内部基准,且模型未公开权重或 API,但其在桌面自动化、游戏 AI 与物理仿真等垂直领域的潜在价值不容忽视。后续工作可聚焦于:
- 开放数据集与可复现基准,提升社区验证力度;
- 扩展至移动端与嵌入式场景,探索更低功耗的想象模型;
- 与大型语言模型深度融合,实现跨模态指令的端到端执行。
行业观察:如果想象模型的训练成本与推理效率继续保持优势,它有望成为下一代“通用感知‑行动”平台的核心技术,推动从桌面自动化向更广泛的现实世界交互迈进。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。