Thinking Machines Lab发布Inkling‑Small,276B多模态MoE模型实现单卡部署
模型概览
Thinking Machines Lab今日在 Hugging Face 公布了 Inkling‑Small,这是一款总参数 2760 亿、激活参数 120 亿的稀疏混合专家(Mixture‑of‑Experts, MoE)模型。相比其前身 Inkling(9750 亿总参数、410 亿激活),规模仅为四分之一,却在多模态推理、代码代理等任务上实现了显著提升。模型原生支持 文本、图像、音频 三模态输入,上下文窗口扩展至 1 000 000 标记,推理时可通过调节思考力度(effort)平衡算力与精度。
"Inkling‑Small 将大模型的算力门槛大幅降低,使得单卡部署成为可能。"——官方模型卡
架构亮点
- 稀疏 MoE 前馈层:每层 256 位专家中选取 6 位激活,再加 2 位共享专家,单 token 实际路由至 8 位专家;
- 42 层解码器‑only Transformer:采用局部+全局混合注意力,省去编码器结构,实现更高效的跨模态融合;
- 多模态嵌入:图像切分为 40×40 像素补丁,经四层 hMLP 处理;音频转为 dMel 谱图后同样进入轻量嵌入层;
- 数值支持:提供 BF16、MXFP8 与 NVFP4 三种数值格式,满足不同硬件平台需求。
评测成绩
Inkling‑Small 在公开基准上整体超越其教师模型 Inkling,关键成绩如下:
- Humanity’s Last Exam(文本):31.6% > 29.7%
- SWE‑bench Verified:80.2% > 77.6%
- Terminal‑Bench 2.1:64.7%(最佳 harness)
- Toolathlon Verified:54.4% > 45.5%
- GPQA Diamond:89.5%
- AIME 2026:95.5%
- IFBench:82.2%
- ARC‑AGI‑2:40.1% > 36.5%
在多模态指标方面,Inkling‑Small 与 Inkling 持平或略有优势:MMMU Pro 74.0%、VoiceBench 90.1%、MMAU 77.0%。其 epistemic 校准也提升至 Brier Index 61.3(优于 Inkling 的 60.1)。安全评估显示 StrongREJECT 98.4%、FORTRESS 对抗 71.6%、温和 96.9%。
部署与硬件需求
- BF16 检查点:需累计 600 GB VRAM,可通过 4×B300 或 8×H200 实现;
- NVFP4 检查点:显存需求降至 180 GB,单块 NVIDIA B300(SM100+)即可运行,采用 W4A4 量化;亦可在两块 H200 上使用 W4A16。
- 兼容运行时:SGLang、vLLM、TokenSpeed、Unsloth 以及 Hugging Face 官方推理库全部支持。
这意味着创业公司只需租用一台 B300 实例即可自行托管,具备算力的中型企业亦可在现有 H200 集群上直接部署,无需额外采购硬件。针对金融、医疗、保险、电信与公共部门等受监管行业,官方提供私有权重选项以满足合规要求。
行业意义
Inkling‑Small 的单卡可部署特性标志着 前沿大模型 正在从少数云服务商向更广阔的企业与研发社区渗透。它把 2700 亿级别的多模态推理能力搬到可租赁的显卡实例上,为 代码代理、终端自动化、文档与图表解析 以及 呼叫中心音频分析 提供了成本可控的技术底座。与此同时,模型仍保持开源 Apache 2.0 许可证,社区可以在此基础上继续进行安全微调或专用领域适配。
整体来看,Inkling‑Small 既是一次 模型压缩与稀疏化 的成功案例,也是推动开放大模型生态向产业落地迈进的关键一步。
本文基于 Thinking Machines Lab 官方发布的模型卡与技术博客撰写,未包含任何个人主观评价。