Thinking Machines Lab发布Inkling‑Small,276B多模态MoE模型实现单卡部署

0 阅读4分钟前沿

模型概览

Thinking Machines Lab今日在 Hugging Face 公布了 Inkling‑Small,这是一款总参数 2760 亿、激活参数 120 亿的稀疏混合专家(Mixture‑of‑Experts, MoE)模型。相比其前身 Inkling(9750 亿总参数、410 亿激活),规模仅为四分之一,却在多模态推理、代码代理等任务上实现了显著提升。模型原生支持 文本、图像、音频 三模态输入,上下文窗口扩展至 1 000 000 标记,推理时可通过调节思考力度(effort)平衡算力与精度。

"Inkling‑Small 将大模型的算力门槛大幅降低,使得单卡部署成为可能。"——官方模型卡

架构亮点

  • 稀疏 MoE 前馈层:每层 256 位专家中选取 6 位激活,再加 2 位共享专家,单 token 实际路由至 8 位专家;
  • 42 层解码器‑only Transformer:采用局部+全局混合注意力,省去编码器结构,实现更高效的跨模态融合;
  • 多模态嵌入:图像切分为 40×40 像素补丁,经四层 hMLP 处理;音频转为 dMel 谱图后同样进入轻量嵌入层;
  • 数值支持:提供 BF16、MXFP8 与 NVFP4 三种数值格式,满足不同硬件平台需求。

评测成绩

Inkling‑Small 在公开基准上整体超越其教师模型 Inkling,关键成绩如下:

  • Humanity’s Last Exam(文本):31.6% > 29.7%
  • SWE‑bench Verified:80.2% > 77.6%
  • Terminal‑Bench 2.1:64.7%(最佳 harness)
  • Toolathlon Verified:54.4% > 45.5%
  • GPQA Diamond:89.5%
  • AIME 2026:95.5%
  • IFBench:82.2%
  • ARC‑AGI‑2:40.1% > 36.5%

在多模态指标方面,Inkling‑Small 与 Inkling 持平或略有优势:MMMU Pro 74.0%、VoiceBench 90.1%、MMAU 77.0%。其 epistemic 校准也提升至 Brier Index 61.3(优于 Inkling 的 60.1)。安全评估显示 StrongREJECT 98.4%、FORTRESS 对抗 71.6%、温和 96.9%。

部署与硬件需求

  • BF16 检查点:需累计 600 GB VRAM,可通过 4×B300 或 8×H200 实现;
  • NVFP4 检查点:显存需求降至 180 GB,单块 NVIDIA B300(SM100+)即可运行,采用 W4A4 量化;亦可在两块 H200 上使用 W4A16。
  • 兼容运行时:SGLang、vLLM、TokenSpeed、Unsloth 以及 Hugging Face 官方推理库全部支持。

这意味着创业公司只需租用一台 B300 实例即可自行托管,具备算力的中型企业亦可在现有 H200 集群上直接部署,无需额外采购硬件。针对金融、医疗、保险、电信与公共部门等受监管行业,官方提供私有权重选项以满足合规要求。

行业意义

Inkling‑Small 的单卡可部署特性标志着 前沿大模型 正在从少数云服务商向更广阔的企业与研发社区渗透。它把 2700 亿级别的多模态推理能力搬到可租赁的显卡实例上,为 代码代理、终端自动化、文档与图表解析 以及 呼叫中心音频分析 提供了成本可控的技术底座。与此同时,模型仍保持开源 Apache 2.0 许可证,社区可以在此基础上继续进行安全微调或专用领域适配。

整体来看,Inkling‑Small 既是一次 模型压缩与稀疏化 的成功案例,也是推动开放大模型生态向产业落地迈进的关键一步。


本文基于 Thinking Machines Lab 官方发布的模型卡与技术博客撰写,未包含任何个人主观评价。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。