1180亿参数Laguna模型在编码基准上击败万亿参数大模型
•1 阅读•4分钟•前沿
PoolsideLagunaTerminal-Bench 2.1编码模型
Jesus Rodriguez••1 阅读•4分钟•前沿

亮眼成绩
Poolside最近公开的 Laguna S 是一款拥有 1180 亿参数 的开源编码模型。该模型在业界常用的 Terminal‑Bench 2.1(代码生成与调试)基准上取得 70.2% 的得分,显著高于同类大模型:
- DeepSeek‑V4‑Pro‑Max(1.6 万亿参数)得分 64.0%
- Inkling(9750 亿参数)得分 63.8%
- Nemotron 3 Ultra(5500 亿参数)得分 56.4%
在更具挑战性的 DeepSWE 基准上,Laguna S 仍以 40.4% 的得分领先,同样模型的 DeepSeek‑V4‑Pro‑Max 仅为 9.0%。这些数据表明,Laguna 在同等任务上能够以约 13 倍 参数劣势实现 4 倍 以上的分数优势。
与万亿参数大模型的对比
传统认知认为,参数规模是提升大语言模型能力的主要驱动力。然而,Laguna 的表现挑战了这一假设:
- 数据质量与微调策略:Poolside 在论文中透露,模型在训练阶段采用了大规模高质量代码数据,并结合了多阶段微调(SFT+RLHF)以强化语言‑代码对齐。
- 模型架构优化:虽然文章强调“有趣的并非架构”,但实际使用了稀疏专家(MoE)和高效的 Transformer‑XL 变体,显著提升了长上下文处理能力。
- 评估透明度:Poolside 公开了全部评估轨迹,允许研究者逐步复现每一次生成,这在业界极为罕见。
评估争议与行业影响
如此巨大的性能差距自然引发质疑:是否存在评估漏洞或数据泄露?Poolside 主动发布评估日志的举动旨在消除怀疑,然而仍有声音指出:
“如果模型在训练数据中已经包含了测试集的代码片段,那么得分提升并不意味着真正的通用能力。”——来自 Stanford AI Lab 的评论。
与此同时,Laguna 的成功也激励了开源社区重新审视 小模型高效化 的路线。过去几年,开源大模型往往追求参数规模的突破,而 Laguna 证明,围绕 数据精选、微调技术 与 架构压缩 的组合,同样能在特定任务上实现领先。
商业与技术前景
- 成本优势:118B 参数模型在推理时所需显存约为 1/10‑1/12 的大模型,意味着企业可以在普通 GPU(如 RTX 4090)上部署,显著降低算力成本。
- 生态驱动:Poolside 已将模型权重、训练脚本以及评估日志全部开源,预计会在 Hugging Face 与 GitHub 上快速形成二次开发社区。
- 竞争格局:DeepSeek、Meta、Google 等巨头若想在编码领域保持领先,可能需要加速对 高质量代码数据 与 多阶段微调 的投入,而非单纯扩大参数规模。
结语
Laguna 的出现提醒业界:在生成式 AI 的赛道上,“更大并非唯一答案”。如果后续独立复现能够验证其优势,这一模型有望成为开源社区在代码生成任务中的新标杆,并推动算力成本与模型效能之间的重新平衡。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。