快手KAT团队发布KAT-Coder-V2.5 实现超10万可验证代码环境 显著提升训练效率
背景与意义
KAT-Coder 系列是快手KAT团队针对 Agentic Coding(具身编码)场景推出的专用语言模型。相较于传统的单轮代码生成模型,KAT-Coder 能在完整的代码仓库、依赖安装及测试执行链路中进行迭代修复,真正实现“写代码‑跑测试‑修正”闭环。KAT-Coder-V2.5 通过 100,000+ 可验证环境的规模化训练,首次将基础设施瓶颈转化为可量化的优化目标。
模型概览
- 模型规模:35B 参数(MoE 3B 活跃)
- 权重发布:KAT-Coder-V2.5-Dev(Apache‑2.0)已同步至 Hugging Face
- 训练目标:在真实仓库中完成补丁生成并通过结构化测试,采用 asymmetric PPO+GAE 的三层奖励体系
AutoBuilder 与环境构建
AutoBuilder 是本次训练的核心组件,负责自动化构建可执行的仓库环境。通过预配置的基础镜像、构建系统模板以及可检索的构建配方库,环境构建成功率从原始的 16.5% 提升至 57.2%,累计生成 100,000+ 跨 12 种编程语言的可验证环境。系统在构建阶段会剥离 Git 历史、提交元数据等潜在泄露信息,确保模型无法直接读取参考实现。
基础设施审计与错误削减
训练期间团队发现约 16% 的 RL 轨迹因沙箱基础设施故障而失效。针对三大根因完成以下修复:
- 磁盘使用优化:提前回收镜像,将磁盘占用从 95% 降至 60%,超时导致的无效回滚从 6‑7% 降至 <1%。
- 环境变量校正:统一远程沙箱初始化参数,消除 6‑7% 样本的奖励翻转错误,错误率降至 <1%。
- Gateway Server 调整:绕过常规 chat 接口,直接调用 /generate,避免 200‑turn 规模的 token 漂移。
三项改动将沙箱反馈错误率压至 2% 以下,训练崩溃次数下降一个数量级。
训练方法与奖励设计
采用 asymmetric actor‑critic:Critic 在训练时获得完整的奖励、测试、覆盖率、补丁元信息等 privileged context,Actor 仅观测 rollout 状态。奖励分为三层:
- 核心任务分数:所有必测用例必须全部通过。
- 行为约束:惩罚重复调用、错误工具使用、调试残留等。
- 失败轨迹激励:对文件检索行为给予部分测试分,鼓励模型在困难环境中探索。
多教师 on‑policy 蒸馏结合 reverse KL、off‑policy 启动以及 drift‑aware 修剪,进一步提升策略稳健性。
基准评测表现
在统一的 Claude Code harness 下,KAT-Coder-V2.5 在 PinchBench 获得 94.9,超越 Opus 4.8(93.5)。在 SWE‑Bench Pro 排名第二(65.2),仅次于 Opus 4.8(69.2)。内部 KAT Code Bench 得分 53.1,位列第三。
对比 Terminal‑Bench 2.1 与 SciCode,模型分别得到 60.7(最后)和 50.3(持平 GLM‑5.2),显示在终端交互和科学代码领域仍有提升空间。
开源与生态
KAT-Coder-V2.5‑Dev 作为 35B‑total / 3B‑active MoE 版本,在 Qwen3.6‑35B‑A3B 基础上进行 127K SFT 示例的后训练,随后再进行 RL 微调。该版本权重已在 Hugging Face 公布,供科研与商业社区自行部署。
影响与展望
此次发布表明 Agentic Coding 的瓶颈更多来源于可执行环境的规模化构建与训练基础设施的可靠性,而非模型容量本身。AutoBuilder 的成功经验为后续多语言、跨平台代码生成提供了可复制的流水线,也为行业探索“代码即服务”式的闭环训练奠定基础。未来,团队计划进一步提升环境成功率至 80% 以上,并在更大规模的代码基准上验证模型的通用性。
“我们把重点放在让模型在真实开发环境中可靠运行,而不是单纯追求更大的参数量。” — KwaiKAT 团队负责人