Liquid AI推出LFM2.5‑2.6B 本地部署代理模型实现小模型多功能

2 阅读6分钟开源
Liquid AI推出LFM2.5‑2.6B 本地部署代理模型实现小模型多功能

模型概述

LFM2.5‑2.6B 是 Liquid AI 在 Hugging Face 上开源的 2.5‑2.6 B 参数大模型,定位为 本地部署的代理模型。它兼容常见的推理框架(llama.cpp、MLX、vLLM、SGLang、ONNX),可直接在笔记本、手机甚至嵌入式芯片上运行。核心特性包括:

  • 工具调用:内置 tool‑calling 接口,支持搜索、计算、代码执行等多种外部工具。
  • 多步工作流:通过 Agentic RL 训练的多轮推理能力,可在同一次对话中完成信息检索、分析与输出。
  • 高效推理:在 Apple M5 Max 上达 220 tok/s,AMD Ryzen CPU 上达 113 tok/s,显存占用低于 2.5 GB。

训练与强化学习流程

模型的训练分为四个阶段:

  1. 监督微调(SFT):两轮 SFT,重点使用工具使用、网络搜索和代理轨迹数据。
  2. 教师专家化:为数学、代码、工具使用等领域分别训练专门的教师模型。
  3. 多域在线蒸馏(MOPD):将各领域教师模型蒸馏成单一学生模型,保持跨域能力。
  4. 代理强化学习(Agentic RL):在真实的代理环境(如 OpenClaw、Hermes Agent)中进行多轮 RL,模型学习在不同工具、系统提示和任务环境之间的协同。

训练框架将模型优化、推理和环境执行解耦:Training Engine 负责模型参数更新,Rollout Engine 生成动作并收集轨迹,Sandbox Service 在安全沙箱中执行实际工具调用,Harness Proxy 负责捕获 token‑level 轨迹供后续 RL 使用。

基准评测

Liquid AI 将 LFM2.5‑2.6B 与尺寸约为其四倍的模型进行对标,覆盖 STEM、指令跟随、工具使用和综合代理任务。关键结果如下(分数越高越好):

  • AIME25:51.87(领先) vs. 9.7 B Qwen 56.07
  • LiveCodeBenchv6:59.41(领先) vs. 69.86(9.7 B Qwen)
  • ToolSandbox:77.83(领先)仅次于 9.7 B Qwen 的 76.44
  • IFBench:59.17(领先) vs. 56.47(9.7 B Qwen)

在指令跟随和工具使用基准上,LFM2.5‑2.6B 超越所有同类模型,仅在 BFCLv4(工具沙箱)上被 9.7 B Qwen 略微超越。编码任务仍是大模型的优势,若对代码质量有严格要求,建议使用更大的模型。

推理性能与部署

CPU 推理

  • Apple M5 Max:220 tok/s
  • AMD Ryzen AI Max+ 395:113 tok/s
  • 在 30 tok/s 速度下,甚至可以在手机上运行完整的代理工作流。

GPU 推理

  • 单卡 H100:约 15 k tok/s 的高并发输出,日产量约 1.3 B token。
  • 同尺寸模型中,LFM2.5‑2.6B 的吞吐量居首。

这些数据表明,模型在 边缘算力云端算力 之间实现了平衡,企业可根据业务需求灵活选择部署方式,既能降低云推理费用,又能保证数据本地化。

使用指南

from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
    model_id, device_map="auto", dtype="bfloat16"
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
    [{"role": "user", "content": prompt}],
    add_generation_prompt=True, return_tensors="pt"
).to(model.device)
output = model.generate(
    input_ids, do_sample=True, temperature=0.2, top_k=80,
    repetition_penalty=1.05, max_new_tokens=512
)
print(tokenizer.decode(output[0], skip_special_tokens=False))

上述代码可在任意支持 transformers>=5.0.0 的环境中直接运行,配合 flash_attention_2 可进一步提升显存利用率。

展望

Liquid AI 表示,LFM2.5‑2.6B 只是其“AI 可随处运行”愿景的第一步。后续将推出更大规模的系列模型以及针对特定行业(如金融、医疗)的专属教师模型,进一步提升在专业任务上的表现。同时,社区已可在 Hugging Face Spaces 中体验 WebGPU 演示,帮助开发者快速验证模型在浏览器端的可行性。

“我们期待看到开发者利用本地代理模型构建更安全、更高效的 AI 应用。” — Liquid AI 团队

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。