Liquid AI推出LFM2.5-2.6B 本地化代理模型实现128K上下文与工具调用

62 阅读4分钟开源

模型概览

Liquid AI在本周正式开源 LFM2.5-2.6B,这是一款专为本地部署设计的代理式大模型。模型总参数为2.69 B,采用30层结构,其中包含22个双门短卷积块和8个分组查询注意力块(GQA),词表规模128 K,最大上下文长度达131 072 token。模型分为两套检查点:Base 版用于后续微调,Agent 版已完成四阶段后训练,直接支持工具调用与多步任务规划。

关键技术亮点

  • 超长上下文:131k token 的窗口让文档全局检索与长篇推理成为可能。
  • 本地化推理:在 Apple M5 Max 上解码速率 220 tok/s,显存占用不足 2.5 GB;在手机上约 30 tok/s,满足离线使用。
  • 多格式权重:提供原生 GGUF、MLX、ONNX 三种格式,兼容 llama.cpp、vLLM、SGLang、LM Studio 等主流推理框架。
  • 工具调用:模型在推理阶段可调用外部工具(搜索、数据库、机器人指令等),实现真正的代理能力。
  • LoRA 微调:支持通过 LoRA 与 TRL、Unsloth 等库快速适配特定行业任务。

性能与基准

Liquid AI 将 LFM2.5-2.6B 与同规模或更大模型进行对标,主要结果如下:

  • ToolSandbox:77.83 分,领先 gemma‑4‑E4B‑it(65.00)和 Qwen3.5‑9B(76.44)。
  • Multi‑IF:80.07 分,显著高于 gemma‑4‑E4B‑it(77.35)和 Qwen3.5‑9B(62.55)。
  • IFStruct:85.49 分,超过所有对手。
  • 编码效率:在 M5 Max 上 220 tok/s,手机端 30 tok/s,保持低功耗。
  • 编码成本:推理全程本地化,数据不离设备,边际成本几乎为零。

唯一短板在于代码生成等知识密集任务,LiveCodeBench v6 上仅得 59.41 分,仍落后 Qwen3.5‑9B(69.86)。

应用场景与部署方案

  • 行业垂直:汽车驾驶舱、消费电子、工业机器人、医疗影像、金融合规、电子商务与国防等对数据保密有严格要求的场景。
  • 本地助理:在手机、笔记本或嵌入式设备上实现离线文档三千页检索、发票表单抽取、长文本摘要等。
  • 机器人指令:通过工具调用将自然语言转化为机器人动作指令,实现持续后台运行的智能体。
  • 企业部署:单卡 NVIDIA H100 可每日处理约 1.3 B token,适合中小团队自托管;大规模 OEM 可通过 GGUF/ONNX 将同一权重下发至千级设备。

市场意义

LFM2.5-2.6B 的发布标志着 本地化代理模型 正式进入商业化落地阶段。相较于传统云端大模型,它在隐私、安全、成本三方面具备天然优势,尤其符合监管严格的行业需求。开源权重与多格式发布进一步降低了技术门槛,促使更多开发者和企业能够在现有硬件上快速试验并迭代特定任务。随着 128 K 超长上下文的普及,长文档处理与多模态检索将成为新一轮竞争焦点,Liquid AI 的这款模型为行业提供了一个可直接落地的参考标杆。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。