Liquid AI发布LFM2.5双向编码器 实现8K上下文CPU高速推理

0 阅读4分钟开源

背景与创新

随着企业对长文本理解需求的激增,传统 BERT 系列在 4K‑8K Token 场景下的计算成本成为瓶颈。Liquid AI 基于自研的 LFM2 混合骨干,推出两款 8K 上下文双向编码器,旨在保持高准确率的同时显著压缩 CPU 推理时延。

模型架构与训练细节

  • 模型来源:从 LFM2.5‑230M / LFM2.5‑350M 解码器初始化,改为双向注意力掩码并将短卷积改为非因果对称填充。
  • 遮罩率:采用 30% 掩码率(高于 BERT 15%),提升大规模预训练效果。
  • 两阶段训练
    1. 1,024 Token 短上下文 MLM 预训练,获取通用语言能力;
    2. 扩展至 8,192 Token 完整数据混合,强化事实、法律及多语言理解。
  • 超参数:隐藏层维度 1024、词表 65,536、支持 15 种语言,使用 AdamW、10 种学习率 + 3 个随机种子的网格搜索。

基准评测

Liquid AI 在 14 款模型、17 项 GLUE、SuperGLUE 与多语言分类任务上进行全量微调评估。

  • LFM2.5‑Encoder‑350M:平均得分 81.02,位列第 4,仅次于 XLM‑R XL(3.5B)、ModernBERT‑large(395M)和 XLM‑R large(560M)。
  • LFM2.5‑Encoder‑230M:平均得分 79.29,位列第 6,已超越 ModernBERT‑base(78.19)和所有 EuroBERT 系列。
  • CPU 性能:在 8K Token 场景下,230M 单次前向约 28 秒;对比 ModernBERT‑base 超过 90 秒,效率提升近 3 倍。

适用场景与部署

  1. 边缘与嵌入式设备:车载计算单元、工业控制器等无 GPU 环境。
  2. 受监管的本地系统:金融、医疗、法律等对数据隐私和长文档处理有严格要求的行业。
  3. 高吞吐、低成本流水线:在大型生成模型前作第一层过滤,显著降低整体算力开销。

使用指南

  • 加载方式:通过 transformersLfm2BidirectionalModelLfm2BidirectionalForMaskedLM,需设置 trust_remote_code=True
  • Fine‑tune:模型仅提供通用表示,实际任务仍需微调;Liquid AI 提供 8K 长文档微调示例,涵盖合同、病历等场景。
  • Demo:官方在 Hugging Face Space 上公开了五个 CPU‑only 演示,包括零样本路由、政策检查、拼写纠错以及基于掩码扩散的聊天机器人。

关键要点

  • 开源双向编码器,8K Token 上下文,CPU 推理保持高速;
  • 350M 在多任务基准中排名第 4,表现仅次于更大模型;
  • 30% 高遮罩率与非因果卷积是性能提升核心;
  • 适用于边缘、合规与高吞吐场景,提供完整加载与微调教程。

“长文本理解不再是算力的硬性门槛,LFM2.5 编码器让 CPU 也能高效工作。” — Liquid AI 官方博客

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。