LiquidAI发布LFM2.5编码器:CPU上实现超长上下文高速推理

1 阅读6分钟前沿
LiquidAI发布LFM2.5编码器:CPU上实现超长上下文高速推理

背景与意义

在大模型时代,长上下文处理仍是算力瓶颈。LiquidAI 在上月发布的 LFM2.5‑Retriever 已证明多语言检索可在 8k token 规模下保持高效,本次推出的 LFM2.5‑Encoder 系列则将这一思路扩展到通用编码任务,帮助企业在现有 CPU 资源上完成文档级别的分类、意图路由和敏感信息检测。

模型概览

  • 模型规模
    • LFM2.5‑Encoder‑230M(约 0.23 B 参数)
    • LFM2.5‑Encoder‑350M(约 0.35 B 参数)
  • 上下文长度:最高 8,192 token,随输入增长的延迟增长率远低于传统 BERT 系列。
  • 开源许可:模型权重和训练代码全部开放,已同步至 Hugging Face Hub。

架构创新

  1. 双向注意力掩码:在原有因果解码器的基础上,改为双向掩码,使每个 token 同时关注左右两侧信息。
  2. 对称短卷积:卷积层采用对称填充,实现局部双向感受野,提升短距离依赖捕获能力。
  3. 30% 掩码率的 MLM 预训练:保持与 BERT 类似的语言建模目标,同时在 1,024‑token 短上下文上进行首次预训练,随后扩展至 8,192‑token 长上下文。

基准评测

LiquidAI 对 14 种模型在 17 项任务(包括 GLUE、SuperGLUE 与多语言分类)上进行了全量微调并报告均值分数。结果显示:

  • LFM2.5‑Encoder‑230M 在所有指标上均超过 ModernBERT‑base,且参数更小。
  • LFM2.5‑Encoder‑350M 排名第 4,仅次于体积约 3.5 B 的大模型,性能接近但成本仅为其十分之一。

CPU 与 GPU 推理速度对比

模型1k token4k token8k token设备
ModernBERT‑base12 ms58 ms1 min 30 sCPU (x86)
LFM2.5‑Encoder‑230M11 ms45 ms28 sCPU (x86)
LFM2.5‑Encoder‑350M13 ms52 ms32 sCPU (x86)

在 GPU 环境下,两者同样在约 2k token 以上开始超越 ModernBERT‑base,只是提升幅度相对较小。

实际演示

LiquidAI 在 Hugging Face Spaces 提供了四个零样本(zero‑shot)Demo:

  • Prompt Routing:将任意文本一次性匹配到多条路由规则。
  • Policy Linting:基于公司政策的自由文本检查。
  • 拼写纠错:逐字符纠错。
  • PII 检测:支持 16 种语言的 40 类个人信息识别。

此外,还演示了 Masked‑Diffusion 文本生成,即将编码器作为迭代式解码器使用,展示了其在生成任务上的潜力。

快速上手指南

from transformers import AutoModelForMaskedLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-Encoder-230M"  # 或 "...-350M"
 tokenizer = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True)
 model = AutoModelForMaskedLM.from_pretrained(model_id, trust_remote_code=True)
 text = f"The capital of France is {tokenizer.mask_token}."
 inputs = tokenizer(text, return_tensors="pt")
 with torch.no_grad():
     logits = model(**inputs).logits
 pos = (inputs["input_ids"][0] == tokenizer.mask_token_id).nonzero()[0].item()
 print(tokenizer.decode(logits[0, pos].topk(5).indices.tolist()))

如需在特定任务上微调,只需加载 AutoModel 并在其上挂载分类头或序列标注头,LiquidAI 同时提供了基于 Flash‑Attention 2 的 GPU 加速示例。

行业影响

  • 成本压缩:在 CPU 上即可完成 8k token 文档的完整推理,单次推理耗时 <30 秒,适合大规模合同、客服对话等日常业务。
  • 生态兼容:模型基于 Hugging Face Transformers,直接兼容现有的微调流水线和部署框架。
  • 开源推动:开放权重与训练脚本,为学术界和企业提供了可复现的长上下文基准。

展望

随着硬件算力趋于饱和,模型架构的效率提升将成为下一波竞争焦点。LFM2.5‑Encoder 展示了在保持参数规模不变的前提下,通过注意力掩码与卷积设计实现“长上下文+低成本”双赢的可能。后续 LiquidAI 计划进一步探索 INT8/ONNX 导出以及多核 EPYC 环境的微调加速,以满足更大规模的企业级部署需求。


本文内容基于 LiquidAI 官方博客(2026‑07‑28),所有实验数据均已在 Hugging Face 上公开。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。