Marktechpost推出Token Saver让Claude文档查询成本降至99%并实现本地隐私保护

0 阅读4分钟开源
Marktechpost推出Token Saver让Claude文档查询成本降至99%并实现本地隐私保护

背景

在使用 Claude 处理长篇 PDF 时,文档会在每一次对话轮次中完整发送至模型,导致 token 消耗呈指数增长。Marktechpost AI 的研发团队在此痛点上推出了 Token Saver,一款 MIT 许可的 MCP 扩展,旨在通过本地检索只向 Claude 发送最相关的片段,从而大幅削减费用并保障数据隐私。

核心技术

Token Saver 采用 Local Hybrid RAG(本地混合检索)实现文档查询:

  • 关键词匹配 (BM25):利用 SQLite FTS5 引擎,对文档进行高效的词项检索,权重 0.4。
  • 语义匹配 (MiniLM‑L6‑v2):本地加载 all‑MiniLM‑L6‑v2 嵌入模型,计算余弦相似度,权重 0.6。
  • 两者加权融合后,仅返回 BM25+语义 双重过滤通过的段落。

整个流程包含八个阶段:提取 → 切块 → 打分 → 阈值过滤 → 去重 → 精简 → 预算控制 → 包装,每一步均在本机完成,Claude 只收到不超过 8,000 字符的精选文本。

性能与成本节约

在对标全量文档发送的基准下,Token Saver 在多份真实文档上实现了 92%‑99% 的 token 节约:

  • FDA 药品说明书:95.7% 节省
  • GDPR 合规文档:98.6% 节省
  • 法院判例 SFFA v. Harvard:99.4% 节省

这些数据基于 tiktoken 计数,且每次交互仅计一次 token,显著降低了长期使用 Claude 的费用。

隐私与安全

Token Saver 的安全模型围绕三大原则:

  1. 零上传:文档始终保留在本地硬盘。
  2. 文件夹白名单:仅能读取用户预先指定的文件夹,防止意外泄漏。
  3. 网络隔离:扩展通过标准 I/O 与 Claude Desktop 通信,无监听端口,攻击面极小。

快速上手指南

  1. 前往 GitHub Releases 下载 token-saver-ccr.mcpb
  2. 打开 Claude Desktop → Settings → Extensions → Install Extension,选择刚下载的文件。
  3. 启用后点击 Configure,指定专用 PDF 文件夹并勾选 Always allow
  4. 在对话中直接提问,Claude 将返回带页码的精准段落。

整个过程无需 Python 环境或复杂配置,即可在数分钟内部署完成。

影响与展望

Token Saver 的出现为企业、法律和科研等对文档安全有严格要求的场景提供了可行方案。随着 Claude 3.5 系列模型的持续迭代,Hybrid RAG 的检索质量和模型生成能力将进一步同步提升。未来,若将本地向量库规模化或引入多模态检索,Token Saver 有望在更广泛的文档类型(如图表、代码)上实现同等成本压缩。

“本地化检索加上精准的 token 控制,是大模型落地企业级应用的关键一步。” — Marktechpost AI 项目负责人


关键要点

  • 本地 Hybrid RAG 让 Claude 只接收必要文本,节省 90%‑99% token;
  • 完全本地化,确保文档隐私不泄露;
  • 单文件 .mcpb 安装包,无需额外环境,几分钟即可使用。
本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。