Baseten加入Hugging Face推理生态,开启模型即插即用新体验

0 阅读4分钟应用
Baseten加入Hugging Face推理生态,开启模型即插即用新体验

背景与意义

近日,Hugging Face 在官方博客中宣布,Baseten 正式成为其平台上的第三方 Inference Provider。此举标志着 Hugging Face 推理生态向多供应商开放迈出关键一步,开发者无需自行搭建服务器,即可在模型页面“一键”调用 Baseten 的无服务器推理能力,实现更快的原型迭代和产品落地。

功能与支持模型

  • 多任务覆盖:首批上线的任务包括对话式生成和文本生成,后续将陆续扩展至文本到语音、图像生成等。
  • 前沿模型集合:已对接的开源大模型包括 Kimi K3(Moonshot AI)、DeepSeek V4 Flash、GLM‑5.2 等,均可通过 Baseten 完成高效推理。
  • 统一 UI 与 SDK:在模型页面的右侧小部件中,用户可以直接切换 Baseten 与其他提供商;同时,Hugging Face 的 Python(huggingface_hub>=1.26.1)和 JavaScript(@huggingface/inference)SDK 已内置对 Baseten 的调用封装,无需额外代码改动。

使用方式

  1. 在用户设置中绑定 API Key:可自行填写 Baseten 的私有 API Key;若未填写,系统会自动走 Hugging Face 路由并使用 HF 账户计费。
  2. 模型页面选择:在支持的模型卡片下方,会出现已匹配的第三方提供商列表,用户可按偏好排序并选择 Baseten。
  3. 代码示例(Python):
import os
from openai import OpenAI
client = OpenAI(base_url="https://router.huggingface.co/v1", api_key=os.getenv("HF_TOKEN"))
resp = client.chat.completions.create(
    model="deepseek-ai/DeepSeek-V4-Flash-0731:baseten",
    messages=[{"role": "user", "content": "写一个返回第 n 项斐波那契数的递归函数。"}]
)
print(resp.choices[0].message)

对应的 JavaScript 示例同理,只需将 baseURL 指向同一路由即可。

计费与成本透明度

  • 自定义 Key 模式:请求直接发送至 Baseten,费用由 Baseten 账户结算,计费标准遵循 Baseten 官方定价。
  • HF 路由模式:请求先经 Hugging Face 转发,费用仍按 Baseten 实际使用量计费,平台不收取额外加价。
  • PRO 用户福利:每月可获 $2 推理额度,可跨供应商使用,进一步降低小规模实验成本。

行业影响与展望

Baseten 的加入为 Hugging Face 打造「模型即服务」的生态链提供了关键节点。开发者在选择推理提供商时拥有更大灵活性,尤其是对算力需求波动大的生成式 AI 场景,可根据成本、延迟或地域优势动态切换。与此同时,更多第三方供应商的加入将促使平台形成竞争性定价,推动整体算力成本下降,助力中小企业和创业团队快速落地 AI 产品。

"我们希望通过开放的推理提供商生态,让每一个模型都能在最合适的算力资源上运行,降低技术门槛。" — Hugging Face 官方声明

未来,Baseten 计划继续扩展支持的模型种类,并与 Hugging Face 合作推出统一的监控与优化工具,帮助用户在不同提供商之间实现无缝切换,进一步完善生成式 AI 的全链路服务。

本文是对第三方新闻源的主观解读。消息可能出现过时、不准确、歧义或错误的地方,仅供参考使用。点击此处查看消息源。