FREE EMBEDDING API · 2026

免费 Embedding API
先看 5 个官方入口

面向中文语义搜索与 RAG,优先比较免费层是否持续、批量限制、向量维度和数据使用方式,而不是只看模型名称。

快速答案

要持续免费的中文向量 API:Cloudflare Workers AI(BGE-M3 / Qwen3 Embedding)每天有共享免费额度;要 Google 生态:Gemini Embedding 免费层可直接用,但免费层输入可能用于改进产品;只做临时原型:Cohere Evaluation Key 或 Jina 新用户额度更省事;低频任务可以用 Hugging Face 每月小额额度。敏感语料先核对各平台的数据使用条款。

5 个入口怎么选

Gemini Embedding 2

Google 官方价格页当前把文本、图片、音频和视频输入列为 Free Tier 免费;免费层内容可能用于改进产品。

查看模型入口 →

Cloudflare Workers AI

BGE-M3 与 Qwen3 Embedding 0.6B 当前均按每百万输入 Token 1,075 Neurons 计量,共享每天 10,000 Neurons 免费额度。

查看 Workers AI 入口 →

Hugging Face

Free 用户当前每月获得 0.10 美元 Inference Providers 额度,可用于符合条件的 Feature Extraction 路由;额度和可用 Provider 会变化。

查看 HF 入口 →

Cohere 与 Jina 补充入口

Cohere Embed 4

免费 Evaluation key 可用于原型,Embed 端点按输入速率和每月调用量限流。

查看免费规则 →

Jina Embeddings v4

新用户当前获得 10M 免费 tokens,支持多语言文本、图片和 PDF 向量。

查看免费规则 →

Cloudflare 免费额度能处理多少

按官方当前单价,如果 10,000 Neurons 全部只用于 BGE-M3 或 Qwen3 Embedding 0.6B,理论上约对应 930 万输入 Token。这个数字是按价格表计算的上限,不是吞吐承诺;同一账户的其他 Workers AI 调用会共同消耗额度。

中文 RAG 的最低检查项

查看建库额度算例、请求体与模型迁移步骤 →

  1. 查询和文档是否使用同一模型、同一归一化方式。
  2. 模型是否明确支持中文或多语言,最大输入长度是否覆盖文档切片。
  3. 向量维度是否能被现有向量库接受,切换模型后是否需要重建索引。
  4. 免费层输入是否可能被用于改进产品,敏感资料不要直接进入不合适的免费通道。

官方来源

Gemini API 价格

核对免费层与数据使用 ↗

Workers AI 价格

核对 Neurons 单价 ↗

Hugging Face 额度

核对每月免费额度 ↗

HF Feature Extraction

查看 API 说明 ↗

资料审阅:2026-07-26。限额、地区和模型路由可能调整,使用前请重新打开来源页。

中文知识库怎么起步:先算额度,再建索引

本节核对日期:。以下为官方资料整理和假设算例,未调用付费或免费模型做性能测试。

免费向量模型和免费 API,是两种选择

本地开放权重

模型能下载,不等于有人免费托管推理。需要自行承担算力、部署和更新成本。数据需要留在自己的环境时,可先评估这条路径。

托管 Embedding API

注册平台并调用接口,受账户额度、速率、数据条款和路由可用性限制。适合先验证业务流程;后续仍需预算重建索引和在线查询成本。

按任务选择入口

证据:Gemini 定价与数据用途 · HF 额度及计费路径。Gemini 免费层内容可能用于改进产品,上传语料前核对适用条款。

算例:1 万个文档片段需要多少额度?

假设有 10,000 个片段,每段平均 500 输入 Token;当天还有 1,000 次检索,每个问题平均 50 Token。首次建库与查询共计 10,000 × 500 + 1,000 × 50 = 5,050,000 Token

Workers AI 价格页列出 BGE-M3 和 Qwen3 Embedding 0.6B 为每百万输入 Token 1,075 Neurons,因此该假设消耗约 5.05 × 1,075 = 5,428.75 Neurons,低于每日共享的 10,000 Neurons。其他模型调用、重复提交和重建索引都可能占用额度;Token 数应使用对应模型计数,不能把中文字符数直接代入。

免费额度在 00:00 UTC(北京时间 08:00)重置,和本站 06:15 日更时间不同。Workers Free 超出限制后请求失败,Paid 计划超出免费分配的用量会计费。额度够用不代表速率、延迟或并发一定满足需求。核对 Cloudflare 官方计量规则

最小接入流程

  1. 在平台控制台确认账户与模型权限,凭据仅保存在自己的服务端。
  2. 先用一段非敏感文本请求向量,核对响应成功标志、数量和维度。
  3. 为每段文档保存原文 ID、模型标识、切片版本和向量;查询也经过同一套模型与预处理。
  4. 先验证召回结果,再接生成模型;否则生成效果不好时难以定位问题。

Cloudflare BGE-M3 官方示例使用以下请求体,将它发送到官方文档指定的账户接口。这里不收集或代管 Key。

{ "text": ["退款申请需要订单号", "发票可在订单页面下载"] }

打开 BGE-M3 官方请求示例与参数。托管接口暴露的能力不一定覆盖开放权重模型的全部能力,按所用接口核对。

切换模型为什么不能只改模型名称?

相同维度不代表向量处于同一语义空间。迁移时建立独立索引,重新编码文档,并使用新模型编码查询;确认召回结果后再切换流量。旧索引保留到验证完成,便于回退。

给自己的知识库做一轮小检查

手工整理 20 个真实问题,提前标注应该命中的文档。每次只调整一个因素,例如切片长度或模型,记录前 5 条是否包含目标文档、无答案问题是否被误匹配,以及建库与查询用量。这是自己的验收样本,不是全网模型性能排名。

如果相关文档能召回却排序不理想,再阅读 Embedding 与 Rerank 的衔接方法。如果准备比较免费规则,查看 免费向量模型目录

想知道免费规则后续有没有变化?订阅免费模型变化 RSS;订阅内容覆盖整个模型目录。

EMBEDDING MODELS

6 个已收录向量模型

常见问题

哪个免费 Embedding API 最适合中文 RAG?

Cloudflare Workers AI 的 BGE-M3 与 Qwen3 Embedding 都明确支持中文等多语言,并共享每天 10,000 Neurons 免费额度;按 1,075 Neurons/百万输入 Token 计量,理论上限约 930 万输入 Token/天。

免费 Embedding API 的输入会被用于训练吗?

取决于平台条款。Gemini 官方说明免费层内容可能用于改进产品;敏感语料应先核对各平台的数据使用条款再决定通道。

Embedding 免费额度用完后会自动扣费吗?

Cloudflare Free 计划超额后请求失败;Hugging Face 每月小额额度用完即止。未绑定付款方式时一般不会产生费用,但仍以各平台实时条款为准。