FREE EMBEDDING API · 2026免费 Embedding API
先看 5 个官方入口
面向中文语义搜索与 RAG,优先比较免费层是否持续、批量限制、向量维度和数据使用方式,而不是只看模型名称。
快速答案
要持续免费的中文向量 API:Cloudflare Workers AI(BGE-M3 / Qwen3 Embedding)每天有共享免费额度;要 Google 生态:Gemini Embedding 免费层可直接用,但免费层输入可能用于改进产品;只做临时原型:Cohere Evaluation Key 或 Jina 新用户额度更省事;低频任务可以用 Hugging Face 每月小额额度。敏感语料先核对各平台的数据使用条款。
5 个入口怎么选
Gemini Embedding 2Google 官方价格页当前把文本、图片、音频和视频输入列为 Free Tier 免费;免费层内容可能用于改进产品。
查看模型入口 →
Cloudflare Workers AIBGE-M3 与 Qwen3 Embedding 0.6B 当前均按每百万输入 Token 1,075 Neurons 计量,共享每天 10,000 Neurons 免费额度。
查看 Workers AI 入口 →
Hugging FaceFree 用户当前每月获得 0.10 美元 Inference Providers 额度,可用于符合条件的 Feature Extraction 路由;额度和可用 Provider 会变化。
查看 HF 入口 →
Cohere 与 Jina 补充入口
Cohere Embed 4免费 Evaluation key 可用于原型,Embed 端点按输入速率和每月调用量限流。
查看免费规则 →
Jina Embeddings v4新用户当前获得 10M 免费 tokens,支持多语言文本、图片和 PDF 向量。
查看免费规则 →
Cloudflare 免费额度能处理多少
按官方当前单价,如果 10,000 Neurons 全部只用于 BGE-M3 或 Qwen3 Embedding 0.6B,理论上约对应 930 万输入 Token。这个数字是按价格表计算的上限,不是吞吐承诺;同一账户的其他 Workers AI 调用会共同消耗额度。
中文 RAG 的最低检查项
查看建库额度算例、请求体与模型迁移步骤 →
- 查询和文档是否使用同一模型、同一归一化方式。
- 模型是否明确支持中文或多语言,最大输入长度是否覆盖文档切片。
- 向量维度是否能被现有向量库接受,切换模型后是否需要重建索引。
- 免费层输入是否可能被用于改进产品,敏感资料不要直接进入不合适的免费通道。
官方来源
资料审阅:2026-07-26。限额、地区和模型路由可能调整,使用前请重新打开来源页。
中文知识库怎么起步:先算额度,再建索引
本节核对日期:。以下为官方资料整理和假设算例,未调用付费或免费模型做性能测试。
免费向量模型和免费 API,是两种选择
本地开放权重模型能下载,不等于有人免费托管推理。需要自行承担算力、部署和更新成本。数据需要留在自己的环境时,可先评估这条路径。
托管 Embedding API注册平台并调用接口,受账户额度、速率、数据条款和路由可用性限制。适合先验证业务流程;后续仍需预算重建索引和在线查询成本。
按任务选择入口
- 已有 Cloudflare 账户、准备做文本检索:核对 BGE-M3 或 Qwen3 Embedding 的参数与共享额度。
- 需要图片、音频与文本共同检索:Gemini Embedding 2 的 Standard 免费层覆盖这些输入类型;批处理价格是另一套规则,不能把 Standard 免费推导为 Batch 免费。
- 只想验证少量请求:Hugging Face Free 用户每月有 0.10 美元额度,且官方注明可能调整。额度适用于经 HF 路由的合格调用;自带 Provider Key 不使用这笔额度。
证据:Gemini 定价与数据用途 · HF 额度及计费路径。Gemini 免费层内容可能用于改进产品,上传语料前核对适用条款。
算例:1 万个文档片段需要多少额度?
假设有 10,000 个片段,每段平均 500 输入 Token;当天还有 1,000 次检索,每个问题平均 50 Token。首次建库与查询共计 10,000 × 500 + 1,000 × 50 = 5,050,000 Token。
Workers AI 价格页列出 BGE-M3 和 Qwen3 Embedding 0.6B 为每百万输入 Token 1,075 Neurons,因此该假设消耗约 5.05 × 1,075 = 5,428.75 Neurons,低于每日共享的 10,000 Neurons。其他模型调用、重复提交和重建索引都可能占用额度;Token 数应使用对应模型计数,不能把中文字符数直接代入。
免费额度在 00:00 UTC(北京时间 08:00)重置,和本站 06:15 日更时间不同。Workers Free 超出限制后请求失败,Paid 计划超出免费分配的用量会计费。额度够用不代表速率、延迟或并发一定满足需求。核对 Cloudflare 官方计量规则。
最小接入流程
- 在平台控制台确认账户与模型权限,凭据仅保存在自己的服务端。
- 先用一段非敏感文本请求向量,核对响应成功标志、数量和维度。
- 为每段文档保存原文 ID、模型标识、切片版本和向量;查询也经过同一套模型与预处理。
- 先验证召回结果,再接生成模型;否则生成效果不好时难以定位问题。
Cloudflare BGE-M3 官方示例使用以下请求体,将它发送到官方文档指定的账户接口。这里不收集或代管 Key。
{ "text": ["退款申请需要订单号", "发票可在订单页面下载"] }
打开 BGE-M3 官方请求示例与参数。托管接口暴露的能力不一定覆盖开放权重模型的全部能力,按所用接口核对。
切换模型为什么不能只改模型名称?
相同维度不代表向量处于同一语义空间。迁移时建立独立索引,重新编码文档,并使用新模型编码查询;确认召回结果后再切换流量。旧索引保留到验证完成,便于回退。
给自己的知识库做一轮小检查
手工整理 20 个真实问题,提前标注应该命中的文档。每次只调整一个因素,例如切片长度或模型,记录前 5 条是否包含目标文档、无答案问题是否被误匹配,以及建库与查询用量。这是自己的验收样本,不是全网模型性能排名。
如果相关文档能召回却排序不理想,再阅读 Embedding 与 Rerank 的衔接方法。如果准备比较免费规则,查看 免费向量模型目录。
想知道免费规则后续有没有变化?订阅免费模型变化 RSS;订阅内容覆盖整个模型目录。
EMBEDDING MODELS
6 个已收录向量模型
@cf/baai/bge-m3计入 Workers AI 每日免费 Neurons
多语言稠密向量
资料审阅:2026-08-27@cf/qwen/qwen3-embedding-0.6b计入 Workers AI 每日免费 Neurons
多语言轻量
资料审阅:2026-08-27gemini-embedding-2官方定价页列有免费层,限额以控制台为准
多模态向量API
资料审阅:2026-08-27embed-v4.0免费 Evaluation key 可用;Embed 试用限额按输入数和月度调用量计算
多语言多模态向量API
资料审阅:2026-08-27jina-embeddings-v4新用户当前获得 10M 免费 tokens;免费 Key 有 RPM、TPM 与并发限制
模型权重使用 Qwen Research License;官方 API 与本地权重的使用边界不同。
多语言多模态向量长文本
资料审阅:2026-08-27microsoft/harrier-oss-v1-0.6b符合条件的路由可使用每月免费额度
向量开放权重
资料审阅:2026-08-27常见问题
哪个免费 Embedding API 最适合中文 RAG?
Cloudflare Workers AI 的 BGE-M3 与 Qwen3 Embedding 都明确支持中文等多语言,并共享每天 10,000 Neurons 免费额度;按 1,075 Neurons/百万输入 Token 计量,理论上限约 930 万输入 Token/天。
免费 Embedding API 的输入会被用于训练吗?
取决于平台条款。Gemini 官方说明免费层内容可能用于改进产品;敏感语料应先核对各平台的数据使用条款再决定通道。
Embedding 免费额度用完后会自动扣费吗?
Cloudflare Free 计划超额后请求失败;Hugging Face 每月小额额度用完即止。未绑定付款方式时一般不会产生费用,但仍以各平台实时条款为准。