免费 AI 目录
RAG MODEL GUIDE

Embedding 与 Rerank
到底怎么选

Embedding 负责大范围召回,Rerank 负责把候选结果重新排序。多数 RAG 系统不是二选一,而是前后配合。

最小可用链路

  1. 用 Embedding 把文档转成向量并写入向量库。
  2. 查询时召回相似度最高的一批候选文档。
  3. 用 Rerank 对问题和候选文档逐条打分。
  4. 把排序靠前的内容交给生成模型回答。

免费方案怎么选

小型中文知识库可以先用多语言 Embedding;当结果“相关但顺序不准”时再增加 Rerank。托管 API 省运维,本地开放权重更可控,但需要计算资源。

别忽略这些字段

向量维度、最大输入长度、批量大小、多语言能力、许可证和速率限制都会影响成本。模型榜单只提供入口,具体限制仍以来源页为准。

EMBEDDING + RERANK

10 个可核对入口