ENTITY
BGE系列模型
基本定义
BGE系列模型是北京智源研究院(BAAI)开源的嵌入与重排模型家族,是中文RAG检索增强生成场景应用最广泛的模型系列之一,也是RAG场景Embedding模型选型方法中的主流默认选择。
核心子模型
BGE系列包含三类定位不同的核心子模型,可覆盖绝大多数中文检索场景需求:
BGE-M3
定位为通用场景首选模型,支持中英多语言,最大上下文窗口为8192token,同时支持稠密向量检索、稀疏向量检索、ColBERT式多向量检索三种模式,无特殊场景限制时可直接选用该模型,无需额外调试即可获得较好的检索效果。
BGE-large-zh
纯中文专项大尺寸模型,仅支持中文输入,上下文窗口为512token,在纯中文短文档(单条文本长度低于512token)场景下的检索精度略高于BGE-M3,适合无多语言需求、文档切片长度较短的垂直业务场景。
BGE-Reranker
同系列Cross-Encoder架构重排模型,分为base、large两个尺寸,中文场景重排效果领先,和BGE系列嵌入模型搭配使用时,因训练数据分布、语义空间一致性更高,效果优于跨系列模型搭配。
性能表现
BGE系列模型长期位居MTEB文本嵌入评测榜单的中文分支(C-MTEB)检索子任务榜单前列,在通用中文、中英混合场景的检索精度表现优于多数同尺寸开源嵌入模型。
适用场景与边界
适用场景
- 通用中文/中英混合RAG场景:优先选择BGE-M3,是绝大多数项目的默认选型;
- 纯中文短文档场景:可选择BGE-large-zh获得更高检索精度;
- 重排阶段配套:配合同系列BGE-Reranker使用,遵循RAG两阶段检索架构流程,先用BGE嵌入模型从全量知识库快速召回Top100候选片段,再用BGE-Reranker精排取Top5输入大模型生成回答。
边界例外
若业务场景以非中英的多语言为主、或需部署在资源受限的边缘设备,可参考GTE系列模型、E5系列等其他嵌入模型进行选型。
相关条目
- 阿里面试官怒了:Embedding模型都不会选,BGE和GTE
- RAG场景Embedding模型选型方法
- RAG两阶段检索架构
- MTEB文本嵌入评测榜单
- GTE系列模型