Tag: sparse-retrieval-bm25-tf-idf
-
【AI 核心深度 M7-004】解释 SPLADE 等学习式稀疏检索的思路(Explain the Principles and Architecture of Learned Sparse Retrieval Such as SPLADE)深度数理推导与工程落地解析
用 BERT + MLM 头 + ReLU + 稀疏正则,让每个词扩展为’词表上的稀疏权重’,兼具语义泛化与倒排索引效率。
-
【AI 核心深度 M7-005】解释稀疏检索的局限与改进方向(Explain the Limitations of Sparse Retrieval and Key Directions for Improvement)深度数理推导与工程落地解析
局限:无同义词/语义泛化、词汇失配(vocabulary mismatch)、无法处理拼写变体;改进:查询扩展、学习式稀疏、混合检索。
-
【AI 核心深度 M7-006】解释文档长度对检索打分的影响与处理(Explain the Impact of Document Length on Retrieval Scoring and Common Mitigation Strategies)深度数理推导与工程落地解析
长文档天然命中更多查询词(不公平优势);用长度归一化(BM25 的 b)、BM25F 的字段加权、或分块处理。
-
【AI 核心深度 M7-007】解释 BM25 的变体与改进(BM25+ / BM25F / 学习式权重)(Explain Key BM25 Extensions and Enhancements: BM25+, BM25F, and Learning-to-Rank Weights)深度数理推导与工程落地解析
BM25+ 修正长文档 TF 饱和下限;BM25F 做多字段加权;学习式权重用 LTR 学各部分权重。
-
【AI 核心深度 M7-001】写出 BM25 公式,并解释 k1 与 b 的作用(Write the BM25 Formula and Explain the Roles of Hyperparameters k1 and b)深度数理推导与工程落地解析
BM25 用饱和的 TF 与文档长度归一化加权 IDF;k1 控制 TF 饱和速度,b 控制长度归一化强度。
-
【AI 核心深度 M7-002】解释倒排索引的结构与查询流程(Explain the Structure and Query Processing Pipeline of an Inverted Index)深度数理推导与工程落地解析
倒排索引是’词 → 文档列表(含词频与位置)’的映射;查询时取各词列表求交/并,再按打分公式排序。
-
【AI 核心深度 M7-003】解释 TF-IDF 的动机与它的两个组成部分(Explain the Motivation Behind TF-IDF and Its Two Constituent Components)深度数理推导与工程落地解析
TF 衡量’词在文档中的重要度’、IDF 衡量’词的区分度’;两者相乘即’该词对该文档的权重’。