AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M7-035】解释 GPU 加速的 ANN(如 CAGRA)与硬件协同(Explain GPU-Accelerated Approximate Nearest Neighbor Search (e.g., CAGRA) and Hardware Co-Design)深度数理推导与工程落地解析
把图搜索放到 GPU 上并行(CAGRA);适合高吞吐低延迟场景,但受显存与数据规模限制。
【AI 核心深度 M7-036】解释十亿级索引的分片与路由(Explain Sharding and Routing Strategies for Billion-Scale Vector Indices)深度数理推导与工程落地解析
把索引分到多机(按向量/按簇/按哈希);查询需’路由到相关分片’并’合并结果’;关键是减少需访问的分片数。
【AI 核心深度 M7-037】解释量化对 ANN 召回的影响与重排补偿(Explain the Impact of Vector Quantization on ANN Recall and Compensation via Full-Precision Re-Ranking)深度数理推导与工程落地解析
PQ/二值量化降低精度(召回下降);用’量化粗筛 + 全精度重排’补偿,使量化误差只影响候选集大小。
【AI 核心深度 M7-038】解释 cross-encoder 重排的原理与代价(Explain the Principles, Architectural Expressiveness, and Computational Cost of Cross-Encoder Re-Ranking)深度数理推导与工程落地解析
把查询与文档拼接后一起编码,充分交互 → 精度高;但无法预计算 → 每个候选一次前向(慢)。
【AI 核心深度 M7-039】解释 ColBERT 的延迟交互(Late Interaction)(Explain the Principles and Mechanisms of ColBERT Late Interaction (Contextualized Late Interaction over BERT))深度数理推导与工程落地解析
文档侧预计算 token 级向量,查询时用 MaxSim(每个查询 token 取与文档 token 的最大相似度再求和)→ 兼顾效率与精度。
【AI 核心深度 M7-040】解释重排模型的训练数据构造(Explain Training Data Construction, Negative Mining, and Distillation Protocols for Re-Ranking Models)深度数理推导与工程落地解析
用’(查询,正文档,负文档)’三元组或’(查询,文档,相关性等级)’训练;关键是难负样本与’蒸馏标注’。
【AI 核心深度 M7-041】解释多阶段排序架构的设计原则(Explain the Architectural Design Principles of Multi-Stage Ranking Pipelines)深度数理推导与工程落地解析
候选数逐级减少、模型逐级变强;每级的目标是’保证下一级的候选够好’(上游保召回、下游保精度)。
【AI 核心深度 M7-042】解释重排中的多样性与去重(Explain Diversity Promotion and Deduplication Strategies in Search and Re-Ranking)深度数理推导与工程落地解析
重排需在’相关性’之外考虑’多样性’(避免同质结果)与’去重’(近重复文档);用 MMR 或 DPP。
【AI 核心深度 M7-043】解释重排的延迟优化手段(Explain Latency and Throughput Optimization Techniques for Deep Re-Ranking Models)深度数理推导与工程落地解析
减小候选数、用小模型、蒸馏、批处理、ONNX/量化、级联、缓存、GPU、异步预取。
【AI 核心深度 M7-044】解释 LLM 重排(Listwise Reranking)的做法与代价(Explain the Methodologies, Advantages, and Operational Costs of LLM-Based Listwise Re-Ranking)深度数理推导与工程落地解析
用 LLM 对候选列表做 listwise 排序(或打分);效果强(能理解复杂相关性)但成本高、延迟大。
【AI 核心深度 M7-045】比较 Pointwise、Pairwise、Listwise 三种 LTR 方法(Compare Pointwise, Pairwise, and Listwise Learning-to-Rank (LTR) Methodologies)深度数理推导与工程落地解析
pointwise 逐个打分(忽略顺序)、pairwise 优化样本对顺序、listwise 直接优化列表指标。
【AI 核心深度 M7-046】解释 LambdaMART 的核心思想(Explain the Core Principles, Lambda Gradients, and GBDT Integration of LambdaMART)深度数理推导与工程落地解析
用 λ 梯度(含 |ΔNDCG| 权重)作为’伪梯度’,配合 GBDT 拟合;既优化排序指标又利用 GBDT 的强拟合能力。
【AI 核心深度 M7-018】解释 RRF(Reciprocal Rank Fusion)的原理与超参数 k 的作用(Explain the Principles of Reciprocal Rank Fusion (RRF) and the Role of Hyperparameter k)深度数理推导与工程落地解析
只用排名融合:score=Σ 1/(k+rank_i),k≈60;避免不同检索器分数尺度不可比的问题。
【AI 核心深度 M7-019】解释为什么混合检索通常优于单一方法(Explain Why Hybrid Retrieval (Sparse + Dense) Consistently Outperforms Single Retrieval Modalities)深度数理推导与工程落地解析
稀疏(精确匹配)与稠密(语义泛化)能力互补;查询类型多样时,混合能覆盖更多情况。
【AI 核心深度 M7-020】解释分数融合与排名融合的差异(Explain the Differences Between Score-Based Fusion and Rank-Based Fusion in Search Systems)深度数理推导与工程落地解析
分数融合用归一化后的分数加权(保留置信度但需正确归一化);排名融合用排名(鲁棒但丢信息)。