AirSOTA
Air School of Thoughts AtoZAirSOTA 知识矩阵:聚合大模型算法架构、科学育儿情境成长、加州地产考牌实战与全球数字化商业出海的权威专栏。
TalentMe · AI 学习与系统架构
工业级 AI 算法核心 69 题、前沿大模型系统架构演进与北美技术面试全流程备考深度长文。
【AI 核心深度 M2-055】推导/描述 EM 算法的两步,并说明为什么它单调提升似然。(Derive the Expectation-Maximization (EM) Algorithm and Prove Its Monotonic Likelihood Ascent via Jensen’s Inequality)深度数理推导与工程落地解析
E 步算后验责任度,M 步最大化期望完全数据对数似然;每轮提升(或不变)观测似然。
【AI 核心深度 M2-056】如何评估聚类质量(无标签)?内部与外部指标各有哪些。(Detail Unsupervised Clustering Evaluation: Internal Metrics vs. External Ground-Truth Metrics)深度数理推导与工程落地解析
内部:轮廓系数、DB 指数、CH 指数;外部(有标签):ARI、NMI、纯度。
【AI 核心深度 M2-057】解释 PCA 的目标与实现步骤。(Formulate Principal Component Analysis (PCA): Maximum Variance and Minimum Reconstruction Error Perspectives)深度数理推导与工程落地解析
找方差最大的正交方向;对中心化数据做协方差特征分解或 SVD,取前 k 个主成分。
【AI 核心深度 M2-058】PCA 与 SVD 的关系是什么?(Explain the Exact Mathematical Equivalence Between PCA and Singular Value Decomposition (SVD))深度数理推导与工程落地解析
对中心化矩阵 X 做 SVD,右奇异向量即主成分方向,奇异值平方/n 即方差。
【AI 核心深度 M2-059】PCA 有哪些局限?什么时候不该用 PCA。(Enumerate the Limitations of PCA and Scenarios Where Linear PCA Fails)深度数理推导与工程落地解析
只捕捉线性结构、对方差敏感、可解释性差、监督信息未用;不适合非线性流形与分类判别。
【AI 核心深度 M2-060】比较 t-SNE 与 UMAP 的原理与适用场景。(Compare t-SNE and UMAP: Manifold Assumptions, Global vs. Local Structure, and Computational Scaling)深度数理推导与工程落地解析
t-SNE 保持局部邻域概率分布(KL 最小化),适合可视化;UMAP 基于流形与拓扑,更快且更好保留全局结构。
【AI 核心深度 M2-061】如何选择降维后的维度?解释方差比例法的思路与局限(How to Choose Target Dimensions in Dimensionality Reduction? Variance Ratio Method and Limitations)深度数理推导与工程落地解析
选累计解释方差达 90–95% 的维度;但该准则与下游任务无关,最好用下游验证性能选择。
【AI 核心深度 M2-062】列举类别特征的常见编码方式及适用场景(Common Categorical Feature Encoding Methods and Applicable Scenarios)深度数理推导与工程落地解析
one-hot(低基数)、目标编码(高基数)、频率编码、哈希、嵌入(深度学习)。
【AI 核心深度 M2-063】为什么要对数值特征分箱?分箱方式有哪些(Why Bin Numerical Features? Common Binning Strategies and Use Cases)深度数理推导与工程落地解析
捕捉非线性、抗异常值、便于业务解释;等宽、等频、有监督(决策树/卡方)。
【AI 核心深度 M2-064】解释特征交互与多项式特征,什么时候需要(Feature Interactions and Polynomial Features: Concepts and Scenarios)深度数理推导与工程落地解析
线性模型无法捕捉交互,需显式构造 x_i·x_j;树模型可自动学习交互。
【AI 核心深度 M2-065】时间特征的工程要点有哪些?如何避免泄漏(Key Points in Time Feature Engineering and Preventing Temporal Leakage)深度数理推导与工程落地解析
滞后、滚动统计、周期性编码、时间差;必须保证只用过去信息(滚动窗口右对齐)。
【AI 核心深度 M2-066】什么是特征哈希(hashing trick)?它的优缺点(What is the Hashing Trick (Feature Hashing)? Pros and Cons)深度数理推导与工程落地解析
用哈希函数把高基数特征映射到固定维度,省内存、支持流式;代价是哈希冲突。
【AI 核心深度 M2-067】比较过滤式、包裹式与嵌入式特征选择(Comparing Filter, Wrapper, and Embedded Feature Selection Methods)深度数理推导与工程落地解析
过滤式按统计量排序(快但忽略模型);包裹式按模型性能搜索(准但贵);嵌入式在训练中选(如 L1/树重要度)。
【AI 核心深度 M2-068】为什么“去掉无用特征”有时反而降低性能?(Why Can Removing ‘Useless Features’ Sometimes Degrade Model Performance?)深度数理推导与工程落地解析
特征间存在交互与冗余;单看边际重要性会低估协同特征,且删特征可能破坏模型稳定性。
【AI 核心深度 M2-041】写出朴素贝叶斯的分类决策式,并说明’朴素’指什么。(Formulate Naive Bayes Classification Decision Rule and the Exact Nature of Its ‘Naive’ Assumption)深度数理推导与工程落地解析
假设特征在类别下条件独立;用后验 ∝ 先验 × 各特征似然之积分类。