Tag: information-theory
-
【AI 核心深度 M1-065】解释 JS 散度与它相对 KL 的改进。(Explain Jensen-Shannon (JS) Divergence and Its Structural Improvements Over KL Divergence)深度数理推导与工程落地解析
JS = KL 的对称化平滑版本,取值 [0, log2],有界且对称;但两个分布支撑不重叠时仍饱和。
-
【AI 核心深度 M1-066】什么是 Wasserstein 距离?为什么 GAN 用它?(Define Wasserstein Distance (Earth Mover’s Distance) and Why WGAN Relies on It)深度数理推导与工程落地解析
推土机距离:把分布 p 搬到 q 的最小代价;即使支撑不重叠也有连续梯度。
-
【AI 核心深度 M1-067】解释最大熵原理与它在机器学习中的应用。(Explain the Principle of Maximum Entropy and Its Applications in Statistical Learning)深度数理推导与工程落地解析
在满足已知约束的分布中选熵最大(假设最少)的;导出指数族与逻辑回归等形式。
-
【AI 核心深度 M1-068】解释数据处理不等式与它的含义。(Explain the Data Processing Inequality and Its Information-Theoretic Implications)深度数理推导与工程落地解析
若 X→Y→Z 构成马尔可夫链,则 I(X;Z) ≤ I(Y;Z) ≤ I(X;Y);处理不会增加信息。
-
【AI 核心深度 M1-069】什么是信息瓶颈(Information Bottleneck)?它如何解释表示学习?(Define the Information Bottleneck Principle and How It Explains Representation Learning in Deep Networks)深度数理推导与工程落地解析
在压缩输入(min I(X;Z))与保留预测力(max I(Z;Y))之间权衡;是表示学习的理论框架。
-
【AI 核心深度 M1-012】KL 散度为什么不对称?前向与反向 KL 在优化上有什么区别?(Explain Why KL Divergence is Asymmetric and Contrast the Optimization Behaviors of Forward vs. Reverse KL)深度数理推导与工程落地解析
KL(p‖q) ≠ KL(q‖p)。前向(moment-covering)逼 q 覆盖 p 的支撑;反向(mode-seeking)让 q 收缩到 p 的众数。
-
【AI 核心深度 M1-013】解释互信息与点互信息(PMI),它们分别用在哪里?(Define Mutual Information (MI) and Pointwise Mutual Information (PMI), and Detail Their Practical ML Applications)深度数理推导与工程落地解析
互信息衡量两变量共享的信息量;PMI 是单点对的信息贡献,MI 是 PMI 的期望。