Tag: module-m6
-
【AI 核心深度 M6-086】解释 FID 的定义与局限。(Fréchet Inception Distance (FID): Mathematical Formulation and Structural Limitations)深度数理推导与工程落地解析
FID 用真实与生成图像在 Inception 特征空间的高斯距离衡量质量;对特征分布假设与样本量敏感,且不测文本对齐。
-
【AI 核心深度 M6-087】解释 CLIP-score 与它的偏置。(CLIP-Score Evaluation Mechanics and Linguistic/Perceptual Biases)深度数理推导与工程落地解析
CLIP-score 用 CLIP 计算生成图与 prompt 的相似度,衡量’文本对齐’;但它有’偏好特定风格’的偏置,且不能测真实感。
-
【AI 核心深度 M6-088】解释人类偏好在生成评估中的地位与方法。(Human Preference Benchmarking, Elo Ratings, and Automated Multimodal Judges)深度数理推导与工程落地解析
人类偏好是黄金标准;通过成对比较(Elo/Bradley-Terry)或打分收集,成本高但是最终裁决;LLM/VLM-judge 可扩展但需校准。
-
【AI 核心深度 M6-089】解释生成评估中的多样性与保真度权衡。(The Diversity vs Fidelity Pareto Trade-off in Generative Evaluation)深度数理推导与工程落地解析
保真度(每张图是否真实/对题)与多样性(是否覆盖模式)存在张力;需分别度量(Precision/Recall)而非用单一指标。
-
【AI 核心深度 M6-090】解释商品图生成特有的评估维度。(Specialized Evaluation Metrics for E-Commerce Product Image Generation)深度数理推导与工程落地解析
除通用指标外,需评’本体保真度(结构/颜色/纹理/文字)’、’合规性’、’一致性’与’业务指标(点击/转化)’。
-
【AI 核心深度 M6-091】解释生成评估的统计显著性问题。(Statistical Significance, Sample Sizing, and Confidence Intervals in Generative Evaluation)深度数理推导与工程落地解析
生成评估的指标有方差(样本、种子、prompt);需报告置信区间、多种子、配对比较,避免’单点结论’。
-
【AI 核心深度 M6-092】解释视频生成相对图像生成的主要挑战。(Core Challenges of Video Generation Beyond 2D Image Synthesis: Temporal Consistency and Physics)深度数理推导与工程落地解析
时间一致性(帧间不闪烁)、运动建模、长时序依赖、以及 token 数与成本(帧数 × 每帧 token)。
-
【AI 核心深度 M6-093】解释视频生成中的时空注意力设计。(Spatio-Temporal Attention Architectures in Video Diffusion Models)深度数理推导与工程落地解析
三种设计:全时空注意力(最贵)、时空分离(先空间后时间)、以及分块/窗口;需在质量与成本间权衡。
-
【AI 核心深度 M6-094】解释 NeRF 与 3D Gaussian Splatting 的差异。(Neural Radiance Fields (NeRF) vs 3D Gaussian Splatting: Continuous Volumetric vs Discrete Primitives)深度数理推导与工程落地解析
NeRF 用 MLP 表示隐式辐射场(体积渲染,慢);3DGS 用显式高斯基元(光栅化,快且可实时)。
-
【AI 核心深度 M6-095】解释语音识别与 TTS 的基本流程。(Foundational Pipelines of Speech Recognition (ASR) and Text-to-Speech (TTS))深度数理推导与工程落地解析
ASR:音频 → 特征(mel)→ 编码器 → 解码文本(CTC/注意力/RNN-T);TTS:文本 → 声学模型 → 声码器 → 波形。