Tag: video-3d-audio-generative-models
-
【AI 核心深度 M6-092】解释视频生成相对图像生成的主要挑战。(Core Challenges of Video Generation Beyond 2D Image Synthesis: Temporal Consistency and Physics)深度数理推导与工程落地解析
时间一致性(帧间不闪烁)、运动建模、长时序依赖、以及 token 数与成本(帧数 × 每帧 token)。
-
【AI 核心深度 M6-093】解释视频生成中的时空注意力设计。(Spatio-Temporal Attention Architectures in Video Diffusion Models)深度数理推导与工程落地解析
三种设计:全时空注意力(最贵)、时空分离(先空间后时间)、以及分块/窗口;需在质量与成本间权衡。
-
【AI 核心深度 M6-094】解释 NeRF 与 3D Gaussian Splatting 的差异。(Neural Radiance Fields (NeRF) vs 3D Gaussian Splatting: Continuous Volumetric vs Discrete Primitives)深度数理推导与工程落地解析
NeRF 用 MLP 表示隐式辐射场(体积渲染,慢);3DGS 用显式高斯基元(光栅化,快且可实时)。
-
【AI 核心深度 M6-095】解释语音识别与 TTS 的基本流程。(Foundational Pipelines of Speech Recognition (ASR) and Text-to-Speech (TTS))深度数理推导与工程落地解析
ASR:音频 → 特征(mel)→ 编码器 → 解码文本(CTC/注意力/RNN-T);TTS:文本 → 声学模型 → 声码器 → 波形。
-
【AI 核心深度 M6-096】解释统一多模态 token 化的挑战。(Challenges and Trade-offs of Unified Multimodal Tokenization)深度数理推导与工程落地解析
把文本/图像/音频/视频统一为同一套 token(离散或连续);挑战是’离散化损失’、’模态失衡’与’序列长度爆炸’。
-
【AI 核心深度 M6-097】解释全模态模型的评估难点。(Evaluation Methodologies and Holistic Benchmarking in Omni-Modal Models)深度数理推导与工程落地解析
需覆盖多模态理解与生成、跨模态任务与模态缺失;且各模态指标不可直接比较、评估成本高。