Tag: inference
-
【AI 工业核题 I4】Beam Search 束搜索(束宽更新与长度惩罚)(Beam Search Decoding with Length Penalty)深度实现与原理解析
机器翻译与语音识别经典确定性搜索,保持前 Beam_Width 个最高累计对数似然候选路径。
-
【AI 工业核题 I3】投机解码(Speculative Decoding 验证与接收拒绝)(Speculative Decoding Verification & Accept/Reject)深度实现与原理解析
小草稿模型极速猜测 K 步,大目标模型单次并行前向验证,保证输出数学分布 100% 无损等价。
-
【AI 工业核题 I2】大模型生成采样器(Temperature + Top-K + Top-P)(LLM Generation Sampler (Temperature, Top-K & Top-P))深度实现与原理解析
现代大模型输出控制核心三剑客,温度调节概率尖锐度,Top-K 截断前 K 项,Top-P 动态核采样累计概率。
-
【AI 工业核题 I1】INT8 仿射与对称量化(Scale 与 Zero-Point)(INT8 Affine & Symmetric Quantization)深度实现与原理解析
模型推理加速标配,浮点 FP32 到低位整数 INT8 的映射与反量化重构。
-
【AI 工业核题 D4】KV Cache 自回归生成推理(增量更新与状态拼接)(KV Cache Autoregressive Generation Loop)深度实现与原理解析
将自回归推理复杂度由 O(S^2) 降至 O(S) 的工程生命线,Prefill 预填充与 Decode 增量步骤实现。