0xLucifer.AI
Home Posts /dev/log About
⌘K
↑↓ 导航 Enter 打开 Esc 关闭

推理优化

  • Continuous Batching:推理吞吐的翻倍密码
    Jul 6, 2026
    从 Static Batching 的"等最慢的人"到 Continuous Batching 的"随时进出"——用广告请求批处理的动态调度类比,彻底搞懂。
  • KV Cache 与 PagedAttention:推理的内存战争
    Jun 29, 2026
    为什么 KV Cache 是大模型推理的头号内存杀手?PagedAttention 如何用 OS 的分页思想解决——用广告正排索引的分层加载类比,彻底搞懂。
  • PD 分离:大模型推理的第一步优化
    Jun 22, 2026
    Prefill 和 Decode 为什么要分开部署?从计算特征到工程实践——用广告检索的召回/排序分离类比,一步拆透。
  • AI 芯片核心概念:用广告系统类比理解 NPU
    Jun 15, 2026
    算子、计算图、显存层次、流水线——用广告检索漏斗类比 AI 芯片底层逻辑。从 NPU 架构到算子调度,帮广告和推荐系统工程师快速理解 AI 芯片核心概念。

分类

  • Agent框架 (8)
  • Log (10)
  • 工程与管理 (40)
  • 广告系统 (10)
  • 推理优化 (4)
👁 6,661 · 👤 1,874
© 2026 0xLucifer
京ICP备2026041395号-1 · 公安备案 京公网安备11010502061737号