文章目录

2448 字
12 分钟
文章目录

全部文章#

分类标题
FPGA 加速器HG-PIPE 完全拆解:混合粒度流水线,让 FPGA 把 ViT 跑到 7118 FPS(ICCAD 2024)
FPGA 加速器FPGA 加速器完全拆解(一):可重构硬件、设计空间与经典推理引擎
FPGA 加速器FPGA 加速器完全拆解(二):LLM 推理的前沿技术——FlightLLM、CXL-SpecKV 与 LightMamba
AI 芯片架构TPU v1 完全拆解(一):为推理而生的领域专用架构与指令集
AI 芯片架构TPU v1 完全拆解(二):脉动阵列、weight-stationary 数据流与 Roofline 性能归因
AI 芯片架构Hot Chips 2026 全景拆解:Agentic AI 时代,CPU、GPU 与内存的重新分工
AI 芯片架构H³ 完全拆解:HBM 与高带宽闪存(HBF)混合架构如何驯服长上下文推理的内存墙
AI 芯片架构OpenAI Jalapeño 完全拆解:9 个月从零到流片,凭什么超越英伟达 Blackwell
FlashAttentionFlashAttention 完全拆解(四):FlashAttention-4——面向 Blackwell 的算法-流水线协同设计
FlashAttentionFlashAttention 完全拆解(一):IO 感知与分块注意力算法
FlashAttentionFlashAttention 完全拆解(二):序列维并行、Warp 工作划分与 FlashDecoding
FlashAttentionFlashAttention 完全拆解(三):Warp 特化异步流水线与 FP8 低精度
注意力优化BLASST:一个标量阈值实现的动态块稀疏注意力(MLSys 2026)
注意力优化MAC-Attention:Match-Amend-Complete 注意力复用,长上下文解码 KV 读取最高减少 99%(MLSys 2026)
注意力优化CLAA:跨层注意力聚合,长上下文 Prefill 的 TTFT 最高降低 39%(2026)
注意力优化GQA 完全拆解:分组查询注意力,用 1/8 的 KV 缓存保住 MHA 的质量
注意力优化NSA 原生稀疏注意力(一):压缩-选择-滑窗三分支架构
注意力优化NSA 原生稀疏注意力(二):Triton Kernel 设计与 27B 模型实验
注意力优化Prefix Sliding 完全拆解:前缀 + 滑窗,恒定 KV 内存下的超长推理测试时扩展
注意力优化DeepSeek-V4 混合注意力完全拆解:CSA + HCA + 滑窗,百万上下文如何便宜 10 倍
注意力优化RoPE 完全拆解:旋转位置编码的原理、实现与长度外推
注意力优化LongCat Sparse Attention(LSA)完全拆解:驯服闪电索引器的三件套——相比 NSA/DSA 真的改进了吗
注意力优化SWA 滑窗注意力完全拆解:只加 4 个 attention sink,零训练反超后训练线性注意力
KV CacheQEvict:三档可恢复 KV 缓存,对抗长上下文解码中的注意力漂移
KV CacheMLA 完全拆解:DeepSeek 低秩 KV 压缩注意力的原理与全部实现细节
KV CachePagedAttention 完全拆解:操作系统分页思想如何拯救 LLM 推理的内存利用率
KV CacheKIVI 完全拆解:非对称 2-bit KV Cache 量化,为什么 Key 按通道、Value 按 token
KV CacheH2O 完全拆解:抓住 KV Cache 里的「重击者」,20% 预算无损生成(NeurIPS 2023)
KV CacheStreamingLLM 完全拆解:attention sink 与大模型的无限流式生成
KV CacheSnapKV 完全拆解:LLM 在生成之前就知道你在找什么——观察窗口投票与聚类压缩 Prompt KV(NeurIPS 2024)
KV CacheKVQuant 完全拆解:预旋转逐通道量化、敏感度加权非均匀码本与稀疏离群值,3-bit KV Cache 如何近无损(NeurIPS 2024)
投机解码DSpark:半自回归生成与置信度调度的投机解码
投机解码DFlash 块扩散解码:以并行扩散替代自回归草稿,实现无损 6 倍推理加速
投机解码MTP 完全拆解:多 token 预测如何让 DeepSeek 自带草稿模型
投机解码S²-MoE 完全拆解:路由感知自适应扩展与复用感知门控,端侧 MoE 自投机解码提速最高 5.3 倍
推理服务系统ExpertPlex:共享专家、分离注意力,MoE 高吞吐推理服务的新架构
推理服务系统Blink:把 CPU 请出推理关键路径——SmartNIC 与 GPU 常驻内核的 CPU-Free 服务架构(2026)
推理服务系统TokenWeave:粗粒度 Token 切分与融合 AllReduce-RMSNorm,张量并行推理延迟最高降 29%(MLSys 2026)
推理服务系统DualPath 完全拆解:双路径 KV-Cache 加载,把解码引擎的闲置网卡变成智能体推理加速器(SIGCOMM 2026)
推理服务系统FreeToken 完全拆解:带宽自适应执行,让 8GB 笔记本跑 35B、单卡工作站跑 753B 的边缘 MoE 服务系统
推理服务系统跨模型 KV 缓存转移(Cross-Model KV Transfer):闭式线性映射与 Prefill 复用
推理服务系统连续批处理完全拆解:Orca 的迭代级调度与选择性批处理,如何把 LLM 服务吞吐提升 36.9 倍
推理服务系统DeepSeek-V3/R1 推理系统完全拆解:跨节点专家并行、双批重叠与负载均衡
推理服务系统RadixAttention 完全拆解:用前缀树自动复用 KV Cache,让共享前缀只计算一次
推理服务系统TileRT 完全拆解:tile 级常驻执行引擎,如何把 671B 到 1T 参数的模型压进毫秒级解码
推理服务系统LLM 推理 Benchmark 完全指南:评价指标、主流基准与评测方法论
推理服务系统Training-Free Looped Transformers 完全拆解:免训练测试时循环,让冻结 LLM 多想几遍
推理服务系统Mostik 完全解析:753B 只读题、4B 只作答——跨模型潜空间桥接的机制、账本与疑点
MoE 推理TEAM 完全拆解:时空一致性引导专家激活,MoE 扩散语言模型推理加速 2.2 倍(ICML 2026)
MoE 推理DeepSeek 技术全景:从 67B 稠密模型到 1.6T 稀疏模型的三年演进
MoE 推理DeepSeekMoE 完全拆解:细粒度专家切分与共享专家隔离
MoE 推理DeepEP 完全拆解:DeepSeek 开源通信库如何把 MoE 推理的 dispatch/combine 压到硬件极限
模型量化XFP:质量地板驱动的自适应码本量化——3.4 位在双卡工作站跑通 397B MoE
模型量化AWQ 完全拆解:只保护 1% 的显著权重,4-bit 量化如何接近无损
模型量化GPTQ 完全拆解:二阶信息驱动的权重量化,如何把 175B 模型塞进一张 A100
模型量化SmoothQuant 完全拆解:激活量化难度的数学等价迁移,如何实现无损 W8A8 推理
模型量化LLM.int8() 完全拆解:系统离群值的涌现与混合精度分解,175B 模型的 8-bit 无损推理
模型量化QuaRot 完全拆解:旋转坐标系根除激活离群值,LLM 端到端 W4A4KV4 推理的数学魔法
模型量化AdaRound 完全拆解:为什么四舍五入不是最优权重量化——软舍入与逐层重构(ICML 2020 经典)
答疑答疑特辑:秩与 SVD、RoPE 旋转矩阵、投机解码原理与 AI 芯片全景
答疑答疑特辑(二):浮点数五问——无限循环小数、spacing at 1、Python 精度与舍入方式详解
答疑答疑特辑(三):矩阵秩的参数计数、TPU 训练架构与 AI 芯片算力全景
答疑答疑特辑(四):全场景机器人、共享 KV cache 与 agent harness 三问
答疑AI 编译器开发工程师:一条计算图如何变成 GPU Kernel——岗位工作流与硬核知识体系
数学基础浮点数与数值稳定性:从 IEEE 754 到 FP8 的 LLM 精度世界
数学基础信息论基础:熵、交叉熵与 KL 散度——LLM 推理中无处不在的数学
数学基础数值线性代数(一):高斯消元、LU 分解与「不要显式求逆」
数学基础特征值与特征向量:矩阵的谱、几何直觉与 LLM 推理中的身影
具身智能具身智能完全入门:从会聊天的 AI 到会干活的机器人
具身智能人形机器人必答题:为什么要人形?双足、灵巧手与「玩具论」的完整回应
GPU 编程与 KernelGPU GEMM 优化完全拆解(一):从朴素 Kernel 到共享内存分块
GPU 编程与 KernelGPU GEMM 优化完全拆解(二):寄存器分块、向量化访存与 Warp Tiling
GPU 编程与 KernelGPU GEMM 优化完全拆解(三):Tensor Core、MMA/wgmma 指令与异步流水线
GPU 编程与 KernelDeepGEMM 完全拆解:300 行 FP8 GEMM 内核,如何逼近 Hopper 的算力峰值
行业观察2026 大模型市场全景调查:主流模型能力、参数量与 API 价格总表
职位介绍大模型推理框架开发工程师:岗位地图、开发工作流与硬核知识体系

他山之石#

分类标题
AI 芯片架构H³ 完全拆解:HBM 与高带宽闪存(HBF)混合架构如何驯服长上下文推理的内存墙
推理服务系统FreeToken 完全拆解:带宽自适应执行,让 8GB 笔记本跑 35B、单卡工作站跑 753B 的边缘 MoE 服务系统
推理服务系统跨模型 KV 缓存转移(Cross-Model KV Transfer):闭式线性映射与 Prefill 复用
注意力优化Prefix Sliding 完全拆解:前缀 + 滑窗,恒定 KV 内存下的超长推理测试时扩展

SEC LAB#

分类标题
FPGA 加速器HG-PIPE 完全拆解:混合粒度流水线,让 FPGA 把 ViT 跑到 7118 FPS(ICCAD 2024)
MoE 推理TEAM 完全拆解:时空一致性引导专家激活,MoE 扩散语言模型推理加速 2.2 倍(ICML 2026)
投机解码S²-MoE 完全拆解:路由感知自适应扩展与复用感知门控,端侧 MoE 自投机解码提速最高 5.3 倍

Talk#

分类标题
推理服务系统TileRT 完全拆解:tile 级常驻执行引擎,如何把 671B 到 1T 参数的模型压进毫秒级解码

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

文章目录
https://pinghaoyang.com.cn/aigc/posts/catalog/
作者
平昊阳
发布于
2026-08-10
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
平昊阳
乘长风,破巨浪, 展鸿图于未央!
--
总访问量
--
访客数
公告
欢迎来到我的个人博客!欢迎关注交流吖!
更多相关公告,见
社交-留言」。
音乐
封面

音乐

暂未播放

0:000:00
暂无歌词
站点统计
文章
118
分类
20
标签
164
总字数
1,050,769
运行时长
0
最后活动
0 天前

文章目录