AIGC

AIGC目录
AIGC 板块文章目录。
Cover Image of the Post
人形机器人必答题:为什么要人形?双足、灵巧手与「玩具论」的完整回应
逐条回应人形机器人五大质疑:环境适配、双足与轮式之争、手指与夹爪之辩、「宇树是玩具厂商吗」与商业化真相。
Cover Image of the Post
HG-PIPE 完全拆解:混合粒度流水线,让 FPGA 把 ViT 跑到 7118 FPS(ICCAD 2024)
拆解北大 HG-PIPE:混合粒度流水线消除气泡、LUT 算子替代 DSP,FPGA 上比 V100 快 2.81 倍的 ViT 加速器
Cover Image of the Post
TEAM 完全拆解:时空一致性引导专家激活,MoE 扩散语言模型推理加速 2.2 倍(ICML 2026)
拆解 TEAM:延迟缓存、投机探索与受限激活三策略协同,MoE 扩散模型最高 2.2 倍推理加速。
Cover Image of the Post
跨模型 KV 缓存转移(Cross-Model KV Transfer):闭式线性映射与 Prefill 复用
同族模型间的 KV 缓存近似线性相关,闭式岭回归映射让小模型算好的 KV 直接喂给大模型,跳过 Prefill。
Cover Image of the Post
FreeToken 完全拆解:带宽自适应执行,让 8GB 笔记本跑 35B、单卡工作站跑 753B 的边缘 MoE 服务系统
拆解 FreeToken 的 q* 带宽自适应策略、语义感知缓存与弹性显存管理,边缘设备如何跑起前沿 MoE 模型。
Cover Image of the Post
数值线性代数(一):高斯消元、LU 分解与「不要显式求逆」
从范数补课到条件数几何直觉,完整推导高斯消元、主元策略与 LU 分解,理解为什么工程上从不显式求逆。
Cover Image of the Post
信息论基础:熵、交叉熵与 KL 散度——LLM 推理中无处不在的数学
从惊讶程度到比特:完整推导熵、交叉熵、KL 散度与困惑度,并落到量化评估、投机解码与温度采样的具体用法上。
Cover Image of the Post
GPU GEMM 优化完全拆解(二):寄存器分块、向量化访存与 Warp Tiling
寄存器分块让每线程算 64 个结果,向量化访存与 Warp Tiling 把 GEMM 推到 cuBLAS 的 93.7%。
Cover Image of the Post
答疑特辑(三):矩阵秩的参数计数、TPU 训练架构与 AI 芯片算力全景
回答四问:r(n+m−r) 的 −r 从哪来、TPU 如何训练 Gemini、TPU 与 B200/B300 的算力口径差、2026 年 GPU/TPU/NPU 全景。
Cover Image of the Post
FPGA 加速器完全拆解(二):LLM 推理的前沿技术——FlightLLM、CXL-SpecKV 与 LightMamba
拆解 FPGA 加速 LLM 推理的三条前沿路线:FlightLLM 完整映射流程、CXL-SpecKV 投机 KV 缓存与 LightMamba 量化硬件协同设计。
Cover Image of the Post
答疑特辑(二):浮点数五问——无限循环小数、spacing at 1、Python 精度与舍入方式详解
回答浮点数文章收到的五个问题:无限循环小数与有理数、spacing at 1 与 ULP、Python 默认精度、各工具链舍入方式与银行家舍入。
Cover Image of the Post
GPU GEMM 优化完全拆解(一):从朴素 Kernel 到共享内存分块
从朴素 Kernel 讲起,拆解内存合并访问与共享内存分块两大优化,为什么 309 GFLOPS 能涨到 2980 GFLOPS。
Cover Image of the Post
具身智能完全入门:从会聊天的 AI 到会干活的机器人
零基础认识具身智能:感知-行动闭环、VLA 模型原理、数据与仿真、世界模型、人形机器人产业全景。
Cover Image of the Post
FPGA 加速器完全拆解(一):可重构硬件、设计空间与经典推理引擎
从 LUT/DSP/BRAM 到 EIE、ESE 与 Brainwave,拆解 FPGA 加速深度学习推理的底层原理与经典设计。
Cover Image of the Post
浮点数与数值稳定性:从 IEEE 754 到 FP8 的 LLM 精度世界
从 IEEE 754 位布局、舍入误差到在线 softmax 与 FP8 缩放,讲透 LLM 推理中的数值精度问题。
Cover Image of the Post
DualPath 完全拆解:双路径 KV-Cache 加载,把解码引擎的闲置网卡变成智能体推理加速器(SIGCOMM 2026)
拆解 SIGCOMM 2026 的 DualPath:让解码引擎直读 KV-Cache 再经 RDMA 回传,离线吞吐最高提升 1.87 倍。
Cover Image of the Post
答疑特辑:秩与 SVD、RoPE 旋转矩阵、投机解码原理与 AI 芯片全景
为 MLA、DSpark/DFlash、TPU v1 三篇读者答疑:线性代数基础、投机解码原理与 AI 芯片全景对比。
Cover Image of the Post
TPU v1 完全拆解(二):脉动阵列、weight-stationary 数据流与 Roofline 性能归因
从脉动阵列的时序原理、三种数据流模式到 Roofline 性能模型,彻底解释 92 TOPS 的 MXU 为何平均只用 28%。
Cover Image of the Post
TPU v1 完全拆解(一):为推理而生的领域专用架构与指令集
从芯片架构、内存层次到 CISC 指令集,拆解 Google 第一代 TPU 如何用 15 个月造出推理专用 ASIC。
Cover Image of the Post
PagedAttention 完全拆解:操作系统分页思想如何拯救 LLM 推理的内存利用率
从 KV Cache 内存浪费讲起,彻底拆解 PagedAttention 的分块存储、块表、写时复制与 vLLM 的调度抢占。
Cover Image of the Post
MLA 完全拆解:DeepSeek 低秩 KV 压缩注意力的原理与全部实现细节
从低秩压缩、RoPE 解耦到矩阵吸收与 FlashMLA kernel,彻底讲透 MLA 的每个公式与实现细节。
Cover Image of the Post
TokenWeave:粗粒度 Token 切分与融合 AllReduce-RMSNorm,张量并行推理延迟最高降 29%(MLSys 2026)
拆解 MLSys 2026 的 TokenWeave:GPU 波感知粗粒度切分与融合 AllReduce-RMSNorm,TP 推理延迟最高降 29%。
Cover Image of the Post
Blink:把 CPU 请出推理关键路径——SmartNIC 与 GPU 常驻内核的 CPU-Free 服务架构(2026)
拆解 Blink:SmartNIC 直通 RDMA、GPU 常驻调度内核接管批处理,CPU 干扰下性能纹丝不动,P99 TTFT 最高降 8.47 倍。
Cover Image of the Post
CLAA:跨层注意力聚合,长上下文 Prefill 的 TTFT 最高降低 39%(2026)
拆解 CLAA:以答案回看注意力定义 token 真值重要性,跨层聚合修复排序不稳,TTFT 最高降低 39%。
Cover Image of the Post
MAC-Attention:Match-Amend-Complete 注意力复用,长上下文解码 KV 读取最高减少 99%(MLSys 2026)
拆解 MLSys 2026 的 MAC-Attention:复用相似查询的注意力摘要,解码 KV 读取最高减少 99%。
Cover Image of the Post
XFP:质量地板驱动的自适应码本量化——3.4 位在双卡工作站跑通 397B MoE
拆解 XFP 码本量化:稀疏离群值分离、双阈值自动选位与融合解码 kernel,3.4 有效位双卡跑通 397B MoE。
Cover Image of the Post
BLASST:一个标量阈值实现的动态块稀疏注意力(MLSys 2026)
拆解 MLSys 2026 的 BLASST:复用在线 Softmax 统计量跳过低贡献块,训练无关加速长上下文推理。
Cover Image of the Post
QEvict:三档可恢复 KV 缓存,对抗长上下文解码中的注意力漂移
拆解 QEvict 三档 KV 缓存:用可恢复 INT2 中间档与动态晋升,对抗长上下文解码中的注意力漂移。
Cover Image of the Post
ExpertPlex:共享专家、分离注意力,MoE 高吞吐推理服务的新架构
拆解 ExpertPlex 的自适应持久 kernel 与注意力发起的单边通信,如何在 MoE 服务中获得最高 2.01 倍吞吐。
Cover Image of the Post
DFlash 块扩散解码:以并行扩散替代自回归草稿,实现无损 6 倍推理加速
深入拆解 ICML 2026 论文 DFlash,从 KV 注入到块扩散去噪,理解如何用扩散模型替代自回归草稿生成。
Cover Image of the Post
DSpark:半自回归生成与置信度调度的投机解码
深入拆解 DeepSeek 与北大联合开源的 DSpark 框架,从半自回归草稿生成到置信度调度验证,揭示投机解码如何在生产环境中实现最高 85% 的生成加速。
Cover Image of the Post
FlashAttention-4:面向 Blackwell 的算法-流水线协同设计
深入拆解 FlashAttention-4 如何通过 warp 特化流水线、混合指数计算与条件 softmax 重缩放,在 Blackwell GPU 上将注意力计算推至矩阵乘法级别速度。
Cover Image of the Post
Profile Image of the Author
平昊阳
乘长风,破巨浪, 展鸿图于未央!
--
总访问量
--
访客数
公告
欢迎来到我的个人博客!欢迎关注交流吖!
更多相关公告,见
社交-留言」。
音乐
封面

音乐

暂未播放

0:000:00
暂无歌词
站点统计
文章
66
分类
16
标签
93
总字数
477,284
运行时长
0
最后活动
0 天前
最新动态
2026.07.06
岁次壬寅,序属季夏。负箧吴江,栖迟久泳。时维高考新败,登阊门而北望,临胥江以长嗟。昔者子安命蹇,尚能奋藻于滕阁;今吾才疏,岂可沉沦于吴市?乃焚膏以继晷,立雪而追贤。自暑月即研电学之微,探数理之奥。但求踔厉侪辈,砥砺锋芒。 洎乎素商既至,庠序始开。选修五门皆得满绩,总评冠绝同侪。然尘世难料,人心叵测。交非其人,悔吝丛生。一载相交,竟转瞬成参商。当是时也,恍若屈子见放,贾生受谗。然仲尼厄而作春秋,左丘眇而厥有国语。经此砥砺,竟愈宿疾:昔之曲意逢迎,今则坦荡自持;向之汲汲人言,今则泰然自若。所谓塞翁失马,焉知非福耶? 若夫玄冥司节,青阳启序。既专课业,复骋赛场。数模电赛,殚精竭虑;车赛集创,呕心镂骨。常观吴江夜月,每伴姑苏晨星。悬梁刺股,非为功名之累;凿壁囊萤,实怀鸿鹄之志。终使课业蝉联榜首,竞赛累获殊荣。然形神俱瘁,犹记寒宵病骨,强支案牍;伏暑昏眩,犹自深研不辍。 岁次甲辰,时逢白藏。绩点累年称冠,奖项盈箧成行。遂膺国奖之荣,如登龙门之津。乃遍谒名师,广求良策。拟鹏徙南冥,期凤鸣岐阳。幸得燕园李萌先生青眼,许列门墙。继入艾捷科芯实习,兼修毕业设计。两事交并,心力俱疲。承钟林峰师兄鼎力,终克难关。 今当辞别葑溪,将赴燕台。忆昔韩洪润学长,指迷津于暗夜;念吴圣洁挚友,伴苦读于寒窗。实乃天眷优渥,得遇诸君。昔者范公划粥,终成社稷之臣;欧母画荻,乃育文章之伯。予虽驽钝,敢不踵武前修?悟已往之不谏,知来者之可追。陶元亮归去来辞,实获我心;王子安穷且益坚,宁移素志?今将整装而北发,岂效楚囚之泣?当乘长风,破巨浪,展鸿图于未央!

文章目录