Archive
文章归档
当前共有 35 篇公开文章。
2026年7月
- · AI Coding 如何重构 ASIC 前端设计与验证:网页版演示文稿 · EDA 工具链
2026年6月
- · 第二十七课:GPU 架构学习总结与统一分析框架 · GPU 架构学习
- · 第二十六课:如何从零设计一个简化的 SIMT GPU · GPU 架构学习
- · 第二十五课:稀疏计算、不规则访存,以及 GPU 不擅长什么 · GPU 架构学习
- · 第二十四课:Transformer 中的 MLP、GEMM 与算子融合 · GPU 架构学习
- · 第二十三课:LayerNorm 和 RMSNorm 如何在 GPU 上实现 · GPU 架构学习
- · 第二十二课:Softmax 为什么难以高效,以及 FlashAttention 如何减少显存访问 · GPU 架构学习
- · 第二十一课:从低效 Reduction Kernel 到高性能归约 · GPU 架构学习
- · 第二十课:如何使用 Nsight Compute 分析 CUDA Kernel · GPU 架构学习
- · 第十九课:编译器如何优化 CUDA Kernel · GPU 架构学习
- · 第十八课:PTX、SASS 与 Compute Capability · GPU 架构学习
- · 第十七课:NVIDIA GPU 架构如何演进 · GPU 架构学习
- · 第十六课:从 GPU 框图理解完整芯片 · GPU 架构学习
- · 第十五课:GPU 如何渲染一幅三维图像 · GPU 架构学习
- · 第十四课:多 GPU 如何协同工作 · GPU 架构学习
- · 第十三课:GPU 为什么有多个调度层次 · GPU 架构学习
- · 第十二课:Block 如何分配到 SM,以及 Occupancy 由什么决定 · GPU 架构学习
- · 第十一课:GPU 的缓存、显存控制器与内存事务 · GPU 架构学习
- · 第十课:Tensor Core 与低精度计算 · GPU 架构学习
- · 第九课:GPU 如何执行神经网络卷积 · GPU 架构学习
- · 第八课:GPU 如何完成矩阵乘法 · GPU 架构学习
- · 第七课:GPU 是算力受限,还是带宽受限 · GPU 架构学习
- · 第六课:GPU 中的数据依赖、数据冒险与同步 · GPU 架构学习
- · 第五课:分支、谓词执行与 Warp 发散 · GPU 架构学习
- · 第四课:SM 内部结构与指令执行过程 · GPU 架构学习
- · 第三课:GPU 的存储层次 · GPU 架构学习
- · 第二课:GPU 程序是怎样被执行的 · GPU 架构学习
- · 第一课:GPU 为什么存在,以及它和 CPU 有什么区别 · GPU 架构学习
- · Blackwell 架构概览 · GPU 架构学习
- · 我的数字集成电路设计工具链 · 集成电路设计
2026年5月
- · 从算法模型到可综合 RTL 的完整流程 · 人工智能芯片
- · ITCM、DTCM、Cache 和 SRAM 的区别 · RISC-V 与处理器
2026年4月
- · VCS 常用命令与仿真流程 · EDA 工具链
- · FPGA 神经网络加速器的数据流设计 · FPGA 与硬件加速
2026年3月
- · RISC-V 矩阵处理器的基本架构 · RISC-V 与处理器