Meta Helion 加入 HuggingFace Kernels:预调优决策树让高性能 kernel 开箱即用
Meta Helion 加入 HuggingFace Kernels:预调优决策树让高性能 kernel 开箱即用
记录代码、学习和有趣发现
联系方式:cun.jia.li@gmail.com
Meta Helion 加入 HuggingFace Kernels:预调优决策树让高性能 kernel 开箱即用
Triton 位级确定性新进展:黑盒重构 cuBLAS 算术,静态检查器约束 autotuner 搜索空间
KernelGenBench 发布:首个统一多源多芯片的 Triton kernel 生成评测基础设施
AI Compiler Daily:今日无重大更新
AI Compiler Daily:今日无重大更新
AI Compiler Daily:今日无重大更新
AI Compiler Daily:今日无重大更新
PyTorch 大会硬件专场:Helion 新后端、FlyDSL 入列 Inductor,冷启动编译提速约 30 倍
KernelFoundry:进化搜索驱动 GPU kernel 生成,KernelBench 平均提速 2.3 倍
PyTorch 2.14 发布:NVGEMM 将 CuTeDSL 生成的 CUTLASS 内核引入 Inductor,动态形状与分布式后端全面升级
AI Compiler Daily:今日无重大更新
AI Compiler Daily:今日无重大更新
AI Compiler Daily:今日无重大更新
AI Compiler Daily:今日无重大更新
Triton 3.8.0 发布,新增 Rubin 初始支持与三款插桩调试工具;PyTorch 北美大会 2026 议程披露 vLLM 多项服务栈进展
PyTorch Conference NA 2026 公布 Core PyTorch 议程:Dynamo 图捕获、CUDA Graphs 参数化与 C++ FakeTensor 领衔多项编译优化
NVIDIA T4 CUDA 架构图解:SM、Block、Warp、Thread 与显存层级详解
Overview