在Cursor训练Composer以及构建Meta/Nvidia计算集群的经验教训 | YC Paper Club

在Cursor训练Composer以及构建Meta/Nvidia计算集群的经验教训 | YC Paper Club

在我们最近的YC Paper Club上,研究人员和开发者分享了多GPU内核优化、本地推理的每瓦特智能、AI生成的GPU内核与基准测试、异构推理基础设施设计,以及用于强化学习的GPU加速游戏引擎。 感谢以下演讲者: Stuart Sul (Stanford / Cursor), John (Stanford), Mark (PyTorch / GPU Mode / CoreAuto), Misha (Marlo), and Brennan (Stanford) 文字记录:https://www.ycrootaccess.com/p/multi-gpu-kernels-intelligence-per 章节: 0:00 – Francois Chaubard:芯片与内核专业化的理由 7:16 – Stuart Sul: Parallel Kittens - Systematic and Practical Simplification of Multi-GPU Al Kernels (https://arxiv.org/abs/2511.13940) 21:29 – Jon Saad-Falcon: Intelligence per Watt - Measuring the Intelligence Efficiency of Local and Cloud AI (https://arxiv.org/abs/2511.07885) 31:05 – Mark Saroufim:当AI开始编写系统代码 47:04 – Misha Smelyanskiy:为什么AI推理需要异构硬件 1:04:33 – Brennan Shacklett:构建一个完全在GPU上运行的高吞吐量游戏引擎 (https://madrona-engine.github.io/shacklett_siggraph23.pdf) 1:15:35 – 总结与下一步 申请加入Y Combinator:https://www.ycombinator.com/apply 在初创公司工作:https://www.ycombinator.com/jobs