万卡集群哪些问题最显著
怎么提高训练稳定性,怎么对gpu利用率提升
开个头写一些疑问,稍微还是查点资料吧
最近看了两个预训练的例子,llama3和Sora
先说llama3,最后一代超大规模dense模型
听李沐大神讲的,他朋友说llama3训练过程中像坐牢,这么大模型,人参与其中是很紧张的
首先用了1.6万张H100
过程中重启了400多次可能,每两三个小时重启一次,训了那可能有50多天吧
上面那张图也表明了大部分是GPU的问题,其次是网络和软件
那重启这么多次靠什么,存储上checkpoint足够快
还有人工发现干预换机器足够快
这样下来他们的GPU利用率上了百分之九十
好,那我们知道英伟达GPU是多么容易重启,这么大的厂都是一个规格的GPU出问题概率就这么大,当然和规模关系很大
哎,那我继续说Sora,就是说某大神记不起名字了,是在谷歌工作,那他一直都用TPU和谷歌的infra,有个项目他跑着忘记关了,跑了二十几天,然后就出成果了,后面他可能去别的厂,用上了GPU,说了一句那要是用GPU的话不可能出这个结果
怎么说呢,TPU一个SM吞吐大概是GPU30倍,天然为矩阵tensor设计,加上谷歌超强工程实力,自动发现机制和恢复机制的强,训一个东西好几十天不中断,当然这个肯定没万卡,还有GPU以前是给图像渲染搞的后面改的
说明什么呢,某些基础设施的重要性,国内很多芯片底层是抄TPU,软件方面抄英伟达,反正没抄一致就是了,也是看习惯来
现在AI写东西那么方便,tilelang triton这些轮子那么多,说不定也能搞一套好的基建
再说一下国内做的好的阿里,算是一定程度可以自动发现,这些也是根据大量的用户实例来论证总结的,比如做一个实验大规模三个月,看看他们平台发现了多少问题,这些问题有没有用然后发论文
又开始直接总结了
- 好的发现故障恢复故障机制
- 足够快的checkpoint
- 底层硬件的适配标准
- 非常多的案例得出规律
大说一声,谷歌为什么这么强谷歌为什么这么闭源,全程都自己搞,还有谷歌那破k8s,自己用最好的,开源的给别人用,别人魔改还不发证,就你爱垄断对吧。难怪卖芯片搞不赢英伟达。


