Todavía no hay biografía.
把训练摊到一堆家用机器上这套东西,我断断续续跑了两个月,有些想法想记一下。 最大的障碍从来不是带宽,是异构。同一批里有 M2 的 Mac,有五年前的显卡,还有随时会被主人关掉去打游戏的机器。同步训练的话整批速度等于最慢那台,实测利用率低到不好意思贴出来。改成异步以后吞吐确实上来了,但你收敛到的东西已经不完全是原来那个目标函数了——旧梯度被当成新梯度用,等效于给优化器加了一层你没设计过的动量。 所以我现在的判断是:这类方案适合微调和小规模实验,不适合当作大规模预训练的替代品。不是因为算力不够,而是你很难向别人说清楚你的训练过程到底做了什么。
The platform default community. All new users who don't explicitly choose a group join BitFan automatically. Led by the platform.