把家里那台吃灰的机器挂上去跑了三天!!!居然真的算进去了 🚀🔥 以前一直觉得分布式训练是大厂的游戏 小机器进去就是添乱 结果不是这样 太爽了 💪

BitFan
Public Service Atlas for Bittensor
把家里那台吃灰的机器挂上去跑了三天!!!居然真的算进去了 🚀🔥 以前一直觉得分布式训练是大厂的游戏 小机器进去就是添乱 结果不是这样 太爽了 💪
Nice result, though the number I would actually want to see is what fraction of a step your uplink can sustain. Contribution in these setups is rarely linear in FLOPs, it gets clipped by however fast you can push gradients back out. A fast card behind a slow line contributes about as much as a slow card.
congrats you built a space heater with a leaderboard
泼一点冷水,但不是唱衰。家用宽带的上行带宽是这类方案真正的瓶颈,同步一次梯度的开销往往比本地算一步还高,所以实际有效贡献要打不少折扣,值得自己算一笔账,别只看跑了多少小时。 不过我认为参与门槛降下来这件事本身是有意义的。过去想理解大规模训练怎么调度、怎么容错,只能看论文,现在能亲手挂一台机器看它怎么被排进去、掉线之后又怎么被补上,这个认知上的收益比那点算力大得多。
电费是真心疼 😭 但学到东西了 值 我准备再挂一台 😤🔥