光互联爆发:还差三道门
训练一个大模型,瓶颈究竟在哪? 答案不是算力本身,而是数据搬运。 在一个装了几千块GPU的数据中心里,GPU们要协作完成一个训练任务,就必须不停地交换数据——梯度、激活值、权重……每秒钟需要传输的数据量,远远超过铜导线能承载的极限。 铜缆的问题有三个:带宽有天花板、传输距离短(超过几米就衰减严重)、而且越高频…
这是一篇会员内容
当前页面不提供试看。有效会员登录后可阅读全文。
训练一个大模型,瓶颈究竟在哪? 答案不是算力本身,而是数据搬运。 在一个装了几千块GPU的数据中心里,GPU们要协作完成一个训练任务,就必须不停地交换数据——梯度、激活值、权重……每秒钟需要传输的数据量,远远超过铜导线能承载的极限。 铜缆的问题有三个:带宽有天花板、传输距离短(超过几米就衰减严重)、而且越高频…
当前页面不提供试看。有效会员登录后可阅读全文。