大模型卡顿?解密AI训练背后的带宽刚需
卡顿背后:被忽视的带宽瓶颈
当你在对话框前等待 AI 回复时,卡顿可能不止是 “算力不足”。大模型推理阶段,单条请求需传输数百万参数碎片,若终端到算力节点的带宽低于 10Gbps,就会出现明显延迟。而训练场景的带宽需求更是指数级增长 —— 这正是 AI 产业发展的隐形门槛。
训练现场:带宽需求的量级突破
AI 训练的带宽需求早已突破传统网络认知:
• 单机门槛:单台搭载 8 张 H100 GPU 的服务器,需 8 块 200Gbps RDMA 网卡才能避免瓶颈,双向通信带宽需达 1.7TB/s;
• 集群规模:训练 GPT-4 级模型需 25000+GPU 协同,单实例带宽从 2020 年 400Gbps 飙升至 2024 年 12.8Tbps,4 年增长 32 倍;