大白话讲明白算力上下游
从 GPU 到数据中心,一文看懂 AI 算力产业链全貌
什么是算力?
算力,简单说就是计算能力。
大模型要变聪明,靠的就是高端芯片——GPU(比如 NVIDIA 的 B300)不停吞吐数据、完成计算。大模型喂给它海量数据,GPU 疯狂运算,算出来的结果存到HBM(高带宽内存)里。
从单卡到万卡集群
一个 GPU 远远不够。
通常一个机柜装 4 到 8 张 GPU。大量机柜连在一起,就形成了万卡集群,实现更大规模的并行计算和模型训练。
机柜之间怎么"聊天"?
机柜之间要协同工作,必须高速通信,靠两样东西:
光通讯:速度快、延迟低,是主力 铜连接:短距离场景下的经济之选
光通讯又分两种方案:
传统光模块:即插即用,成熟稳定 CPO(光电共封装):把光器件和电器件封装到一张卡上,通信速度更快,是未来的演进方向
散热和供电——算力的"后勤部队"
GPU 和 HBM 运行起来又热又耗电,必须有强大的后勤保障:
液冷散热:相比传统风冷,液冷效率更高,是万卡集群的标配 AIDC(智算中心):专门服务 AI 算力的数据中心,提供稳定的运行环境 高性能开关和变压器:把交流电转为 GPU 需要的直流电 电算协同 + 储能:确保电力供应稳定、永不断档
训练完了,轮到"推理"登场
大模型训练好之后,我们跟它对话(输入 token,大模型输出 token),这个过程叫推理。
推理不需要高精度计算,速度要求也降低了,对硬件要求宽松很多:
GPU 推理:NVIDIA H20、寒武纪 690 这类中端芯片就够用了 CPU 超节点:用 CPU 集群做推理,也是一种可行方案 存储降级:不需要 HBM 那么高端的存储,HBF 就能满足推理需求
绕不开的半导体
整条产业链的根基是半导体——光刻机、半导体设备、封装、测试,缺一不可,每个环节都是关键拼图。
一张图看清算力产业链
总结
一句话记住:GPU 负责训练,CPU 负责推理,HBM 负责存储,光模块负责通信,AIDC 负责供电。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
暂无评论...




