2026-09-24
DeepSeek 推理优化:PCIe 显卡吞吐提升近 7 倍
DeepSeek推理优化GPU
来源:量子位 ↗ 有技术团队针对 DeepSeek 推理场景进行内核补齐与通信重构,使 PCIe 显卡的推理吞吐量提升近 7 倍,并实现 1.5 台 6000D 跑赢 1 台 B300 的效果。这一结果说明,在特定优化下,被低估的 PCIe 显卡也能在推理任务中释放出可观性能,对关注推理成本与硬件选型的团队具有参考价值。
PCIe 显卡因互联带宽不及 NVLink 方案,常被认为不适合大模型推理。此次优化从内核与通信层面入手,缩小了硬件差距,也提示推理性能不只取决于单卡算力,软件栈与通信效率同样关键。后续值得观察该方案能否在更多模型和集群规模上复现。
本文编译自「量子位」,点击查看原始报道。
查看原始报道 ↗