从某种意义上来说,DeepSeek可以认为是绕过了CUDA,主要体现在以下方面:
• 采用PTX语言优化:DeepSeek在训练DeepSeek - V3时,没有使用CUDA,而是采用英伟达的PTX语言进行优化,针对自身需求对硬件的流式多处理器进行了重新配置,变相绕过了硬件对通信速度的限制。
• 降低对CUDA依赖:通过直接使用PTX,DeepSeek减少了对CUDA高级编程语言的依赖,直接在更接近底层硬件的层面进行操作,实现了算法与硬件的直接对接,降低了开发成本,显著提升了计算效率。
• 展现跨平台潜力:DeepSeek已经与AMD、华为等团队紧密合作,第一时间提供了对其他硬件生态的支持,这表明其不依赖CUDA也能在不同硬件平台上进行高效开发和应用,展现出一定的跨平台潜力。
但严格来说,PTX仍然是英伟达GPU架构中的技术,是CUDA编程模型中的中间表示。在实际编译流程中,CUDA代码首先被编译为PTX代码,PTX代码再被编译为目标GPU架构的机器码。所以DeepSeek的操作并非完全脱离英伟达的技术体系,只是在一定程度上突破了CUDA的限制。