生态层面,CUDA 仍是 NVIDIA 的护城河,但 TPU 生态加速开放。NVIDIA 的CUDA 覆盖 PyTorch、TensorFlow、JAX 全部主流框架及 TensorRT-LLM、Megatron-Core 等推理与训练工具链,是 MLPerf 唯一全项提交平台。Google TPU 支持JAX/XLA、PyTorch/XLA、MaxText/JetStream 等,2025 年起通过 vLLM 进一步融合 PyTorch 生态,但 JAX 路径较 PyTorch/XLA 仍有约 20%吞吐量优势。CUDA 自定义内核迁移至 TPU 有相当大的工程成本,但超大规模集群训练与极低推理成本使 TPU 的长期竞争力不可忽视。