15 8 月, 2026

英伟达适配DeepSeek-V4 AI模型,性能突破每秒150 Tokens

deepseek-v4-ai-150-tokens

IT之家4月25日消息,英伟达今日发布博文,宣布其NVIDIA Blackwell平台已成功适配DeepSeek-V4-Pro与DeepSeek-V4-Flash两款AI模型。开发者可以通过NVIDIA NIM微服务下载部署,或利用SGLang与vLLM框架进行定制化推理。

英伟达在博文中指出,DeepSeek-V4-Pro拥有1.6T总参数量与49B激活参数,专为高级推理任务设计;而DeepSeek-V4-Flash版本则具备284B总参数量与13B激活参数,主要用于高速高效场景。这两款模型均支持100万Token上下文窗口与最高38.4万Token输出长度,覆盖长文本编码、文档分析等核心应用,并采用MIT开源协议。

性能测试与技术背景

实测数据显示,DeepSeek-V4-Pro在NVIDIA GB200 NVL72上开箱即用性能超150 tokens/sec/user。借助vLLM的Day 0配方,开发者可在Blackwell B300上快速部署。随着Dynamo、NVFP4及CUDA内核的深度优化,预期性能将进一步提升。

在部署生态方面,开发者可以通过NVIDIA NIM微服务下载部署,或利用SGLang与vLLM框架进行定制化推理。SGLang提供低延迟、均衡及最大吞吐量三种配方;vLLM则支持多节点扩展至100个以上GPU,具备工具调用与推测解码能力。

行业影响与未来展望

这一发展标志着英伟达在AI模型适配领域的又一重要里程碑。随着AI技术的不断进步,企业对高效能、高灵活性AI解决方案的需求日益增加。英伟达的这一举措不仅提升了其在AI市场的竞争力,也为开发者提供了更为广泛的选择。

根据行业专家的分析,英伟达的Blackwell平台通过其强大的计算能力和灵活的部署选项,为AI开发者提供了一个理想的开发环境。专家指出,“英伟达的持续创新将推动AI技术的进一步普及和应用。”

总结与结语

随着AI技术的快速发展,英伟达的DeepSeek-V4系列模型为开发者提供了强大的工具,帮助他们在复杂的推理任务中取得突破。未来,随着技术的进一步优化和应用场景的拓展,英伟达有望在AI领域继续保持领先地位。

IT之家附上参考广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。

推荐阅读  美股全线下跌:科技股领跌,市场对降息预期骤降