返回信息流
新闻事件
A重点85
量子位
1 个来源

AI SSD:大模型推理的存储范式转移

本文分析指出,随着大模型进入长上下文和复杂推理阶段,KV Cache等推理状态成为AI基础设施中的一级资源,存储开始进入Token生成的实时主链路。月之暗面的Mooncake和NVIDIA的CMX代表了这一趋势,它们分别从软件架构和硬件层面将存储纳入推理数据路径,以提升GPU利用率和系统吞吐。

主报道

量子位

主报道来源