单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!
来自UC Berkeley、MIT等机构的联合团队开源了名为FreeToken的全新边缘端推理系统,该系统针对MoE大模型在消费级硬件上的本地部署进行了全栈协同设计,使得单卡RTX 5090可以运行DeepSeek-V4-Flash 284B模型,笔记本RTX 4060可以运行Qwen3.6-35B,且速度超过Codex生产trace的中位decode速度。FreeToken通过动态带宽感知、双缓冲数据流和状态复用等技术,打破了大规模前沿模型必须依赖数据中心集群的硬件门槛,实现了交互级实用速度的本地推理。