返回信息流
新闻事件
机器之心
1 个来源

单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!

来自UC Berkeley、MIT等机构的联合团队开源了名为FreeToken的全新边缘端推理系统,该系统针对MoE大模型在消费级硬件上的本地部署进行了全栈协同设计,使得单卡RTX 5090可以运行DeepSeek-V4-Flash 284B模型,笔记本RTX 4060可以运行Qwen3.6-35B,且速度超过Codex生产trace的中位decode速度。FreeToken通过动态带宽感知、双缓冲数据流和状态复用等技术,打破了大规模前沿模型必须依赖数据中心集群的硬件门槛,实现了交互级实用速度的本地推理。

SynthePulse Insight · AI 深度解读

FreeToken:让消费级显卡跑满血MoE大模型的开源系统

版本 1 · 1 个来源

UC Berkeley与MIT等机构联合开源FreeToken,通过带宽自适应调度与双缓冲预填充,让单张RTX 5090运行284B的DeepSeek-V4-Flash,笔记本RTX 4060跑Qwen3.6-35B,速度超越Codex生产环境。

  • FreeToken由UC Berkeley、MIT等机构开源,专为MoE模型在消费级硬件上的本地部署设计。
  • 单张RTX 5090可运行284B参数的DeepSeek-V4-Flash,笔记本RTX 4060可运行Qwen3.6-35B,均为满血模型。
  • 笔记本RTX 4060跑Qwen3.6-35B的decode速度达39.3 token/s,超过Codex生产trace的中位速度33 token/s。
  • FreeToken将首Token延迟(TTFT)降低42-58%,多轮Agent交互的TTFT减少65-80%。
  • 系统在显存被抢占时能无缝收缩GPU缓存,避免OOM崩溃,实现平滑降级。
展开章节目录开源发布与核心性能

开源发布与核心性能

来自UC Berkeley、MIT等机构的联合团队开源了名为FreeToken的边缘推理系统,专门针对MoE大模型在消费级硬件上的本地部署进行全栈协同设计。论文、GitHub和官网均已上线,提供Windows/Linux桌面App和CLI安装方式。

性能数据令人瞩目:笔记本RTX 4060跑Qwen3.6-35B的decode速度达39.3 token/s,超过Codex生产trace的中位速度33 token/s;单张RTX 5090可运行284B参数的DeepSeek-V4-Flash。传统CPU-GPU卸载方案因PCIe带宽瓶颈速度极慢,而FreeToken实现了交互级实用速度。

在长Prompt(4-16k上下文)场景下,FreeToken将首Token延迟(TTFT)降低42-58%;针对Agent工具调用和思维链迭代,后续多轮交互的TTFT减少65-80%。

技术原理与创新

FreeToken的核心创新包括全层双缓冲预填充、带宽自适应混合调度、面向Agent的状态复用和弹性显存热扩缩容。双缓冲使GPU计算第l层时,第l+1层权重已通过PCIe预取,消除I/O等待。

带宽自适应调度实时探测PCIe带宽和CPU算力,动态计算最优分流比率q*,未命中专家部分传输至GPU,部分在CPU并行计算,使系统收敛至硬件理论最大吞吐。

状态复用机制在特殊Token边界设置轻量检查点,上下文编辑时仅从最近锚点恢复,避免重复计算。弹性显存支持在显存被抢占时无缝收缩LRU缓存,将未命中专家转交CPU,保证服务不中断。

硬件需求与压力测试

以DeepSeek-V4-Flash为例,其专家池约140GB,需要32GB显存(RTX 5090)和192GB内存才能稳定运行。系统在PCIe 3.0 x8、PCIe 4.0 x16、PCIe 5.0 x16及不同CPU下测试,后台高I/O任务时自动提升CPU分流比例,总线空闲时提升GPU载入比例。

压力测试模拟后台3D渲染或游戏导致显存骤降4-8GB,传统方案会触发CUDA OOM崩溃,FreeToken在0停机开销下无缝收缩GPU驻留的LRU Cache,将更多未命中Expert转交CPU计算,保证推理平滑降级。

这表明跑大模型不再需要模型100%上显存,通过DDR5大内存+PCIe高带宽+消费级单卡即可获得日常可用体验。

背景与意义

当前开放权重模型解决了谁能拿到模型,但未解决谁能跑得起模型。Kimi-K3、GLM-5.2、DeepSeek-V4-Flash能力逼近闭源第一梯队,但默认需要数据中心。Steam数据显示约72%的电脑有N卡,最常见的是笔记本RTX 4060,FreeToken旨在利用这些硬件。

MoE模型如DeepSeek-V4-Flash有284B总参数、43层、每层256个路由专家选6个,单token只激活13B,活跃参数可塞进RTX 5090的32GB显存。但Prefill会摧毁稀疏性,长prompt的专家并集几乎覆盖全部专家,导致每次prefill需搬运接近完整的专家池。

FreeToken重新定义了端侧异构硬件的协同调度,将CPU、系统内存、PCIe总线与GPU作为统一弹性计算平台,极大降低本地部署高智能模型的成本。

局限与展望

FreeToken的硬件需求仍较高,如DeepSeek-V4-Flash需要192GB内存,并非所有消费级用户都能满足。系统针对MoE优化,对dense模型效果未知。

论文中性能数据基于特定硬件配置,实际效果可能因环境而异。压力测试模拟了显存骤降场景,但真实使用中的其他因素可能影响表现。

文章结尾提到“就差个传说中的Qwen3.8-A3B”,暗示未来可能有更小模型进一步降低门槛,但具体信息未披露。

可信度边界

本文信息主要来自机器之心报道,属于二手来源。性能数据、技术细节均来自论文或官方发布,但未经独立验证。部分数据如39.3 token/s、TTFT降低百分比等为论文声称,应视为source_claim。

核心结论

FreeToken通过软硬件协同设计,让消费级显卡运行大规模MoE模型成为可能,但硬件门槛仍高,实际效果需进一步验证。

主报道

机器之心

主报道来源