Single RTX 5090 Runs Full DeepSeek V4 Flash, Now Open Source, Token Freedom!
A joint team from UC Berkeley, MIT, and other institutions has open-sourced FreeToken, a new edge inference system designed for MoE large models on consumer hardware. It enables a single RTX 5090 to run DeepSeek-V4-Flash 284B and a laptop RTX 4060 to run Qwen3.6-35B, with speeds exceeding Codex's median decode rate. FreeToken uses dynamic bandwidth-aware execution, double-buffered data flow, and state reuse to break the hardware barrier that previously required data center clusters, achieving practical interactive-speed local inference.