返回信息流
新闻事件
The AI Insider
1 个来源

Multiverse Computing 报告所有 CompactifAI 模型现可在 Intel Xeon 6 处理器上运行

Multiverse Computing 宣布其 CompactifAI 压缩版 Llama 3.3 70B 模型现可在 Intel Xeon 6 处理器上运行,性能显著提升。基准测试显示,与未压缩版本相比,吞吐量提升高达 94%,延迟降低 48%,标志着向更节能的 AI 部署迈出重要一步。

SynthePulse Insight · AI 深度解读

CompactifAI压缩Llama 3.3 70B在Intel Xeon 6上实现近两倍吞吐量,准确率损失低于3%

版本 1 · 1 个来源

Multiverse Computing宣布其CompactifAI压缩版Llama 3.3 70B模型可在Intel Xeon 6处理器上运行,基准测试显示吞吐量提升约94%,延迟降低近50%,而准确率下降不超过2.5%。

  • CompactifAI压缩版Llama 3.3 70B在Intel Xeon 6上输出吞吐量达3.86 tokens/s,较未压缩基线提升93.6%。
  • 总token吞吐量提升94.1%,延迟降低48.6%(单用户场景)。
  • 在256并发用户下,吞吐量提升107.0%,延迟降低51.7%。
  • 模型磁盘大小从~130 GiB减至~65 GiB,降幅约50%。
  • 准确率在MMLU上下降2.48%,在BoolQ、GSM8K、HellaSwag上下降0.95%-1.94%,WinoGrande反而提升6.86%。
  • 支持Llama 4 Scout、Mistral Small 3.1、DeepSeek R1等多种模型,集成PyTorch、Hugging Face等框架。
展开章节目录性能飞跃:吞吐量与延迟的双重优化

性能飞跃:吞吐量与延迟的双重优化

Multiverse Computing于2026年7月23日宣布,其CompactifAI压缩版Llama 3.3 70B模型已可在Intel Xeon 6处理器(Performance-cores)上运行,利用vLLM CPU和Intel AMX实现。在Intel Xeon 6737P处理器上的基准测试中,对于1024输入+1024输出token的请求,压缩模型输出吞吐量为3.86 tokens/s,总token吞吐量为7.81 tokens/s,较未压缩基线(2.00 tokens/s和4.02 tokens/s)分别提升93.6%和94.1%。

延迟方面,单用户场景下处理时间从5056.34秒降至2598.22秒,降幅48.6%。ITL(平均token间延迟)从493.36 ms降至252.08 ms(降48.9%),TPOT(平均每输出token时间)从494.71 ms降至255.76 ms(降48.3%),TTFT(平均首token时间)从6939.20 ms降至3705.64 ms(降46.6%)。在256并发用户下,吞吐量提升107.0%,延迟降低51.7%。

准确率保持:压缩后仍保留97%以上基线性能

在标准基准测试中,压缩模型准确率与基线相比仅有微小变化:BoolQ从0.904587降至0.896024(降0.95%),GSM8K从0.934799降至0.924185(降1.14%),HellaSwag从0.590520降至0.579068(降1.94%),MMLU从0.776528降至0.757300(降2.48%)。WinoGrande反而从0.678769升至0.725335(升6.86%)。总体而言,压缩模型保留了基线97%以上的准确率。

WinoGrande的意外提升被归因于压缩后的“愈合”重训练过程。Multiverse Computing在压缩参数的同时进行针对性重训练,虽不能保证所有基准提升,但核心信息保留使得特定场景下性能可能增益。

部署优势:模型体积减半,生态兼容广泛

压缩后模型磁盘大小从约130 GiB降至约65 GiB,减少约50%,显著降低存储和部署时间。CompactifAI集成PyTorch、Hugging Face等开源框架,支持RAG、多模态推理和企业级AI工作负载。支持的模型包括Llama 4 Scout、Llama 3.3 70B、Llama 3.1 8B、Mistral Small 3.1、DeepSeek R1及其“Slim”变体。

CompactifAI现已可在主流云平台及Intel Xeon 6实例上使用,补充本地部署,为金融、医疗、制造等行业提供高性能与能效优化方案。

可信度边界

本文信息基于Multiverse Computing发布的新闻稿,经The AI Insider转载。所有性能数据均为公司自述,未经独立第三方验证。基准测试配置为Intel Xeon 6737P处理器、单用户、1024输入+1024输出token,完整方法见附录。

核心结论

CompactifAI在Intel Xeon 6上实现了Llama 3.3 70B模型的高效压缩部署,吞吐量翻倍、延迟减半、体积缩小50%,且准确率损失可控,为AI模型在CPU上的低成本规模化部署提供了可行路径。

主报道

The AI Insider

主报道来源