宣布新的移动端AI推理基准测试:与Liquid AI合作
Artificial Analysis与Liquid AI合作,宣布为移动设备上的小型AI模型推出独立的智能和推理基准测试。该测试将覆盖iPhone 17 Pro和Galaxy S26 Ultra等流行手机,评估模型在典型端侧任务中的表现。他们计划发布结合智能评估和推理性能基准的结果,以帮助用户和开发者全面了解手机端AI模型的性能。
Artificial Analysis与Liquid AI合作,宣布为移动设备上的小型AI模型推出独立的智能和推理基准测试。该测试将覆盖iPhone 17 Pro和Galaxy S26 Ultra等流行手机,评估模型在典型端侧任务中的表现。他们计划发布结合智能评估和推理性能基准的结果,以帮助用户和开发者全面了解手机端AI模型的性能。
SynthePulse Insight · AI 深度解读
版本 1 · 1 个来源
Artificial Analysis与Liquid AI合作推出手机端小模型智能与推理性能基准测试,在iPhone 17 Pro和Galaxy S26 Ultra上以4-bit或更低精度运行模型,并设定16K上下文限制,揭示小模型在移动设备上的真实表现与权衡。
Artificial Analysis与Liquid AI合作,在iPhone 17 Pro和Galaxy S26 Ultra上对4-bit或更低精度的小模型进行智能与推理性能基准测试。推理测试在受控环境中使用Liquid AI的开源软件,测量端到端生成时间、输出速度、峰值内存等指标,并发布免费应用Pipette供用户自测。
智能排名基于五个评估的平均分:BFCL、IFBench、AA-Omniscience、GPQA Diamond和MATH-500,默认限制16K上下文,以反映手机内存对KV缓存的约束。便携设备类别定义为量化后(含KV缓存)在8K上下文下适配8GB内存的模型。
评测会随新模型、设备、框架和量化技术而演进,页面将持续更新。
在16K限制下,Nanbeige4.2-3B和LFM2.5-2.6B并列平均分63,领先Ornith-1.0-9B(62)和Qwen3.5 9B (Reasoning)(61)。但效率差异显著:LFM2.5-2.6B在iPhone 17 Pro上处理1,024 token提示仅需8.0秒和2.3GB内存,而Nanbeige4.2-3B需21.4秒和4.0GB,9B模型则需25秒以上和6.9GB。
16K限制重塑了排名:Qwen3.5 9B (Reasoning)在一次基准测试中消耗74.5M输出token,29%的生成触及16K上限,最终仅列第四。若放宽至64K,Ling 3.0 Tiny以66分登顶,但64K窗口在手机内存中不现实,且以55 token/s生成64K token需20分钟以上,耗电巨大。
因此,主要结果以16K为上限,同时发布64K和一分钟生成时间限制的附加结果。
在iPhone 17 Pro上,速度与智能的帕累托前沿仅包含六款模型:LFM2.5-230M(27分,0.9秒)、MiniCPM5-1B(45分,2.9秒)、LFM2.5-8B-A1B(58分,5.7秒)、Ling 3.0 Tiny(59分,5.7秒)、LFM2.5-2.6B(63分,8.0秒)和Nanbeige4.2-3B(63分,21.4秒)。
LFM2.5-8B-A1B和Ling 3.0 Tiny是混合专家模型,每token激活约1B参数,因此能以8B级权重在6秒内完成回答。
端到端生成时间(1,024 token输入后生成256 token)跨度达30倍,从0.9秒到26.7秒;峰值内存在4K上下文下跨度约19倍,从0.4GB到6.9GB,高内存模型在12GB手机上可能挤压系统空间。
各领先模型优势互补:Nanbeige4.2-3B最均衡(BFCL 76%、MATH-500 96%、GPQA Diamond 67%);Qwen3.5 9B (Non-reasoning)在工具调用(BFCL 77%)和科学推理(GPQA Diamond 79%)上最强;LFM2.5-2.6B在指令遵循(IFBench 59%)上最佳,MATH-500超90%,且抗幻觉显著优于其他模型(AA-Omniscience非幻觉率79%,对比Nanbeige4.2-3B的33%和Qwen3.5 9B (Reasoning)的24%)。
此外,Falcon-H1R-7B在MATH-500上达到97%,但未进入综合排名前列。
这些差异表明,模型选择需根据具体任务需求权衡。
评测设定16K上下文限制,导致一些设计上不针对手机内存约束的冗长模型相对得分下降,例如Qwen3.5 9B (Reasoning)因超限而排名受影响。
评测结果会随新模型、设备、推理框架和量化技术而更新,当前结果仅为初始版本。
用户可通过免费应用Pipette在自有设备上测试模型,但需注意评测环境为受控条件,实际表现可能因设备和使用场景而异。
本报道基于Artificial Analysis在X平台发布的官方公告及后续帖子,属于一手来源。所有数据均来自该来源,未引入外部信息。部分结论(如“LFM2.5-2.6B更适合作为默认模型”)为来源中用户评论的推断,非官方结论。
在手机端小模型选择中,智能分数并非唯一指标,速度、内存和上下文限制同样关键。LFM2.5-2.6B在效率和智能间取得最佳平衡,而9B模型虽分数略高,但代价显著。
主报道
主报道来源