A重点76
Artificial Analysis (X)
2 个来源Grok 4.6 在 AA-Briefcase 基准测试中取得显著进步
Grok 4.6 在 AA-Briefcase 基准测试上取得了显著进步,该基准测试评估长期代理性知识工作任务。该模型在性能上与 Claude Fable 5 相当,但成本显著更低,每任务成本为 4.42 美元,而 Claude Fable 5 为 22.30 美元。这一发布展示了 xAI 在 AI 模型效率和性能上的竞争力。
Grok 4.6 在 AA-Briefcase 基准测试上取得了显著进步,该基准测试评估长期代理性知识工作任务。该模型在性能上与 Claude Fable 5 相当,但成本显著更低,每任务成本为 4.42 美元,而 Claude Fable 5 为 22.30 美元。这一发布展示了 xAI 在 AI 模型效率和性能上的竞争力。
主报道
主报道来源
另有 1 个来源报道