返回信息流
新闻事件
机器之心
1 个来源

华师大智金院发布金融原生基模Mint-Agent,超越GPT-5.6与Claude Opus 4.8

华东师大智金院团队发布了金融原生Agentic Foundation Model家族Mint-Agent,包括9B的Mint-Cu和27B的Mint-Ag。在FinanceAgentBench v2基准上,Mint-Ag以60.49%的得分超越GPT-5.6-Sol和Claude Opus 4.8,且推理成本仅为后两者的约22%和10%。目前商业订单已超亿元,标志着模型从能力验证进入规模化金融场景验证阶段。

SynthePulse Insight · AI 深度解读会员精读

Mint-Agent:金融原生基模如何把“可审计”变成基础设施

版本 1 · 1 个来源

华东师大智金院发布金融原生Agentic Foundation Model家族Mint-Agent,27B的Mint-Ag在FinanceAgentBench v2上以60.49%超越GPT-5.6-Sol与Claude Opus 4.8,单题推理成本仅为两者的约22%和10%,商业订单已超亿元。其核心不是更强的问答,而是把来源、时间、数值与运算纳入同一条可恢复链,让每个结论都可被复核。

  • Mint-Agent家族包含9B的Mint-Cu与27B的Mint-Ag,定位为金融原生Agentic Foundation Model。
  • 在FinanceAgentBench v2上,Mint-Ag得分60.49%,超过GPT-5.6-Sol和Claude Opus 4.8,单题推理成本分别约为两者的22%和10%。
  • 模型将来源、时间、数值与运算纳入同一条可恢复链,可靠性可定位到证据、抽取或计算中的具体一步。
展开章节目录性能与成本:不只是更强的模型

性能与成本:不只是更强的模型

Mint-Agent的发布核心数据是:在FinanceAgentBench v2上,27B的Mint-Ag得分60.49%,超过GPT-5.6-Sol和Claude Opus 4.8;同时单题推理成本分别仅为两者的约22%和10%。这组数字直接回应了金融AI的一个关键问题:性能提升是否必然以更高执行成本为代价。Mint-Agent给出的答案是,通过金融推理、长程执行与证据管理能力的协同,可以在不增加推理预算的情况下获得更高准确率。

9B的Mint-Cu则展示了紧凑模型在金融搜索与执行中的效率潜力。团队强调,真正的门槛不是“知道”,而是“做完”——真实金融研究需要模型自己找到权威材料、识别正确报告期、抽取指标、统一单位、完成计算,再跨来源核验并形成结论。任何一环偏离,最后的文字都可能“看起来合理,实际上错误”。

限时免费

继续阅读完整分析

还有 4 节深入分析和完整结论

加载中

可信度边界

本文信息主要来自机器之心对Mint-Agent发布的报道,属于第二手来源。所有性能数据、成本对比、商业订单金额等均为来源方声称,未经独立验证。技术细节(如MintHarness、证据账本、训练路径)来自团队发布的技术报告和项目网站,同样属于来源声明。读者应将其视为厂商宣称,而非已确认事实。

主报道

机器之心

主报道来源