由华东师大智金院团队孵化的金融原生 Agentic Foundation Model 家族 Mint-Agent 正式发布。在 FinanceAgentBench v2 上,27B 的 Mint-Ag 达到 60.49%,超过 GPT-5.6-Sol 与 Claude Opus 4.8;单题推理成本分别仅为两者的约 22% 和 10%。与此同时,Mint-Agent 商业订单已超亿元,开始从模型能力验证进入规模化金融场景验证阶段。

图 1|Mint-Agent 在六项核心金融评测中的表现。上排考察有界金融推理与可靠性,下排考察开放环境中的搜索、工具调用与长程执行;FinanceAgentBench v2 为三次运行均值。
- Mint-Agent 项目网站: https://mint-fin.github.io/mint-agent/
- Mint-Agent 技术报告: https://arxiv.org/abs/2608.16386
Mint-Agent发布
Mint-Agent 的卓越性能表明,在金融专业任务上,性能提升并不必然来自更大的推理预算,而可以来自金融推理、长程执行与证据管理能力的协同。而在金融,性能只是第一道门槛。投研、风控和审计还要继续追问:答案能否回到正确来源、报告期与计算过程?
Mint-Agent 团队据此推出金融原生 Agentic Foundation Model 家族:9B 的 Mint-Cu 与 27B 的 Mint-Ag。模型把来源、时间、数值与运算纳入同一条可恢复链;可靠性不再是抽象评分,而是能否把错误定位到证据、抽取或计算中的具体一步。
对于金融基座模型,性能、效率与可审计性必须同时成立。
性能提升,不以更高执行成本为代价
在业内最具影响力的金融智能体评测基准之一FinanceAgentBench v2 上,Mint-Ag 得分 60.49%,高于 GPT-5.6-Sol 和 Claude Opus 4.8;在取得更高准确率的同时,其单题推理成本分别仅为两者的约 22% 和 10%。

Mint-Ag 在高难度金融任务上进入性能 — 成本前沿:模型既保持金融推理与长程执行能力,也显著降低推理开销。9B 的 Mint-Cu 则进一步展示了紧凑模型在金融搜索与执行中的效率潜力。
真正的门槛,不是 “知道”,而是 “做完”
真实金融研究很少由单条知识直接回答。Agentic Model 必须自己找到权威材料,识别正确报告期,抽取指标,统一单位,完成计算,再跨来源核验并形成结论。任何一环偏离,最后的文字都可能 “看起来合理,实际上错误”。
Mint-Agent 因此把任务重新定义为一条可恢复的链:从来源到事实,从事实到计算,再从计算到结论。答案不是孤立文本,而是由证据和操作共同支撑的 Claim。这也改变了评估方式:不只比较最终答案,还要检查证据是否有效、计算是否闭合、过程是否可以重放。
从 Financial LLM 到 Auditable Agentic Model
金融智能的能力边界,正在从 “生成答案” 走向 “完成任务并接受检查”。
01 Financial LLM | 金融知识与问答
02 Financial Reasoning Model | 金融计算与分析
03 Financial Agentic Model | 搜索、工具调用与长程任务执行
04 Agentic Foundation Model | 证据可追溯、计算可复现、过程可验证
Mint-Agent 瞄准 Agentic Foundation Model 的最后一层:不是再增加一个金融问答能力,而是把研究过程本身做成可检查的系统。前三层解决 “能不能回答、能不能分析、能不能行动”,最后一层回答 “结果能不能被研究员、风控人员与审计者真正接手”。

图 2|Mint-Agent 的三位一体技术栈:Data 定义什么算对,Harness 保存模型如何执行,Algorithm 把推理与执行训练进同一策略。三部分并不是并列功能,而是共享同一套金融正确性标准:来源、报告期、指标、数值、单位和计算必须能够被重新检查。
Data:先把 “什么算对” 定义清楚
数据引擎首先构造知识、提取、计算、分析、验证五类原子任务。材料来自 EDGAR、公司投资者关系页面、XBRL、交易所记录、FRED 与会计分类体系;每个事实绑定实体、报告期、指标、数值、单位和原始位置。只有证据支持、计算可重放、答案唯一的样本,才进入训练。

图 3|原子金融任务构造:系统从 EDGAR、XBRL、交易所记录、FRED 与会计分类体系中采样材料,抽取带来源定位、实体、期间、指标、数值和单位的事实,并按知识、提取、计算、分析、验证五类能力生成任务;只有证据支持、计算可重放且答案唯一的样本才进入训练。
长程任务则故意隐藏材料,只暴露研究目标。系统预先构建隐藏证据图,固定所需事实、来源和运算路径,并为动态页面保存时间快照。模型必须在开放环境中自己恢复这条路径,而不能从题面获得答案。因此,同一个问题的正确性不再依赖措辞,而落到一组可机器核验的事实节点和运算关系上。

图 4|长程 Agentic 任务构造与验证:Agentic Model 只看到研究目标,必须通过搜索、检查、计算与综合自行恢复答案;底层来源包与隐藏证据图不向模型暴露,但用于验证轨迹是否可重放、答案是否唯一、证据是否可定位,以及题面是否泄露既定路径。
Harness:证据不能随着上下文一起消失
MintHarness 将研究过程变成有状态执行循环。模型决定下一步行动;Harness 负责校验工具、预算和输出格式,并把有效结果写入 证据账本(Evidence Ledger)。这个账本保留实体、期间、指标、数值、单位、来源位置及获取时间,和失败的检索路径严格分开。
当上下文变长,旧对话可以被压缩,但证据账本、工作记忆和完整动作 — 观察轨迹仍保存在模型上下文之外。模型看到的是当前任务所需的紧凑视图,审计者保留的是完整研究记录。即使任务经历网页失效、搜索转向或多轮压缩,已经确认的证据也不会被后续对话覆盖。

图 5|MintHarness 的状态化执行循环。任务、工具和预算进入循环后,证据账本、工作记忆与完整轨迹持续更新;隐藏答案只留在隔离的评估侧。
因此,即便一个答案碰巧正确,只要证据无法支持、时间边界不成立或计算不能复现,它也不会被视为真正完成任务。
Algorithm:双核训练,能力合一

图 6|从人类认知到可扩展智能。 人类认知受到注意力、记忆稳定性与行动跨度的生物限制;Mint 通过 SFT 获取专家经验,借助 RLVR 从可验证反馈中持续改进,并利用 MOPD 蒸馏和融合多个专门化教师。由此形成的统一智能体结合持久记忆、可验证推理、工具增强能力与长程执行机制,将有限的内部认知扩展为持久、可验证且可扩展的智能系统。
擅长金融推理的模型,未必擅长长程执行;会调用工具的 Agentic Model,也未必能把金融问题算对。Mint-Agent 从同一基础模型出发,分别训练金融推理与 Agentic 执行两条路径:前者强化计算、分析和验证,后者强化搜索、工具调用和失败恢复。两条路径都经历了完整的 SFT – OPD – RLVR – Model merging/Multi-teacher OPD 训练路径。团队自研的核心算法再将两类专长整合到同一模型中。它借鉴人脑的功能分工,却不依赖易丢失的短期记忆 —— 证据账本、工作记忆和完整轨迹被保存在模型上下文之外,确保过程可恢复、可复核。
结果之外,真正值得看的是轨迹
轨迹图记录的不只是模型最终答了什么,还记录它如何处理失败检索、证据锁定、口径修正与计算复核。下面两条代表性轨迹,分别展示检索恢复能力与长程状态保持。

图 7|AMD 收入指引轨迹:13 步、23 次工具调用。模型否决错误的 accession,扩大 SEC 检索,定位四个季度的 EX-99.1,并在输出前重新打开 Q3 来源复核。
关键不是 “从不失败”,而是失败被明确记录,并触发可追踪的路径修正;原始文件、中间数值与最终比例都能被重新检查。换言之,系统允许出现可见、可纠正的失败,却不接受一个无法解释的 “正确答案”。
CASE 02・长程状态与计算复现

图 8|台积电 2025 年第一季度营收推演轨迹。37 步长程执行跨越申报受阻、季度页面误选、年度数据误用和统计窗口修正;模型持续保留有效指引与月度营收记录,最终恢复 2022—2024 年口径并完成可复现计算。
这条轨迹检验的是长程执行中的持久状态。模型在多次来源失败和口径绕行中始终保留已经确认的 2025 年第一季度指引与月度营收记录;恢复 2022—2024 年三年窗口后,重新计算历史 3 月增速,推演 2025 年 3 月营收,并估算季度营收为 NT$825,110 million。由于指引中值和汇率换算均被锁定在证据账本中,最终 NT$8,010 million 的差额可以沿原始证据和计算过程完整复核。
两条轨迹共同说明:可审计性不止是给结论附上引用,而是让证据、状态和计算在长程执行中持续有效。AMD 案例展示失败检索后的路径修正;台积电案例则展示模型如何在多轮绕行和口径修正后保留已确认材料并完成重算。对于更难的 FinanceAgentBench v2,关键不仅是找到来源,更是把来源转化为完整、范围正确且可重放的金融证据。
金融不会容忍 “差不多正确”
Mint-Agent 并不是把金融语料继续堆进通用模型。它建立的是更严格的金融基座模型(Agentic Foundation Model):数据先定义证据,Harness 保留执行状态,训练算法再把正确行为写进策略。
这条路线给出的判断很明确:可审计性不是推理后的说明层,而是数据、执行与训练共同依赖的底座。具备 Agentic 能力的金融基座模型,下一阶段的竞争也不会只是谁更像分析师,而是谁能把任务完成,并为每一个结论留下可检查的依据。真正可落地的系统,要允许业务人员沿着证据链复核、质疑并重新执行,而不是仅仅相信模型的语气。
跨学科联合团队,把研究推进到金融现场
项目由华东师范大学上海人工智能金融学院院长邵怡蕾团队牵头,依托学院及相关产研平台。团队成员来自国内外头部科技企业与高校,包括前国内大厂金融 AI 研究员、南洋理工大学、新加坡国立等博士后研究人员。
团队覆盖大模型、Agentic Model、强化学习、金融科技与可信人工智能等方向,持续连接前沿算法研究、金融场景验证与产业转化,并形成 “模型研发 — 金融问题定义 — 工程部署 — 真实场景反馈” 的完整闭环。
从技术前沿到产业窗口:金融基座模型进入基础设施竞争
随着 Agentic Model 从信息检索和内容生成进一步进入自主规划、工具调用与复杂决策辅助,金融 AI 的竞争正在发生变化。对于高价值、高风险、强监管的金融业务而言,模型能力只是进入核心生产环境的第一道门槛;稳定性、可解释性、证据可追溯以及全流程可审计能力,正在成为决定模型能否规模化部署的关键条件。
这也使金融基座模型呈现出不同于通用大模型的技术与产业门槛:它不仅需要前沿模型研发能力,还需要金融业务理解、可信 AI、安全治理与产业工程能力的深度结合。竞争的核心正在从 “模型有多强”,转向 “模型能否进入真实生产环境,并为每一个结论和行动留下可检查的依据”。
在这一背景下,兼具前沿模型研发能力、金融业务理解能力和产业工程落地能力的团队具有明显的稀缺性。本项目团队依托华东师范大学上海人工智能金融学院及产研院平台,已形成覆盖大模型、Agentic Model、强化学习、金融科技与可信人工智能的完整技术体系,并持续推动前沿算法研究与真实金融场景之间的闭环验证。目前,Mint-Agent 商业订单已超亿元,显示出金融机构与产业客户对其技术路线和落地能力的实际需求;与此同时,团队正在推进新一轮战略融资,并与产业资本及专业投资机构展开深入沟通。
下一阶段,Mint-Agent 将进一步推动金融原生 Agentic Foundation Model 进入真实生产环境,并围绕 “模型 —Agent— 安全 — 应用” 构建一体化技术体系。随着金融机构从 “尝试使用” 走向核心业务深度部署,可信、安全、可审计的金融 AI 能力将成为金融智能基础设施中最具壁垒的核心环节。
从模型能力领先,到亿元级商业订单,Mint-Agent 正在跨越金融 AI 从 “能用” 到 “敢用”、从技术验证到规模化部署的关键门槛。团队正在推进新一轮战略融资,与金融机构、产业伙伴及长期资本共同建设下一代安全、可信、可审计的金融智能基础设施。
联系 Mint 团队:wang.kun@minttruth.com