Financial Model × Evaluation Intelligence · v0.2

连接金融模型与评测
做到可追溯、可执行

从领域预训练、指令微调和金融推理模型,到 benchmark、真实工作流、专家流程与评分规则:在一张图谱里回答“模型从哪来、开放到哪、测什么、怎么得分”。

START HERE

从评测地图到 Loop,三步读懂本页

模型图谱已独立成页;本页专注 benchmark、开放性证据与人机闭环评测。

01
EVALUATION LAYER

从构建方法、任务覆盖到代表性评测集。

DESIGN BLUEPRINT

一条高质量样例如何诞生

专家不是最终“打个分”才出现,而是贯穿任务定义、金标制作、rubric 编写、盲评与争议仲裁。

01

任务采样

从真实金融工作流与岗位成果物反推能力

02

专家撰写

从业者提供提示、上下文、附件与参考答案

03

交叉审核

另一位专家检查真实性、可解性与歧义

04

Rubric 原子化

把正确性拆成可独立验证、带权重的评分点

05

盲评校准

人类盲评 + judge 校准,记录分歧与置信度

BENCHMARK LANDSCAPE

代表性数据集

“开放”区分公开完整集与公开子集;所有 Demo 均为结构示意或基于公开字段的节选,不替代原始数据许可。

2025 · 44 个职业 / 9 个行业公开金标子集

GDPval

以真实职业工作成果为目标的评测。金融与保险行业覆盖金融分析师、财务经理、理财顾问、金融销售和客服等岗位。

工作成果金融研究数值推理
专家参与平均 14 年经验;约 5 轮审核
评分方式专家盲测两两偏好 + 任务 rubric
2024–26 · 航空、零售、银行等交互环境完整开放

τ-bench / τ³-bench

让工具型智能体与模拟用户进行动态多轮对话,并依据领域政策与数据库最终状态判断任务是否真正完成;最新版加入 banking。

交互智能体工具调用多轮交互
专家参与领域政策与任务经人工设计校验
评分方式数据库状态 + policy 合规 + pass^k
2026 · 928 个真实金融研究任务公开 50 条子集

BigFinanceBench

评测从找数、口径判断到计算的完整金融研究轨迹;公开 50 条分层子集,包含参考答案、逐点 rubric、工具轨迹和多模型评分。

金融研究数值推理工具调用
专家参与专家答案 + 独立人工工作底稿校验
评分方式逐项加权 rubric(公开集 793 条)
2023 · 上市公司财报问答完整开放

FinanceBench

围绕 SEC 文件构建的开放式金融问答,强调答案、证据字符串与文件来源的对应,适合检验检索增强与财报理解。

文档问答数值推理
专家参与金融从业者编写并复核
评分方式答案正确性 + 证据一致性
2021 · 2,789 份财报 / 8,281 个问题完整开放

FinQA

以财报文本和表格为上下文的数值推理数据集,金标包含可执行程序,适合把最终答案与中间计算过程分开评估。

文档问答数值推理
专家参与人工问题与程序标注,多阶段质检
评分方式执行结果 + 程序精确匹配
2025 · 金融专用 · 高风险专业推理公开对话与 rubrics

PRBench Finance

以专家编写的细粒度 rubrics 评估金融与法律高风险任务,不只看结论,还检查财务准确性、合规性、推理和专业沟通。

安全合规金融研究工作成果
专家参与182 名专业人士共同设计
评分方式多类别专家 criteria 的通过率
ICLR 2026 · 金融专用 · 635 个开放域问题完整开放

FinSearchComp

真实分析师式开放域金融搜索评测,覆盖实时数据获取、简单历史查找和复杂历史调查,包含全球与大中华市场。

金融研究工具调用交互智能体
专家参与70 名金融专家;多阶段质检
评分方式Rubric judge + 数值容差 + 专家抽检
ACL 2026 · 金融专用 · 多模态深度研究系统代码开放 / 评测集未公开

FinSight

端到端生成公司与行业专业报告,强调可编程数据分析、引用感知写作以及通过视觉反馈迭代图表。论文评测集为 20 个目标,但当前仓库未公开目标清单与金标报告。

金融研究工作成果工具调用多模态
专家参与6 名金融背景研究生人评
评分方式9 个自动指标 + 3 维人评
ACL 2026 · 金融专用 · 12 领域 / 58 主题完整开放

FinChain

用参数化符号模板与可执行 Python 同时验证答案和逐步推理,减少只看最终数字造成的假正确。

数值推理文档问答
专家参与专家评估校准 ChainEval
评分方式答案正确 + DTW 步骤对齐
TASK COVERAGE

任务覆盖矩阵

圆点表示核心任务,珊瑚色表示间接覆盖。它揭示传统问答集与真实工作流评测之间的断层。

评测集文档问答数值推理金融研究工作成果工具调用多轮交互多模态表格工作流桌面操作安全合规
GDPval———————
τ-bench / τ³-bench———————
BigFinanceBench———————
FinanceBench————————
FinQA————————
PRBench Finance———————
FinSearchComp———————
FinSight——————
FinChain————————
MultiFinBen———————
FinMRAGBench——————
FinCall-Surprise————————
Finch / FinWorkBench——————
AgencyBench——————
WorkArena++———————
OSWorld———————
GAIA———————
BankerToolBench——————
FinEvo-Bench——————
CLQT——————
FinVault———————
FraudBench (Policy-Grounded Banking Agents)———————
Finance Agent Benchmark———————
InvestorBench——————
StockBench——————
Agent Market Arena (AMA)——————
FinanceGym (Point-in-Time Deep Research)———————
FinToolBench——————
ReguSim / ReguBench———————
FinGuard-Bench————————
PayBench————————
OpenPM-Bench——————
RISCTrade——————
02
EVIDENCE LAYER

进入原始数据、代码审计与可执行 Demo。

OFFICIAL DATASET · UNEDITED

FinSearchComp 原始测试集 Demo

以下 12 条记录从官方 635 条 CC BY 4.0 数据文件按地区与 T1/T2/T3 分层抽取。问题、标准答案、标签和 judge prompt 均未翻译、改写或总结;完整原始文件可通过链接核验。

635原始问题
2区域子集
3任务层级
70金融专家
原始记录分布
OFFICIAL RECORD(T1)Time_Sensitive_Data_Fetching_001
1 / 2

上海金午盘的最新基准价

必答点:上海金SHAU.SGE午盘的最新基准价格(即最新交易日午盘收盘价) 精度要求:允许误差范围绝对数值±15

Time-Sensitive_Data_Fetching(Greater China)

展开官方 Judge 字段与全部原始字段
【问题】:{prompt}

【评分标准】:
{response_reference}

【实时信息】:
{ground_truth}

【学生回复】:
{response}
你是一个严格的判官。你的任务是根据金融问题、我提供的真实实时信息以及评分标准,给学生关于金融问题的回复打分。1分代表学生回复满足要求,0分代表不满足。请先分析再给出最终分数,最终分数如果打1分请输出{"score":1},打0分则输出{"score":0}。你必须输出严格的json。
具体规则如下:
- 如果学生回复为空,打0分。
- 如果学生回复不为空,而真实实时信息的数据是空的(没有数字),打分输出{"score":"null"}
- "评分标准-必答点"是学生必须至少回答出来的内容。
    - 如果学生回复不满足必答点(缺内容)则打0分。
    - 学生对于必答点给出多个相互矛盾的数字且有的数字不满足评分标准的阈值范围要求则要扣分。
    - 学生多答其他内容不算错,不扣分。
    - 比如必答点是"美元兑人民币最新在岸价格",模型在正确回答在岸的基础上还给出了离岸价格、中间价、在岸买入价和卖出价,以及再前几天的在岸价格,即便这些信息与"真实实时信息"数字不一致也不扣分;而模型给出了多个不同数据源的最新在岸价,有的数据不满足评分标准中的要求,则要扣分。
    - 你仅需关注信息本身,无需关注时间,无需因为问"最新价格"而学生只回复了"x月x日价格"而扣分。
- "真实实时信息"是对于题目的用户问题和询问时间的**正确回复信息**,你应该完全相信它。如果学生回复满足必答点,请以真实实时信息为ground truth核对学生回答是否正确,并按照"评分标准-精度要求"评分,满足要求1分,不满足0分。
    - 如果"评分标准-精度要求"是"仅允许四舍五入误差",则允许学生给的数字和真实实时信息有因保留小数位数不同而造成的四舍五入的误差。比如12.26 vs 12.256视为一致,给1分。
    - 如果"评分标准-精度要求"是"答案落在最高价最低价区间即可",则学生给的数字落在真实实时信息中的最大值和最小值之间即可,同时仅允许四舍五入误差。比如真实实时信息给的最大值12.256,最小值12.152,则学生答案12.26视为落在正确区间给1分,而学生答案12.27视为没落在正确区间给0分。
    - 如果"评分标准-精度要求"是"允许误差范围绝对数值±xx",则学生给的数字落在真实实时信息数字的±xx之内都算对。比如要求"允许误差范围绝对数值±0.01%",真实实时信息中的数字是13.56%,则学生答案落在[13.55%,13.57%]都算对,给1分;没落在该区间给0分。
    - 如果"评分标准-精度要求"是"在最高价最低价区间基础上扩大范围绝对数值a",则正确的范围是真实实时信息中的"最大值+a"到"最小值-a"之间。
注意:
- 你仅需核对股价/指数等数值,无需核对日期,只要股价/指数的数值正确代表学生回复正确。你无需因为学生回复"最新/昨日"而参考信息中时间是特定的"x月x日"而扣分,也无需因为学生回复的日期和参考信息对不齐而扣分(毕竟存在时区以及交易日/自然日口径问题)。
- 真实实时信息中"昨收"和"收盘价"是不同的概念,"收盘价"是所查日期当天的收盘价,"昨收"是再前一个交易日的收盘价。

以下示例中的时间均为虚构,请勿参考具体数字
示例1:
【问题】:今天NVDA的股市如何?
【评分标准】:
必答点:英伟达最新的开盘价、最高价、最低价、涨跌幅度(百分比)
精度要求:仅允许四舍五入误差
【实时信息】:
{
 "data": {
 "symbol": "NVDA",
 "open": "112.905",
 "high": "114.665",
 "low": "112.660",
 "price": "113.820",
 "latest_trading_day": "20250426",
 "previous_close": "114.500",
 "change": "-0.680",
 "change_percent": "-0.59%"
 }
}
【学生回复】:
根据北京时间4月27日17:47的最新消息,截至美东最近交易日收盘,英伟达(NVDA)的股价下跌0.59%。

当日英伟达股价开盘价为112.91美元,最高价114.67美元,最低价112.66美元,成交量1.3亿,成交额151.5亿美元。盘后股价为113.28美元,较收盘价下跌0.54美元,跌幅0.47%。
【你的输出】:
分析:
学生回复是否满足必答点:是;
该数字是否一致(仅允许四舍五入误差):开盘价、最高价、最低价仅存在四舍五入误差,因此是一致的;学生回复‘跌幅0.47%’与实时信息的‘"change_percent": "-0.59%"’不一致;
不满足全部要求,最终得0分;
分数:
{"score":0}

示例2:
【问题】:人民币兑美元在岸汇率
【评分标准】:
必答点:人民币兑美元最新在岸汇率
精度要求:答案落在最高价最低价区间即可
【实时信息】:
    {
      "currency_pair": "USD/CNY",
      "exchange_per": "-0.0403",
      "exchange_range": "-0.0029",
      "exchange_rate": "7.1871",
      "exchange_rate_hi": "7.1934",
      "exchange_rate_lo": "7.1855",
      "open_exchange_rate": "7.1900",
      "pre_close_exchange_rate": "7.1900",
      "trading_date": "20250605",
    }
【学生回复】:
截至2025年6月5日北京时间03:00,在岸人民币兑美元(CNY)收报7.1905元,较前一交易日夜盘收盘跌26点,成交量360.94亿美元。

此外,2025年6月5日银行间外汇市场人民币汇率中间价为1美元对人民币7.1729元,较前一交易日调升32基点。
【你的输出】:
分析:
学生答出了必答点:是;
该数字是否满足精度要求:实时信息的阈值范围是[7.1855,7.1934],学生回复的数字7.1905落在该范围内,满足要求。
最终分数:{"score":1}

示例3:
【问题】:comex黄金最新价格
【评分标准】:
必答点:comex黄金最新价格
精度要求:允许误差范围绝对数值±0.6
【实时信息】:
{
  "res": {
    "request": "w.wsq(\"GC.CMX\",\"rt_date,rt_time,rt_last\")",
    "code": 0,
    "data": {
      "GC.CMX": {
        "RT_DATE": 20250619,
        "RT_TIME": 90628,
        "RT_LAST": 3383.2000
      }
    }
  }
}
【学生回复】:
根据同花顺期货通数据,截至 2025 年 6 月 18 日 23:22,纽约金(COMEX 黄金期货)价格为 3382.7 美元 / 盎司,较前一交易日下跌 25.4 美元,跌幅为 0.75%,最高达到 3405.2 美元 / 盎司,最低为 3363.6 美元 / 盎司
【你的输出】:
分析:
学生答案满足必答点:是;
数字是否满足精度要求:实时信息的阈值3383.2000±0.6,即[3382.6000,3383.8000],学生回复的数字3382.7落在该范围内,满足要求。
最终分数:{"score":1}

示例4:
【问题】:最新苹果股价
【评分标准】:
必答点:苹果最新股价(即最新收盘价)
精度要求:仅允许四舍五入误差
【实时信息】:
"AAPL.O": {"RT_TIME": "200000", "RT_LAST": "214.05", "RT_DATE": "20250728"}
【学生回复】:
苹果最新股价$214.05 USD。另有数据源显示苹果最新股价:开盘价$214.70,收盘价$213.88
【你的输出】:
分析:
学生答案满足必答点:是;
该数字是否满足精度要求:学生回复中苹果最新股价$214.05 USD和实时信息一致,而收盘价$213.88不满足精度要求。
最终分数:{"score":0}

========示例结束,以下是你的任务========
{
  "prompt_id": "(T1)Time_Sensitive_Data_Fetching_001",
  "prompt": "上海金午盘的最新基准价",
  "response_reference": "必答点:上海金SHAU.SGE午盘的最新基准价格(即最新交易日午盘收盘价)\n精度要求:允许误差范围绝对数值±15",
  "judge_prompt_template": "【问题】:{prompt}\n\n【评分标准】:\n{response_reference}\n\n【实时信息】:\n{ground_truth}\n\n【学生回复】:\n{response}",
  "judge_system_prompt": "你是一个严格的判官。你的任务是根据金融问题、我提供的真实实时信息以及评分标准,给学生关于金融问题的回复打分。1分代表学生回复满足要求,0分代表不满足。请先分析再给出最终分数,最终分数如果打1分请输出{\"score\":1},打0分则输出{\"score\":0}。你必须输出严格的json。\n具体规则如下:\n- 如果学生回复为空,打0分。\n- 如果学生回复不为空,而真实实时信息的数据是空的(没有数字),打分输出{\"score\":\"null\"}\n- \"评分标准-必答点\"是学生必须至少回答出来的内容。\n    - 如果学生回复不满足必答点(缺内容)则打0分。\n    - 学生对于必答点给出多个相互矛盾的数字且有的数字不满足评分标准的阈值范围要求则要扣分。\n    - 学生多答其他内容不算错,不扣分。\n    - 比如必答点是\"美元兑人民币最新在岸价格\",模型在正确回答在岸的基础上还给出了离岸价格、中间价、在岸买入价和卖出价,以及再前几天的在岸价格,即便这些信息与\"真实实时信息\"数字不一致也不扣分;而模型给出了多个不同数据源的最新在岸价,有的数据不满足评分标准中的要求,则要扣分。\n    - 你仅需关注信息本身,无需关注时间,无需因为问\"最新价格\"而学生只回复了\"x月x日价格\"而扣分。\n- \"真实实时信息\"是对于题目的用户问题和询问时间的**正确回复信息**,你应该完全相信它。如果学生回复满足必答点,请以真实实时信息为ground truth核对学生回答是否正确,并按照\"评分标准-精度要求\"评分,满足要求1分,不满足0分。\n    - 如果\"评分标准-精度要求\"是\"仅允许四舍五入误差\",则允许学生给的数字和真实实时信息有因保留小数位数不同而造成的四舍五入的误差。比如12.26 vs 12.256视为一致,给1分。\n    - 如果\"评分标准-精度要求\"是\"答案落在最高价最低价区间即可\",则学生给的数字落在真实实时信息中的最大值和最小值之间即可,同时仅允许四舍五入误差。比如真实实时信息给的最大值12.256,最小值12.152,则学生答案12.26视为落在正确区间给1分,而学生答案12.27视为没落在正确区间给0分。\n    - 如果\"评分标准-精度要求\"是\"允许误差范围绝对数值±xx\",则学生给的数字落在真实实时信息数字的±xx之内都算对。比如要求\"允许误差范围绝对数值±0.01%\",真实实时信息中的数字是13.56%,则学生答案落在[13.55%,13.57%]都算对,给1分;没落在该区间给0分。\n    - 如果\"评分标准-精度要求\"是\"在最高价最低价区间基础上扩大范围绝对数值a\",则正确的范围是真实实时信息中的\"最大值+a\"到\"最小值-a\"之间。\n注意:\n- 你仅需核对股价/指数等数值,无需核对日期,只要股价/指数的数值正确代表学生回复正确。你无需因为学生回复\"最新/昨日\"而参考信息中时间是特定的\"x月x日\"而扣分,也无需因为学生回复的日期和参考信息对不齐而扣分(毕竟存在时区以及交易日/自然日口径问题)。\n- 真实实时信息中\"昨收\"和\"收盘价\"是不同的概念,\"收盘价\"是所查日期当天的收盘价,\"昨收\"是再前一个交易日的收盘价。\n\n以下示例中的时间均为虚构,请勿参考具体数字\n示例1:\n【问题】:今天NVDA的股市如何?\n【评分标准】:\n必答点:英伟达最新的开盘价、最高价、最低价、涨跌幅度(百分比)\n精度要求:仅允许四舍五入误差\n【实时信息】:\n{\n \"data\": {\n \"symbol\": \"NVDA\",\n \"open\": \"112.905\",\n \"high\": \"114.665\",\n \"low\": \"112.660\",\n \"price\": \"113.820\",\n \"latest_trading_day\": \"20250426\",\n \"previous_close\": \"114.500\",\n \"change\": \"-0.680\",\n \"change_percent\": \"-0.59%\"\n }\n}\n【学生回复】:\n根据北京时间4月27日17:47的最新消息,截至美东最近交易日收盘,英伟达(NVDA)的股价下跌0.59%。\n\n当日英伟达股价开盘价为112.91美元,最高价114.67美元,最低价112.66美元,成交量1.3亿,成交额151.5亿美元。盘后股价为113.28美元,较收盘价下跌0.54美元,跌幅0.47%。\n【你的输出】:\n分析:\n学生回复是否满足必答点:是;\n该数字是否一致(仅允许四舍五入误差):开盘价、最高价、最低价仅存在四舍五入误差,因此是一致的;学生回复‘跌幅0.47%’与实时信息的‘\"change_percent\": \"-0.59%\"’不一致;\n不满足全部要求,最终得0分;\n分数:\n{\"score\":0}\n\n示例2:\n【问题】:人民币兑美元在岸汇率\n【评分标准】:\n必答点:人民币兑美元最新在岸汇率\n精度要求:答案落在最高价最低价区间即可\n【实时信息】:\n    {\n      \"currency_pair\": \"USD/CNY\",\n      \"exchange_per\": \"-0.0403\",\n      \"exchange_range\": \"-0.0029\",\n      \"exchange_rate\": \"7.1871\",\n      \"exchange_rate_hi\": \"7.1934\",\n      \"exchange_rate_lo\": \"7.1855\",\n      \"open_exchange_rate\": \"7.1900\",\n      \"pre_close_exchange_rate\": \"7.1900\",\n      \"trading_date\": \"20250605\",\n    }\n【学生回复】:\n截至2025年6月5日北京时间03:00,在岸人民币兑美元(CNY)收报7.1905元,较前一交易日夜盘收盘跌26点,成交量360.94亿美元。\n\n此外,2025年6月5日银行间外汇市场人民币汇率中间价为1美元对人民币7.1729元,较前一交易日调升32基点。\n【你的输出】:\n分析:\n学生答出了必答点:是;\n该数字是否满足精度要求:实时信息的阈值范围是[7.1855,7.1934],学生回复的数字7.1905落在该范围内,满足要求。\n最终分数:{\"score\":1}\n\n示例3:\n【问题】:comex黄金最新价格\n【评分标准】:\n必答点:comex黄金最新价格\n精度要求:允许误差范围绝对数值±0.6\n【实时信息】:\n{\n  \"res\": {\n    \"request\": \"w.wsq(\\\"GC.CMX\\\",\\\"rt_date,rt_time,rt_last\\\")\",\n    \"code\": 0,\n    \"data\": {\n      \"GC.CMX\": {\n        \"RT_DATE\": 20250619,\n        \"RT_TIME\": 90628,\n        \"RT_LAST\": 3383.2000\n      }\n    }\n  }\n}\n【学生回复】:\n根据同花顺期货通数据,截至 2025 年 6 月 18 日 23:22,纽约金(COMEX 黄金期货)价格为 3382.7 美元 / 盎司,较前一交易日下跌 25.4 美元,跌幅为 0.75%,最高达到 3405.2 美元 / 盎司,最低为 3363.6 美元 / 盎司\n【你的输出】:\n分析:\n学生答案满足必答点:是;\n数字是否满足精度要求:实时信息的阈值3383.2000±0.6,即[3382.6000,3383.8000],学生回复的数字3382.7落在该范围内,满足要求。\n最终分数:{\"score\":1}\n\n示例4:\n【问题】:最新苹果股价\n【评分标准】:\n必答点:苹果最新股价(即最新收盘价)\n精度要求:仅允许四舍五入误差\n【实时信息】:\n\"AAPL.O\": {\"RT_TIME\": \"200000\", \"RT_LAST\": \"214.05\", \"RT_DATE\": \"20250728\"}\n【学生回复】:\n苹果最新股价$214.05 USD。另有数据源显示苹果最新股价:开盘价$214.70,收盘价$213.88\n【你的输出】:\n分析:\n学生答案满足必答点:是;\n该数字是否满足精度要求:学生回复中苹果最新股价$214.05 USD和实时信息一致,而收盘价$213.88不满足精度要求。\n最终分数:{\"score\":0}\n\n========示例结束,以下是你的任务========",
  "wind_ticker": "SHAU.SGE",
  "akshare_ticker": "",
  "ground_truth": "{\"SHAU___SGE\": {\"RT_TIME\": \"195500\",\"RT_LAST\": \"775.51\",\"RT_DATE\": \"20250814\"}}",
  "time": "2025/8/14",
  "label": "Time-Sensitive_Data_Fetching(Greater China)"
}

来源版本:randomtutu/FinSearchComp main · data/finsearchcomp_data.json · SHA ff89538172a93e10e85f04ca666bbf5adba2df6d · Demo 按 2 个地区 × 3 类任务分层抽样;页面仅改变排版,不改变字段内容。

PAPER × CODE AUDIT

FinSight:评测集与开源代码

名称核对:未检索到对应的 “FirmSight” 金融论文;此处分析前述 ACL 2026 FinSight。论文声称的 benchmark 与仓库实际开放内容分开展示。

开放性结论生成系统代码:已开放20 个评测目标清单:未在仓库找到券商金标报告:未在仓库找到论文评测脚本:未在仓库找到
20评测目标
10公司级
10行业级
>20金标报告页数门槛
>20图表数量门槛
A

Company-level

论文描述:从权威金融平台选择不同市场、行业与市值的公司;覆盖 A 股、港股等。每个目标配一份专业券商深度报告作为 golden reference。

公开状态

完整 10 家公司名单和对应金标报告目前未在官方仓库发布。论文附录只展示商汤科技案例。

B

Industry-level

论文描述:选择金融平台上的高关注行业作为研究目标,使用专业机构行业报告作为 golden reference。

公开状态

完整 10 个行业名单和对应金标报告目前未在官方仓库发布。仓库公开了“金融 AI Agent 发展”生成报告样例。

Research target→专业券商金标报告→模型生成长报告→9 项 0–10 分评价
03
EXAMPLE LAYER

把输入、输出和评分点放在同一个可检查界面。

INSTANCE INSPECTOR

一条数据,拆开来看

交互查看不同评测范式的数据形态。rubric 采用“可独立判断 + 明确权重”的结构,便于人评与自动 judge 对齐。

44 个职业 / 9 个行业工作成果公开金标子集

Input / Context

角色:金融与投资分析师 上下文:给定客户风险偏好、持仓表、市场假设与合规限制。 任务:审阅组合并提交面向投资委员会的建议备忘录。

Expected Deliverable

结构化备忘录(PDF/文档):风险暴露、关键计算、再平衡建议、假设与限制。

Scoring Rubric

R1正确识别组合的集中度与主要风险暴露,并引用附件证据。+4 pts
R2建议与客户风险约束一致,计算可复核。+5 pts
R3明确披露假设、不确定性与潜在利益冲突。+3 pts

样例用于说明 schema 与可视化方式;请从“公开数据”链接获取原始条目并遵守其许可证。仓库 data/benchmarks.json 是页面的唯一内容源。

OFFICIAL TEMPLATE × APPENDIX AUDIT

FinChain:从模板到逐步评分

页面直接对应 ACL 2026 正式论文与官方仓库。原始开放对象主要是 58 个 Python 主题文件和 ChainEval 代码,而不是一个静态、不可变的 JSON 测试表。

开放性结论290 个生成模板:开放ChainEval:开放固定生成后的 2,900 条 JSONL:仓库未附带随机 seed 使实例可再生成
12金融领域
58金融主题
290Python 模板
10×每模板 seeds
2,900可生成实例
Accounting & Financial Reporting4 topics
Corporate Finance5 topics
Crypto Finance7 topics
Finance Regulation5 topics
Financial Markets4 topics
Financial Ratios4 topics
Fintech3 topics
Investment Analysis5 topics
Mergers & Acquisitions5 topics
Personal Finance5 topics
Risk Management7 topics
Sustainable Finance5 topics
Basic116 templates平均 2.01 步;每主题 2 个模板
Intermediate116 templates平均 2.97 步;每主题 2 个模板
Advanced58 templates平均 3.90 步;每主题 1 个模板

论文称数据集为 2,900 个实例;仓库当前开放的是生成这些实例的模板代码。每次运行模板会随机产生 seed 和参数,因此页面不把自行生成的一条记录冒充为论文唯一固定测试条目。

04
HUMAN × AGENT LAYER

用人类基线、教学反馈和迁移测试闭合评测循环。

HUMAN PARTICIPATION PROTOTYPE

人进入 Arena 后,实际做什么?

同一个冻结信息世界、同一套核心 rubric。这里完整演示人类分析师、专家教师和专家裁判在 E1–E3 中的参与方式。

02 / 当前任务

基于截至 2020-08-21 可见的信息,更新 2020 全年 EPS 判断,并说明相较 Q1 判断为何变化。

你如何处理已有经验?
0/3 必填项完成 · 已引用 0 条证据
① 人独立作答建立 Human Baseline
→
② 专家纠正 Agent生成带来源的教学经验
→
③ 下一任务重测检查纠正是否保留与迁移
→
④ 专家裁判仲裁处理开放式结论与分歧

Demo 中的即时分数只用于演示交互;正式 Arena 使用冻结金标、原子 rubric、双人盲评和分歧仲裁。人类与 Agent 共用结果评分,时间、成本和记忆轨迹分别记录。

05
RESEARCH LIBRARY

最后进入 benchmark 深度档案与论文索引。

DATASET-BY-DATASET AUDIT

其余 Benchmark 深度档案

所有 Demo 都标注来源状态:只有取自官方文件的记录才称为原始数据;概念示意不会再伪装成测试样例。

2025 · 公开金标子集

GDPval

1,320full tasks
220open gold tasks
44occupations
9industries
30tasks / occupation

以真实职业工作成果为目标的评测。金融与保险行业覆盖金融分析师、财务经理、理财顾问、金融销售和客服等岗位。

  • Finance & Insurance 下含 Customer Service、Financial & Investment Analysts、Financial Managers、Personal Financial Advisors、Financial Services Sales Agents
  • 任务不是短答案:输入含 prompt、reference files、工作背景;输出可为文档、演示、图纸、表格或多媒体
  • 当前版本是 one-shot,不含与用户反复修改交付物的过程
PAPER DOSSIERS

全部论文档案

每篇统一展示会议、摘要导读、主要卖点、评测设计、专家与 rubric、附录构建线索。摘要为中文转述,点击论文可核对原文。

ABSTRACT · 中文转述

用参数化符号模板与可执行 Python 同时验证答案和逐步推理,减少只看最终数字造成的假正确。

主要卖点
  1. 58 主题的可执行符号金融推理
  2. 逐步金标与最终答案同时可验证
  3. ChainEval 用 DTW 对齐不同长度推理链
评测设计要点

覆盖:金融专用 · 12 领域 / 58 主题

任务:数值推理 · 文档问答

专家:专家评估校准 ChainEval

Rubric:答案正确 + DTW 步骤对齐

APPENDIX · 构建细节

附录 A–B 公开模板生成 prompt、自动验证约束、10 位专家校准与逐模板审核、问题标签、返修统计及两套 1–5 分人评 rubric;附录 C–F 给出模型配置、指标消融、分领域结果和错误类型。