GDPval
以真实职业工作成果为目标的评测。金融与保险行业覆盖金融分析师、财务经理、理财顾问、金融销售和客服等岗位。
从领域预训练、指令微调和金融推理模型,到 benchmark、真实工作流、专家流程与评分规则:在一张图谱里回答“模型从哪来、开放到哪、测什么、怎么得分”。
模型图谱已独立成页;本页专注 benchmark、开放性证据与人机闭环评测。
从构建方法、任务覆盖到代表性评测集。
专家不是最终“打个分”才出现,而是贯穿任务定义、金标制作、rubric 编写、盲评与争议仲裁。
从真实金融工作流与岗位成果物反推能力
从业者提供提示、上下文、附件与参考答案
另一位专家检查真实性、可解性与歧义
把正确性拆成可独立验证、带权重的评分点
人类盲评 + judge 校准,记录分歧与置信度
“开放”区分公开完整集与公开子集;所有 Demo 均为结构示意或基于公开字段的节选,不替代原始数据许可。
以真实职业工作成果为目标的评测。金融与保险行业覆盖金融分析师、财务经理、理财顾问、金融销售和客服等岗位。
让工具型智能体与模拟用户进行动态多轮对话,并依据领域政策与数据库最终状态判断任务是否真正完成;最新版加入 banking。
评测从找数、口径判断到计算的完整金融研究轨迹;公开 50 条分层子集,包含参考答案、逐点 rubric、工具轨迹和多模型评分。
围绕 SEC 文件构建的开放式金融问答,强调答案、证据字符串与文件来源的对应,适合检验检索增强与财报理解。
以财报文本和表格为上下文的数值推理数据集,金标包含可执行程序,适合把最终答案与中间计算过程分开评估。
以专家编写的细粒度 rubrics 评估金融与法律高风险任务,不只看结论,还检查财务准确性、合规性、推理和专业沟通。
真实分析师式开放域金融搜索评测,覆盖实时数据获取、简单历史查找和复杂历史调查,包含全球与大中华市场。
端到端生成公司与行业专业报告,强调可编程数据分析、引用感知写作以及通过视觉反馈迭代图表。论文评测集为 20 个目标,但当前仓库未公开目标清单与金标报告。
用参数化符号模板与可执行 Python 同时验证答案和逐步推理,减少只看最终数字造成的假正确。
圆点表示核心任务,珊瑚色表示间接覆盖。它揭示传统问答集与真实工作流评测之间的断层。
| 评测集 | 文档问答 | 数值推理 | 金融研究 | 工作成果 | 工具调用 | 多轮交互 | 多模态 | 表格工作流 | 桌面操作 | 安全合规 |
|---|---|---|---|---|---|---|---|---|---|---|
| GDPval | — | — | — | — | — | — | — | |||
| τ-bench / τ³-bench | — | — | — | — | — | — | — | |||
| BigFinanceBench | — | — | — | — | — | — | — | |||
| FinanceBench | — | — | — | — | — | — | — | — | ||
| FinQA | — | — | — | — | — | — | — | — | ||
| PRBench Finance | — | — | — | — | — | — | — | |||
| FinSearchComp | — | — | — | — | — | — | — | |||
| FinSight | — | — | — | — | — | — | ||||
| FinChain | — | — | — | — | — | — | — | — | ||
| MultiFinBen | — | — | — | — | — | — | — | |||
| FinMRAGBench | — | — | — | — | — | — | ||||
| FinCall-Surprise | — | — | — | — | — | — | — | — | ||
| Finch / FinWorkBench | — | — | — | — | — | — | ||||
| AgencyBench | — | — | — | — | — | — | ||||
| WorkArena++ | — | — | — | — | — | — | — | |||
| OSWorld | — | — | — | — | — | — | — | |||
| GAIA | — | — | — | — | — | — | — | |||
| BankerToolBench | — | — | — | — | — | — | ||||
| FinEvo-Bench | — | — | — | — | — | — | ||||
| CLQT | — | — | — | — | — | — | ||||
| FinVault | — | — | — | — | — | — | — | |||
| FraudBench (Policy-Grounded Banking Agents) | — | — | — | — | — | — | — | |||
| Finance Agent Benchmark | — | — | — | — | — | — | — | |||
| InvestorBench | — | — | — | — | — | — | ||||
| StockBench | — | — | — | — | — | — | ||||
| Agent Market Arena (AMA) | — | — | — | — | — | — | ||||
| FinanceGym (Point-in-Time Deep Research) | — | — | — | — | — | — | — | |||
| FinToolBench | — | — | — | — | — | — | ||||
| ReguSim / ReguBench | — | — | — | — | — | — | — | |||
| FinGuard-Bench | — | — | — | — | — | — | — | — | ||
| PayBench | — | — | — | — | — | — | — | — | ||
| OpenPM-Bench | — | — | — | — | — | — | ||||
| RISCTrade | — | — | — | — | — | — |
进入原始数据、代码审计与可执行 Demo。
以下 12 条记录从官方 635 条 CC BY 4.0 数据文件按地区与 T1/T2/T3 分层抽取。问题、标准答案、标签和 judge prompt 均未翻译、改写或总结;完整原始文件可通过链接核验。
上海金午盘的最新基准价
必答点:上海金SHAU.SGE午盘的最新基准价格(即最新交易日午盘收盘价) 精度要求:允许误差范围绝对数值±15
Time-Sensitive_Data_Fetching(Greater China)
【问题】:{prompt}
【评分标准】:
{response_reference}
【实时信息】:
{ground_truth}
【学生回复】:
{response}你是一个严格的判官。你的任务是根据金融问题、我提供的真实实时信息以及评分标准,给学生关于金融问题的回复打分。1分代表学生回复满足要求,0分代表不满足。请先分析再给出最终分数,最终分数如果打1分请输出{"score":1},打0分则输出{"score":0}。你必须输出严格的json。
具体规则如下:
- 如果学生回复为空,打0分。
- 如果学生回复不为空,而真实实时信息的数据是空的(没有数字),打分输出{"score":"null"}
- "评分标准-必答点"是学生必须至少回答出来的内容。
- 如果学生回复不满足必答点(缺内容)则打0分。
- 学生对于必答点给出多个相互矛盾的数字且有的数字不满足评分标准的阈值范围要求则要扣分。
- 学生多答其他内容不算错,不扣分。
- 比如必答点是"美元兑人民币最新在岸价格",模型在正确回答在岸的基础上还给出了离岸价格、中间价、在岸买入价和卖出价,以及再前几天的在岸价格,即便这些信息与"真实实时信息"数字不一致也不扣分;而模型给出了多个不同数据源的最新在岸价,有的数据不满足评分标准中的要求,则要扣分。
- 你仅需关注信息本身,无需关注时间,无需因为问"最新价格"而学生只回复了"x月x日价格"而扣分。
- "真实实时信息"是对于题目的用户问题和询问时间的**正确回复信息**,你应该完全相信它。如果学生回复满足必答点,请以真实实时信息为ground truth核对学生回答是否正确,并按照"评分标准-精度要求"评分,满足要求1分,不满足0分。
- 如果"评分标准-精度要求"是"仅允许四舍五入误差",则允许学生给的数字和真实实时信息有因保留小数位数不同而造成的四舍五入的误差。比如12.26 vs 12.256视为一致,给1分。
- 如果"评分标准-精度要求"是"答案落在最高价最低价区间即可",则学生给的数字落在真实实时信息中的最大值和最小值之间即可,同时仅允许四舍五入误差。比如真实实时信息给的最大值12.256,最小值12.152,则学生答案12.26视为落在正确区间给1分,而学生答案12.27视为没落在正确区间给0分。
- 如果"评分标准-精度要求"是"允许误差范围绝对数值±xx",则学生给的数字落在真实实时信息数字的±xx之内都算对。比如要求"允许误差范围绝对数值±0.01%",真实实时信息中的数字是13.56%,则学生答案落在[13.55%,13.57%]都算对,给1分;没落在该区间给0分。
- 如果"评分标准-精度要求"是"在最高价最低价区间基础上扩大范围绝对数值a",则正确的范围是真实实时信息中的"最大值+a"到"最小值-a"之间。
注意:
- 你仅需核对股价/指数等数值,无需核对日期,只要股价/指数的数值正确代表学生回复正确。你无需因为学生回复"最新/昨日"而参考信息中时间是特定的"x月x日"而扣分,也无需因为学生回复的日期和参考信息对不齐而扣分(毕竟存在时区以及交易日/自然日口径问题)。
- 真实实时信息中"昨收"和"收盘价"是不同的概念,"收盘价"是所查日期当天的收盘价,"昨收"是再前一个交易日的收盘价。
以下示例中的时间均为虚构,请勿参考具体数字
示例1:
【问题】:今天NVDA的股市如何?
【评分标准】:
必答点:英伟达最新的开盘价、最高价、最低价、涨跌幅度(百分比)
精度要求:仅允许四舍五入误差
【实时信息】:
{
"data": {
"symbol": "NVDA",
"open": "112.905",
"high": "114.665",
"low": "112.660",
"price": "113.820",
"latest_trading_day": "20250426",
"previous_close": "114.500",
"change": "-0.680",
"change_percent": "-0.59%"
}
}
【学生回复】:
根据北京时间4月27日17:47的最新消息,截至美东最近交易日收盘,英伟达(NVDA)的股价下跌0.59%。
当日英伟达股价开盘价为112.91美元,最高价114.67美元,最低价112.66美元,成交量1.3亿,成交额151.5亿美元。盘后股价为113.28美元,较收盘价下跌0.54美元,跌幅0.47%。
【你的输出】:
分析:
学生回复是否满足必答点:是;
该数字是否一致(仅允许四舍五入误差):开盘价、最高价、最低价仅存在四舍五入误差,因此是一致的;学生回复‘跌幅0.47%’与实时信息的‘"change_percent": "-0.59%"’不一致;
不满足全部要求,最终得0分;
分数:
{"score":0}
示例2:
【问题】:人民币兑美元在岸汇率
【评分标准】:
必答点:人民币兑美元最新在岸汇率
精度要求:答案落在最高价最低价区间即可
【实时信息】:
{
"currency_pair": "USD/CNY",
"exchange_per": "-0.0403",
"exchange_range": "-0.0029",
"exchange_rate": "7.1871",
"exchange_rate_hi": "7.1934",
"exchange_rate_lo": "7.1855",
"open_exchange_rate": "7.1900",
"pre_close_exchange_rate": "7.1900",
"trading_date": "20250605",
}
【学生回复】:
截至2025年6月5日北京时间03:00,在岸人民币兑美元(CNY)收报7.1905元,较前一交易日夜盘收盘跌26点,成交量360.94亿美元。
此外,2025年6月5日银行间外汇市场人民币汇率中间价为1美元对人民币7.1729元,较前一交易日调升32基点。
【你的输出】:
分析:
学生答出了必答点:是;
该数字是否满足精度要求:实时信息的阈值范围是[7.1855,7.1934],学生回复的数字7.1905落在该范围内,满足要求。
最终分数:{"score":1}
示例3:
【问题】:comex黄金最新价格
【评分标准】:
必答点:comex黄金最新价格
精度要求:允许误差范围绝对数值±0.6
【实时信息】:
{
"res": {
"request": "w.wsq(\"GC.CMX\",\"rt_date,rt_time,rt_last\")",
"code": 0,
"data": {
"GC.CMX": {
"RT_DATE": 20250619,
"RT_TIME": 90628,
"RT_LAST": 3383.2000
}
}
}
}
【学生回复】:
根据同花顺期货通数据,截至 2025 年 6 月 18 日 23:22,纽约金(COMEX 黄金期货)价格为 3382.7 美元 / 盎司,较前一交易日下跌 25.4 美元,跌幅为 0.75%,最高达到 3405.2 美元 / 盎司,最低为 3363.6 美元 / 盎司
【你的输出】:
分析:
学生答案满足必答点:是;
数字是否满足精度要求:实时信息的阈值3383.2000±0.6,即[3382.6000,3383.8000],学生回复的数字3382.7落在该范围内,满足要求。
最终分数:{"score":1}
示例4:
【问题】:最新苹果股价
【评分标准】:
必答点:苹果最新股价(即最新收盘价)
精度要求:仅允许四舍五入误差
【实时信息】:
"AAPL.O": {"RT_TIME": "200000", "RT_LAST": "214.05", "RT_DATE": "20250728"}
【学生回复】:
苹果最新股价$214.05 USD。另有数据源显示苹果最新股价:开盘价$214.70,收盘价$213.88
【你的输出】:
分析:
学生答案满足必答点:是;
该数字是否满足精度要求:学生回复中苹果最新股价$214.05 USD和实时信息一致,而收盘价$213.88不满足精度要求。
最终分数:{"score":0}
========示例结束,以下是你的任务========{
"prompt_id": "(T1)Time_Sensitive_Data_Fetching_001",
"prompt": "上海金午盘的最新基准价",
"response_reference": "必答点:上海金SHAU.SGE午盘的最新基准价格(即最新交易日午盘收盘价)\n精度要求:允许误差范围绝对数值±15",
"judge_prompt_template": "【问题】:{prompt}\n\n【评分标准】:\n{response_reference}\n\n【实时信息】:\n{ground_truth}\n\n【学生回复】:\n{response}",
"judge_system_prompt": "你是一个严格的判官。你的任务是根据金融问题、我提供的真实实时信息以及评分标准,给学生关于金融问题的回复打分。1分代表学生回复满足要求,0分代表不满足。请先分析再给出最终分数,最终分数如果打1分请输出{\"score\":1},打0分则输出{\"score\":0}。你必须输出严格的json。\n具体规则如下:\n- 如果学生回复为空,打0分。\n- 如果学生回复不为空,而真实实时信息的数据是空的(没有数字),打分输出{\"score\":\"null\"}\n- \"评分标准-必答点\"是学生必须至少回答出来的内容。\n - 如果学生回复不满足必答点(缺内容)则打0分。\n - 学生对于必答点给出多个相互矛盾的数字且有的数字不满足评分标准的阈值范围要求则要扣分。\n - 学生多答其他内容不算错,不扣分。\n - 比如必答点是\"美元兑人民币最新在岸价格\",模型在正确回答在岸的基础上还给出了离岸价格、中间价、在岸买入价和卖出价,以及再前几天的在岸价格,即便这些信息与\"真实实时信息\"数字不一致也不扣分;而模型给出了多个不同数据源的最新在岸价,有的数据不满足评分标准中的要求,则要扣分。\n - 你仅需关注信息本身,无需关注时间,无需因为问\"最新价格\"而学生只回复了\"x月x日价格\"而扣分。\n- \"真实实时信息\"是对于题目的用户问题和询问时间的**正确回复信息**,你应该完全相信它。如果学生回复满足必答点,请以真实实时信息为ground truth核对学生回答是否正确,并按照\"评分标准-精度要求\"评分,满足要求1分,不满足0分。\n - 如果\"评分标准-精度要求\"是\"仅允许四舍五入误差\",则允许学生给的数字和真实实时信息有因保留小数位数不同而造成的四舍五入的误差。比如12.26 vs 12.256视为一致,给1分。\n - 如果\"评分标准-精度要求\"是\"答案落在最高价最低价区间即可\",则学生给的数字落在真实实时信息中的最大值和最小值之间即可,同时仅允许四舍五入误差。比如真实实时信息给的最大值12.256,最小值12.152,则学生答案12.26视为落在正确区间给1分,而学生答案12.27视为没落在正确区间给0分。\n - 如果\"评分标准-精度要求\"是\"允许误差范围绝对数值±xx\",则学生给的数字落在真实实时信息数字的±xx之内都算对。比如要求\"允许误差范围绝对数值±0.01%\",真实实时信息中的数字是13.56%,则学生答案落在[13.55%,13.57%]都算对,给1分;没落在该区间给0分。\n - 如果\"评分标准-精度要求\"是\"在最高价最低价区间基础上扩大范围绝对数值a\",则正确的范围是真实实时信息中的\"最大值+a\"到\"最小值-a\"之间。\n注意:\n- 你仅需核对股价/指数等数值,无需核对日期,只要股价/指数的数值正确代表学生回复正确。你无需因为学生回复\"最新/昨日\"而参考信息中时间是特定的\"x月x日\"而扣分,也无需因为学生回复的日期和参考信息对不齐而扣分(毕竟存在时区以及交易日/自然日口径问题)。\n- 真实实时信息中\"昨收\"和\"收盘价\"是不同的概念,\"收盘价\"是所查日期当天的收盘价,\"昨收\"是再前一个交易日的收盘价。\n\n以下示例中的时间均为虚构,请勿参考具体数字\n示例1:\n【问题】:今天NVDA的股市如何?\n【评分标准】:\n必答点:英伟达最新的开盘价、最高价、最低价、涨跌幅度(百分比)\n精度要求:仅允许四舍五入误差\n【实时信息】:\n{\n \"data\": {\n \"symbol\": \"NVDA\",\n \"open\": \"112.905\",\n \"high\": \"114.665\",\n \"low\": \"112.660\",\n \"price\": \"113.820\",\n \"latest_trading_day\": \"20250426\",\n \"previous_close\": \"114.500\",\n \"change\": \"-0.680\",\n \"change_percent\": \"-0.59%\"\n }\n}\n【学生回复】:\n根据北京时间4月27日17:47的最新消息,截至美东最近交易日收盘,英伟达(NVDA)的股价下跌0.59%。\n\n当日英伟达股价开盘价为112.91美元,最高价114.67美元,最低价112.66美元,成交量1.3亿,成交额151.5亿美元。盘后股价为113.28美元,较收盘价下跌0.54美元,跌幅0.47%。\n【你的输出】:\n分析:\n学生回复是否满足必答点:是;\n该数字是否一致(仅允许四舍五入误差):开盘价、最高价、最低价仅存在四舍五入误差,因此是一致的;学生回复‘跌幅0.47%’与实时信息的‘\"change_percent\": \"-0.59%\"’不一致;\n不满足全部要求,最终得0分;\n分数:\n{\"score\":0}\n\n示例2:\n【问题】:人民币兑美元在岸汇率\n【评分标准】:\n必答点:人民币兑美元最新在岸汇率\n精度要求:答案落在最高价最低价区间即可\n【实时信息】:\n {\n \"currency_pair\": \"USD/CNY\",\n \"exchange_per\": \"-0.0403\",\n \"exchange_range\": \"-0.0029\",\n \"exchange_rate\": \"7.1871\",\n \"exchange_rate_hi\": \"7.1934\",\n \"exchange_rate_lo\": \"7.1855\",\n \"open_exchange_rate\": \"7.1900\",\n \"pre_close_exchange_rate\": \"7.1900\",\n \"trading_date\": \"20250605\",\n }\n【学生回复】:\n截至2025年6月5日北京时间03:00,在岸人民币兑美元(CNY)收报7.1905元,较前一交易日夜盘收盘跌26点,成交量360.94亿美元。\n\n此外,2025年6月5日银行间外汇市场人民币汇率中间价为1美元对人民币7.1729元,较前一交易日调升32基点。\n【你的输出】:\n分析:\n学生答出了必答点:是;\n该数字是否满足精度要求:实时信息的阈值范围是[7.1855,7.1934],学生回复的数字7.1905落在该范围内,满足要求。\n最终分数:{\"score\":1}\n\n示例3:\n【问题】:comex黄金最新价格\n【评分标准】:\n必答点:comex黄金最新价格\n精度要求:允许误差范围绝对数值±0.6\n【实时信息】:\n{\n \"res\": {\n \"request\": \"w.wsq(\\\"GC.CMX\\\",\\\"rt_date,rt_time,rt_last\\\")\",\n \"code\": 0,\n \"data\": {\n \"GC.CMX\": {\n \"RT_DATE\": 20250619,\n \"RT_TIME\": 90628,\n \"RT_LAST\": 3383.2000\n }\n }\n }\n}\n【学生回复】:\n根据同花顺期货通数据,截至 2025 年 6 月 18 日 23:22,纽约金(COMEX 黄金期货)价格为 3382.7 美元 / 盎司,较前一交易日下跌 25.4 美元,跌幅为 0.75%,最高达到 3405.2 美元 / 盎司,最低为 3363.6 美元 / 盎司\n【你的输出】:\n分析:\n学生答案满足必答点:是;\n数字是否满足精度要求:实时信息的阈值3383.2000±0.6,即[3382.6000,3383.8000],学生回复的数字3382.7落在该范围内,满足要求。\n最终分数:{\"score\":1}\n\n示例4:\n【问题】:最新苹果股价\n【评分标准】:\n必答点:苹果最新股价(即最新收盘价)\n精度要求:仅允许四舍五入误差\n【实时信息】:\n\"AAPL.O\": {\"RT_TIME\": \"200000\", \"RT_LAST\": \"214.05\", \"RT_DATE\": \"20250728\"}\n【学生回复】:\n苹果最新股价$214.05 USD。另有数据源显示苹果最新股价:开盘价$214.70,收盘价$213.88\n【你的输出】:\n分析:\n学生答案满足必答点:是;\n该数字是否满足精度要求:学生回复中苹果最新股价$214.05 USD和实时信息一致,而收盘价$213.88不满足精度要求。\n最终分数:{\"score\":0}\n\n========示例结束,以下是你的任务========",
"wind_ticker": "SHAU.SGE",
"akshare_ticker": "",
"ground_truth": "{\"SHAU___SGE\": {\"RT_TIME\": \"195500\",\"RT_LAST\": \"775.51\",\"RT_DATE\": \"20250814\"}}",
"time": "2025/8/14",
"label": "Time-Sensitive_Data_Fetching(Greater China)"
}来源版本:randomtutu/FinSearchComp main · data/finsearchcomp_data.json · SHA ff89538172a93e10e85f04ca666bbf5adba2df6d · Demo 按 2 个地区 × 3 类任务分层抽样;页面仅改变排版,不改变字段内容。
名称核对:未检索到对应的 “FirmSight” 金融论文;此处分析前述 ACL 2026 FinSight。论文声称的 benchmark 与仓库实际开放内容分开展示。
论文描述:从权威金融平台选择不同市场、行业与市值的公司;覆盖 A 股、港股等。每个目标配一份专业券商深度报告作为 golden reference。
公开状态完整 10 家公司名单和对应金标报告目前未在官方仓库发布。论文附录只展示商汤科技案例。
论文描述:选择金融平台上的高关注行业作为研究目标,使用专业机构行业报告作为 golden reference。
公开状态完整 10 个行业名单和对应金标报告目前未在官方仓库发布。仓库公开了“金融 AI Agent 发展”生成报告样例。
把输入、输出和评分点放在同一个可检查界面。
交互查看不同评测范式的数据形态。rubric 采用“可独立判断 + 明确权重”的结构,便于人评与自动 judge 对齐。
角色:金融与投资分析师 上下文:给定客户风险偏好、持仓表、市场假设与合规限制。 任务:审阅组合并提交面向投资委员会的建议备忘录。
结构化备忘录(PDF/文档):风险暴露、关键计算、再平衡建议、假设与限制。
样例用于说明 schema 与可视化方式;请从“公开数据”链接获取原始条目并遵守其许可证。仓库 data/benchmarks.json 是页面的唯一内容源。
页面直接对应 ACL 2026 正式论文与官方仓库。原始开放对象主要是 58 个 Python 主题文件和 ChainEval 代码,而不是一个静态、不可变的 JSON 测试表。
论文称数据集为 2,900 个实例;仓库当前开放的是生成这些实例的模板代码。每次运行模板会随机产生 seed 和参数,因此页面不把自行生成的一条记录冒充为论文唯一固定测试条目。
用人类基线、教学反馈和迁移测试闭合评测循环。
同一个冻结信息世界、同一套核心 rubric。这里完整演示人类分析师、专家教师和专家裁判在 E1–E3 中的参与方式。
Demo 中的即时分数只用于演示交互;正式 Arena 使用冻结金标、原子 rubric、双人盲评和分歧仲裁。人类与 Agent 共用结果评分,时间、成本和记忆轨迹分别记录。
最后进入 benchmark 深度档案与论文索引。
所有 Demo 都标注来源状态:只有取自官方文件的记录才称为原始数据;概念示意不会再伪装成测试样例。
以真实职业工作成果为目标的评测。金融与保险行业覆盖金融分析师、财务经理、理财顾问、金融销售和客服等岗位。
每篇统一展示会议、摘要导读、主要卖点、评测设计、专家与 rubric、附录构建线索。摘要为中文转述,点击论文可核对原文。
覆盖:金融专用 · 12 领域 / 58 主题
任务:数值推理 · 文档问答
专家:专家评估校准 ChainEval
Rubric:答案正确 + DTW 步骤对齐
附录 A–B 公开模板生成 prompt、自动验证约束、10 位专家校准与逐模板审核、问题标签、返修统计及两套 1–5 分人评 rubric;附录 C–F 给出模型配置、指标消融、分领域结果和错误类型。