FinEval Atlas 单 episode 长轨迹 OSWorld · WorkArena++ · AgencyBench · SWE-bench · τ-bench
→ 反馈驱动迭代 MLAgentBench · OPT-BENCH · DySQL
→ 跨 episode 学习 LLM-Evolve · LifelongAgentBench · LIBERO · AgentRecBench
→ 能力资产化 Reflexion · ExpeL · Agent-Pro · MetaReflection · Mem²Evolve
01 / LANDSCAPE
先区分:数据集、评测框架还是方法 场景很长不等于会演化;会重试也不等于跨任务学习。卡片上的类型与时间尺度决定它能回答什么研究问题。
全部 通用长程 持续演化 方法与机制
通用长程 · 独立 Benchmark OSWorld NeurIPS 2024 · Datasets & Benchmarks
369 tasks 真实桌面 · 跨应用 · 状态化
通用长程 · 独立 Benchmark WorkArena++ NeurIPS 2024 · Datasets & Benchmarks
682 tasks 企业软件 · 组合工作流
通用长程 · 独立 Benchmark AgencyBench ACL 2026 · Main
138 tasks · 32 scenarios 约 90 calls · 百万 token · 小时级
通用长程 · 独立 Benchmark MLAgentBench ICML 2024
13 ML tasks 实验 → 观察 → 修改
通用长程 · 独立 Benchmark SWE-bench ICLR 2024 · Oral
2,294 issues(原版) 仓库级诊断 · 补丁 · 回归测试
通用长程 · 独立 Benchmark τ-bench ICLR 2025
Retail + Airline 用户对话 · policy · tools · DB
持续演化 · 演化评测框架 LLM-Evolve EMNLP 2024 · Main
MMLU · GSM8K · AgentBench 顺序 rounds · feedback · memory
持续演化 · 独立 Benchmark(投稿) LifelongAgentBench ICLR 2026 submission
DB · OS · KG 技能依赖 · 跨 episode 经验重放
持续演化 · 独立 Benchmark OPT-BENCH ACL 2026 · Findings
20 ML + 10 NP-hard tasks perception · memory · reasoning loop
持续演化 · 持续交互评测 Beyond Prompts NeurIPS 2024 · Datasets & Benchmarks
长期模拟用户交互 多任务交错 · 上下文切换
持续演化 · 独立 Benchmark LIBERO NeurIPS 2023 · Datasets & Benchmarks
4 suites · 130 tasks robot lifelong learning
持续演化 · 独立 Benchmark AgentRecBench NeurIPS 2025 · Datasets & Benchmarks
classic · evolving-interest · cold-start 周 / 月级偏好演化
持续演化 · 独立 Benchmark DySQL-Bench ACL 2026 · Findings
13 domains · 1,072 tasks 多轮 CRUD · 可执行 DB
方法与机制 · 方法论文 Reflexion NeurIPS 2023
ALFWorld · HotPotQA · HumanEval verbal reinforcement · episodic memory
方法与机制 · 方法论文 ExpeL AAAI 2024
HotpotQA · ALFWorld · WebShop experience gathering · insight extraction
方法与机制 · 方法论文 Agent-Pro ACL 2024 · Main
交互式 agent tasks policy-level reflection · optimization
方法与机制 · 方法论文 MetaReflection EMNLP 2024 · Main
多环境离线轨迹 offline RL · semantic memory
方法与机制 · 方法 + 综合评测 Mem²Evolve ACL 2026 · Main
6 categories · 8 benchmarks experience memory + asset memory
02 / INSTANCE AUDIT
OSWorld:官方任务与 evaluator NeurIPS 2024 · Datasets & Benchmarks · 独立 Benchmark
原始任务 构造过程 Rubric / Evaluator 演化与金融迁移
OFFICIAL TASK / 原文节选 I have calculated the total work hours from the everyday hours... multiply the total hours with the hourly rate... Help me fill in the cell the correct answer. Don't touch irrelevant blank regions. INSTANCE SCHEMA snapshot: libreoffice_calc source: Multiply_Time_Number.xlsx target artifact: /home/user/Multiply_Time_Number.xlsx evaluator: compare_table · Sheet 0 · E3 审计说明:英文任务为论文或官方仓库可核对的原文 / 最小节选;中文内容解释构造与评分逻辑,不冒充官方数据。请通过上方“原始 Demo”链接逐字段 double-check。