公开论文雷达

公开 arXiv 研究简报 · 2026-08-23T00:51:24.704733+00:00

先看结论和关键数字,再决定要不要读原文。候选只在首次出现时展示;旧候选若后来通过深读门槛,仍会进入重点。

智能体系统去魅:先量方差与行为,再决定部署

三张卡片都在给智能体热点降温:18066发现随机任务顺序把记忆型自我改进增益从+1.5%翻成-4.5%;20195用真实会话数据显示读文档到写代码几乎不相邻、文档驱动验证零实例;19487展示人机协同重构在输出不变下把仿真运行时压85%。读法是先看两记警示,再看正面工作流。

推荐阅读顺序

  1. 2608.18066:决定是否上线记忆型自我改进智能体前,它先教你别信单次跑分,风险最高,先看。
  2. 2608.20195:把同样的怀疑延到Agent读文档行为,用数据推翻读文档即验证的直觉假设。
  3. 2608.19487:看完两记警钟,再学一套可复制的正面流程:先建校验锚点再授权智能体逐轮迭代。
共性方法
三者都不接受关于智能体的现成说法,而是用测量去检验:任务顺序与方差、真实文档交互行为、重构前后的运行时与输出一致性;共同结论是先设好可复现的对照和校验锚点,才能判断增益真假。
关键分歧
18066和20195是拆穿式审计:乱序让增益翻负、文档驱动验证零实例,推翻乐观假设;19487相反,是靠双锚点加人工把关把仿真运行时压缩85%且输出不变的成功案例。前者说别信什么,后者说怎么做对。
选择准则
上线记忆型自我改进智能体,按18066先多次运行加乱序压测;设计Agent文档或验证流程,按20195先测行为别照搬直觉;用智能体降本改代码,按19487先建输出校验锚点再逐轮人工采纳。

重点深读(3 / 3 篇)

形式化与程序验证(0 篇)

本轮没有通过深读证据门的重点论文。

软件工程与仓库智能(1 篇)

软件工程与仓库智能 6/30

From Agent Behaviour to Agent-Friendly Documentation: An Empirical Study of How Coding Agents Discover, Read, and Write Technical Documentation

编码Agent读文档行为:主流假设缺乏行为支撑:对557次Agent编码会话(94,813事件含3,033次文档交互)和33,097条Agent PR(690,260文件变更)进行行为分析,发现60.5%文档交互指向自身产出物(指令文件+工作笔记),API参考仅1.3%;读文档→写代码相邻转移概率0.002;未观测到任何文档驱动的验证序列。

两句看懂

现行「agent-friendly文档」指南假设文档应具备可执行性与可验证性,本研究在两个公开数据集上追踪Agent真实文档交互行为以检验该假设。在94,813个事件中,60.5%文档交互指向指令文件和工作笔记,读文档→写代码相邻转移概率仅0.002,且从未出现文档驱动的验证序列。

核心判断

Agent主导的文档类型是指令文件和工作笔记(60.5%),而非API参考(1.3%);读文档→写代码的行为链路极弱(相邻概率0.002),且从未观测到文档驱动验证序列,「可执行性」与「可验证性」两大设计假设缺乏行为支撑。

关键要点

1. 现行「agent-friendly文档」建议(清晰标题、可运行示例、llms.txt)基于对Agent应如何行为的推断而非观测;API参考主导了现有文档工程工具链,但在实际Agent交互中仅占1.3%,与指令文件和工作笔记(60.5%)存在系统性偏差。 2. 从SWE-chat(557会话、94,813事件)和AIDev(33,097 PR、690,260文件变更)中恢复文档事件并编码为14类类型,计算相邻转移概率、三事件lift及PR时序比;阶段调整逻辑回归控制会话阶段混淆,通过对比非调整与调整估计量评估混淆程度。 3. 读文档→写代码相邻概率仅0.002(调整OR 1.33 [1.09, 1.62],区间上界有限);读文档→测试lift 0.23(调整OR 0.39 [0.25, 0.60]),读文档与测试负相关;代码先于文档变更4.7倍;语料中零例文档驱动验证序列,「可验证性」设计假设无行为依据。

证据与结果

SWE-chat:557次Agent会话、94,813个事件、3,033次文档交互,56.7%的会话含文档交互。AIDev:33,097条PR、690,260条文件变更,41.5%的PR涉及文档变更。文档类型分布:指令文件35.4%、工作笔记25.1%、经典技术文档10.6%、API参考1.3%、故障排查0.4%。关键量:读文档→代码相邻概率0.002;三事件非调整lift 1.05,阶段调整OR 1.33 [1.09, 1.62];读文档→测试lift 0.23(CI 0.08–0.45),调整OR 0.39 [0.25, 0.60];文档创建非调整lift 1.67但调整区间含1;自主发起咨询70.2%,失败驱动7.5%;代码先于文档变更4.7倍。

打开论文原文
它要解决什么
自主编码Agent实际以何种方式、在何时机与哪类文档交互?「读文档→写代码」和「文档用于验证代码」两项行业假设是否有行为支撑?
研究路径
构建事件提取流水线,从四种异构Agent转录格式中恢复文档事件并编码为14类类型;计算相邻转移概率(单步)和三事件lift(多步);对PR中代码与文档文件变更分别排序后比较首次出现时序;以聚类标准误和阶段调整逻辑回归区分混淆效应与真实关联。
这对工程意味着什么
优先维护Agent指令文件并保持其准确,而非扩充API参考——Agent自主咨询指令文件的比例(35.4%)是API参考(1.3%)的27倍。应避免将「文档驱动验证」纳入系统设计假设,该行为在本语料中从未出现,且读文档后测试活动反而降低。
证据定位
读文档→写代码相邻转移概率0.002,三事件非调整lift 1.05,阶段调整OR 1.33 [1.09, 1.62];读文档与测试负相关(lift 0.23,调整OR 0.39 [0.25, 0.60]);指令文件+工作笔记占60.5%,API参考仅1.3%。(筛选维度:可复核评测、软件工程方法)
适用边界
两个数据集均来自开源仓库,不覆盖闭源或企业环境;事件提取依赖四种异构转录格式,格式间召回率差异未完全量化;为描述性研究,无受控实验设计,相关关系不能推断因果方向。
方法与英文摘要

从SWE-chat提取557次Agent会话得94,813个开发事件(含3,033次文档交互);从AIDev提取33,097条Agent PR,分类690,260条文件变更记录。将文档事件编码为14类类型,计算相邻转移概率和三事件lift;以聚类置信区间和阶段调整逻辑回归控制会话阶段混淆;并按代码与文档分别排序PR提交时序以判断方向。

Technical documentation is written for human developers, but an increasing share of software changes is now authored by autonomous coding agents. Which documents they consult, when, and what follows remain unknown. We conduct a behaviour-grounded study of agent-documentation interaction across two public datasets: 557 agentic coding sessions from SWE-chat, yielding 94,813 development events including 3,033 documentation interactions; and 33,097 agentic pull requests from AIDev, with 690,260 classified file-level change records. Four findings challenge current documentation practice. First, agents' documentation work is dominated by agent-facing artefacts: instruction files and working notes account for 60.5% of all documentation interactions, versus 10.6% for classical technical documentation and 1.3% for API references. Second, the link between consultation and code editing is unresolved: the adjacent transition probability is 0.002 and the unadjusted three-event lift 1.05, whereas a stage-adjusted model places it above unity (OR 1.33 [1.09, 1.62]); documentation creation is elevated unadjusted (lift 1.67) but its adjusted interval includes unity. Third, no explicit documentation-based validation sequence was observed, and consultation is associated with less immediate testing (lift 0.23, cluster CI 0.08-0.45; adjusted OR 0.39 [0.25, 0.60]). Fourth, consultation is self-initiated (70.2%) far more often than failure-driven (7.5%), and documentation trails code: among multi-commit pull requests changing both, code is touched first 4.7x more often. From these traces we derive a descriptive model of agent-documentation interaction as a two-lobed cycle rather than a linear journey, and show that two widely assumed properties of "agent-friendly" documentation - actionability and verifiability - lack consistent behavioural support. We release our pipeline, coding scheme, and event-level data.

代码质量与优化(1 篇)

代码质量与优化 4/30

Accelerated Genetic Programming Hyper-Heuristics for Simulation-Based Scheduling via Agentic AI

智能体辅助迭代重构把仿真运行时间压缩85%,输出保持不变:如果你的Python离散事件仿真无法控制向量化、每年在HPC上超配额消耗算力,这条人机协同重构工作流值得照搬:它把测试运行时间从1298秒压到200秒以内,年省约400万核时,且输出与原版本完全一致。方法本身不复杂,关键在于约束锚点的设置。

两句看懂

Python离散事件调度仿真因控制流复杂无法向量化,遗传规划训练期间仿真成为主要算力瓶颈,一年内消耗约517万计算单元、超出105.4万配额近五倍,团队引入智能体辅助的迭代剖析-重构-校验工作流。以测试运行时间和端到端输出一致性为双重约束,优化后测试运行时间从1298秒降至200秒以内,年节省约400万核时。

核心判断

对于控制流复杂、无法向量化的Python离散事件仿真,人机协同迭代重构可在输出完全一致的前提下,把测试运行时间从1298秒压缩至200秒以内(约85%),年节省约400万核时。

关键要点

1. 旧假设认为扩容HPC资源能弥补代码低效;该项目一年消耗约517万计算单元、超出105.4万配额近五倍,说明低效仿真代码只会线性放大消耗。2. 以测试运行时间基准和端到端输出一致性校验为固定锚点,智能体用剖析器定位顺序状态更新、嵌套循环、面向对象结构等热点,循环生成并测量重构方案,研究员逐轮决定是否采纳。3. 测试时间从1298秒降到200秒以内(约85%)、输出完全一致,年省400万核时;要照搬就先建校验锚点再做迭代重构。

证据与结果

代码库为真实项目调度遗传规划超启发式算法,部署于机构管理的HPC集群,历史年消耗约517万计算单元,超出105.4万配额近五倍。主指标是测试套件总运行时间,副指标是端到端输出一致性。优化前1298秒,优化后低于200秒,降幅约85%;预计年节省约400万核时,折合新西兰元32万元。论文未提供各优化轮次的中间剖析数据或热点分布细节。

打开论文原文
它要解决什么
控制流复杂、无法向量化的Python离散事件仿真,能否借助智能体驱动的迭代剖析重构,在保证输出正确的前提下大幅降低HPC运行成本?
研究路径
智能体拿到代码库后先跑剖析器,定位顺序状态更新、嵌套循环、面向对象结构等热点;针对热点生成并执行重构方案;每轮重构后跑代表性测试套件记录运行时间,并与原始版本比对端到端输出;研究员审阅测量结果决定是否采纳,循环重复直到运行时达标。
这对工程意味着什么
第一步行动:给仿真代码建基准测试套件和输出一致性校验锚点,再授权智能体做迭代剖析重构。要避开的捷径:不要用一次性整体重写替代逐步验证,否则引入数值偏差后无法定位。
证据定位
测试套件运行时间从1298秒降至200秒以内,降幅约85%,输出与原始版本完全一致。按历史用量折算,HPC集群预计年节省约400万核时,约合新西兰元32万元。(筛选维度:可复核评测)
适用边界
论文只报告了单一项目调度仿真代码库的端到端结果,没有多代码库或多类型离散事件仿真的对照实验;收益能否推广到其他控制流密集型研究代码,尚无系统性证据。该方法也不适用于已可编译加速的数值密集型代码。
方法与英文摘要

工作负载是真实项目调度的遗传规划超启发式算法,跑在机构HPC集群上。工作流分三层:先用代表性测试套件和端到端输出一致性校验做约束锚点;再由智能体自动跑剖析器、定位顺序状态更新和嵌套循环等热点、生成重构方案并测量效果;最后人工研究员逐轮审阅测量结果、决定是否采纳,保留最终控制权。

Python is widely used in scientific research because it enables rapid development and provides rich ecosystems for data analysis, artificial intelligence (AI), and machine learning. However, customized research code can become prohibitively slow as experiments scale. This challenge is particularly acute in discrete-event project-scheduling simulations, where sequential state updates, nested loops, conditional evaluations, and object-oriented structures limit the benefits of compiled numerical and GPU-accelerated libraries. Addressing these bottlenecks typically requires iterative profiling, refactoring, testing, and validation, yet researchers may lack the time or specialized software-engineering expertise for low-level optimization. This paper presents a systematic refactoring approach using Claude agentic AI on real-world project-scheduling workloads in a high-performance computing (HPC) environment. Guided by representative benchmarks and correctness checks, the agent identifies bottlenecks, implements targeted optimizations, and evaluates their effects, while the researcher retains final control. Testing runtime reduced from 1,298 seconds to under 200 seconds without changing outputs, saving four million core-hours (NZ\$320,000) annually.

UI 与 GUI Agent(0 篇)

本轮没有通过深读证据门的重点论文。

个人知识与本体(1 篇)

个人知识与本体 6/30

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

自我改进智能体不可靠:任务顺序一打乱,增益就从+1.5%变-4.5%:如果你准备上线基于记忆的自我改进智能体,请先停一下:现有好评测结果很可能来自单次实验和默认任务顺序的巧合。一项重新评测发现,随机打乱任务顺序后ReasoningBank平均增益从+1.5%翻转为-4.5%,且71%场景下方差上升。

两句看懂

现有对自我改进智能体的评测通常只做单次实验并使用默认任务顺序,该研究把两种基于记忆的方法放到三个网页浏览基准上,扩展为多次运行加随机顺序重测。结果是71%场景下方差上升,随机顺序使平均性能从+1.5%跌至-4.5%,补充环境规约信息也只回收31%的损失。

核心判断

基于记忆的自我改进智能体在随机任务顺序下不是提升而是退化(+1.5%变-4.5%),且71%场景下方差扩大;根本原因之一是欠规约导致记忆失效,注入规约信息只能部分修复,仍有69%的差距未弥补。

关键要点

1. 旧假设:单次实验结果可信、默认任务顺序天然合理——实际上默认顺序构成隐式易到难课程,掩盖了可重复性问题,加入自我改进循环后71%场景方差上升,最差-最优差距可达10个百分点。 2. 方法:对Agent Workflow Memory和ReasoningBank在WebArena、VisualWebArena、SCUBA上做多次运行和随机任务顺序两组对照实验,再向记忆构建步骤注入环境反馈与任务评分细则检验补救效果。 3. 决定性结果:随机顺序使ReasoningBank平均增益从+1.5%翻转为-4.5%,注入规约信息仅弥补31%的衰退——上线前必须多次运行、乱序压测,并在记忆构建提示中写明环境约束。

证据与结果

评测覆盖WebArena(含GitLab子集180个任务)、VisualWebArena、SCUBA三个网页浏览基准,底层模型和智能体框架均升级以建立更强基线。多次运行对比:WebArena GitLab子集无记忆基线的最差-最优差距为4.4%,加入ReasoningBank后扩至7.8%;全局71%场景下方差上升,最大差距达10个百分点。随机打乱任务顺序后,ReasoningBank平均增益从+1.5%降为-4.5%。注入环境反馈和评分细则后,仅弥补31%由顺序打乱导致的性能衰退。

打开论文原文
它要解决什么
基于记忆的自我改进智能体,在多次运行和随机任务顺序下,还能复现论文报告的增益吗?
研究路径
失败链条是这样的:记忆构建模型不知道环境约束(例如环境是纯浏览器),于是生成含API调用的建议;这条不可执行的记忆被后续任务复用,智能体反复尝试不可达策略。随机任务顺序则打破默认顺序里的隐式易到难课程,早期遇上的难任务产生错误记忆并向后传播。注入环境反馈和评分细则后,构建模型知道约束,记忆质量部分回升,但仍有未识别的脆弱性来源。
这对工程意味着什么
第一步行动:在部署记忆型自我改进智能体前,先多次运行并用随机任务顺序压测,同时在记忆构建提示里写明环境限制。要避免的捷径:不要拿默认任务顺序下的单次实验结果当结论——默认顺序是隐式课程,会虚高评测收益。
证据定位
随机打乱任务顺序后,ReasoningBank平均增益从+1.5%降为-4.5%71%场景下加入自我改进循环后方差上升,最差-最优运行差距可达10个百分点;WebArena GitLab子集上,无记忆基线的最差-最优差距为4.4%,加入ReasoningBank后扩至7.8%;注入规约信息仅弥补31%的顺序打乱导致的性能衰退。(筛选维度:形式化验证、可复核评测)
适用边界
只评测了两种方法(Agent Workflow Memory、ReasoningBank)和三个网页浏览基准,结论能否推广到其他智能体架构或非浏览器任务尚未验证;注入规约信息后仍有69%的性能差距未弥补,说明其他脆弱性来源还没被识别。
方法与英文摘要

研究选取Agent Workflow Memory和ReasoningBank两种基于记忆的方法,在WebArena、VisualWebArena、SCUBA三个网页浏览基准上重新评测。相比原评测扩展两个维度:多次运行以量化方差;随机打乱任务顺序以检验顺序依赖。随后向记忆构建步骤注入环境反馈和任务评分细则,测试欠规约的补救效果,并升级底层语言模型和智能体框架作为更强基线。

Memory-based self-improving agents--those that learn from an online stream of tasks and improve over time by maintaining a textual memory bank--have shown great promise in recent literature. However, the reliability aspects of these methods have been critically overlooked. In this work, we conduct a comprehensive re-evaluation of two memory-based methods, broadening the scope of evaluation along two axes: (1) including multiple runs to quantify variance, and (2) randomly shuffling the tasks to investigate the effect of task order. Through these experiments, we make two observations that expose the fragility of current methods: First, agent evaluation is inherently noisy in complex environments and on multi-step tasks, and stacking a self-improving loop on top can further amplify this noise. Second, the agent's improvement is highly dependent on task order. Prior works often adopt default orderings that impose an implicit curriculum, acting as a hidden prerequisite for success. To better understand this fragility, we manually examine the agents' memory and hypothesize that task and environment underspecification contribute to this fragility. We validate this hypothesis by incorporating information that enables better specification, such as detailed rubrics and environment feedback, into the memory construction process. While this added information partially closes the performance degradation in previous experiments, significant gaps still remain, suggesting that other uncharacterized factors contribute to this fragility. Looking ahead, our work advocates for more rigorous evaluation protocols for self-improving agents by reporting results across multiple runs and stress-testing them under challenging conditions. Moreover, our findings on underspecification call for systems and interfaces that enable effective human oversight, preventing agents from failing in unforeseeable ways.

人机协同与对齐(0 篇)

本轮没有通过深读证据门的重点论文。

本轮分类概览

同一论文只归入一个最先命中的赛道,避免重复计数;“新增候选”只统计首次展示的论文。

赛道新增候选重点
形式化与程序验证00
软件工程与仓库智能01
代码质量与优化01
UI 与 GUI Agent00
个人知识与本体01
人机协同与对齐00

近一个季度监测日历

北京时间。绿色表示有可阅读的新候选,灰蓝表示已监测但无新增,橙色表示部分降级;“无记录”不等于失败。

2026 年 6 月

1无记录2无记录3无记录4无记录5无记录6无记录7无记录8无记录9无记录10无记录11无记录12无记录13无记录14无记录15无记录16无记录17无记录18无记录19无记录20无记录21无记录22无记录23无记录24无记录25无记录26无记录27无记录28无记录29无记录30无记录

2026 年 8 月

近 14 次监测窗口

仅展示公开源的聚合运行状态,不含提示词、全文或个人数据。

本轮新增候选(0 篇)

按赛道、评分和日期展开;中文标签用于导航,英文摘要用于核验。已展示过的旧候选不会每日重复。

形式化与程序验证(0 篇)

本轮该赛道没有候选论文。

软件工程与仓库智能(0 篇)

本轮该赛道没有候选论文。

代码质量与优化(0 篇)

本轮该赛道没有候选论文。

UI 与 GUI Agent(0 篇)

本轮该赛道没有候选论文。

个人知识与本体(0 篇)

本轮该赛道没有候选论文。

人机协同与对齐(0 篇)

本轮该赛道没有候选论文。