| 2026-07-31 | AskChem通过声明中心化基础设施显著提升化学文献合成的效率与准确性。 | AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis |
| 2026-07-31 | 语言模型代理在真实oncall根因分析任务中表现有限,最佳准确率仅25.3%,表明需大幅工程改进才能安全用于生产环境。 | ORCA-bench: How Ready Are Language Model Agents for Oncall? |
| 2026-07-30 | 当前AI代理能完成AI研究的工程任务,但无法实质性推进开放性研究问题。 | Can AI agents conduct open-ended AI research? Early evidence from two case studies |
| 2026-07-30 | LLM代理在办公室任务中比人类更便宜快速,但交付质量尚未达到人类水平。 | OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding |
| 2026-07-29 | UniMem通过互补情景到参数化记忆框架,有效解决了边界无关任务流中的稳定性-可塑性困境。 | UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams |
| 2026-07-29 | AgentToolMO模型通过标准化跨供应商工具信任管理,将级联服务影响的检测时间从小时级缩短至近实时,有效防止级联故障。 | Toward Standardized Cross-Vendor Agent Tool Trust Management in Autonomous Networks |
| 2026-07-28 | APP A框架通过引擎管理的上下文分支和前瞻性授权机制,有效缓解LLM代理处理混合机密数据时因传统taint tracking导致的效用损失问题。 | Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents |
| 2026-07-28 | SIREN框架通过经验驱动的LLM代理实现了端到端极端天气预警自动化,在个体预警步骤和端到端链上均显著优于现有天气代理基线。 | SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents |
| 2026-07-27 | 评估LLM代理的程序化技能时,应分解净效果(收益与回归)而非仅看平均改进。 | The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents |
| 2026-07-27 | 信息遗漏在air-gapped LLM代理管道中是主要可靠性故障,68%源于确定性中间件层(L0-L3)。 | Where FactsGo Missing: A LayerwiseTaxonomy and Per-Layer Attribution of Information Omissionin Air-Gapped LLM Agent Pipelines |
| 2026-07-26 | 本地部署的开源大语言模型在纵向研究数据准备任务中表现优异,平均任务完成率达87.9%,为治理受限研究提供可行路径。 | Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks |
| 2026-07-26 | PATS通过政策感知动态训练脚手架显著提升了长时域LLM代理强化学习的性能。 | PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning |
| 2026-07-25 | Agentic Context Management (ACM) 通过将上下文管理视为生命周期和架构问题,有效解决AI代理的内存与成本挑战。 | Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems |
| 2026-07-25 | 本研究提出轻量级连续保证框架,解决民主化AI代理创建中因依赖项变化导致的可靠性问题。 | Toward Continuous Assurance for the Democratization of AI Agent Creation in Industry |
| 2026-07-24 | OpenForgeRL提供了一个开源框架,使AI代理能在任意环境中端到端训练,无需框架原生支持。 | OpenForgeRL: Train Harness-native Agents in Any Environment |
| 2026-07-24 | AI代理在量子算法和信息理论定理证明中表现有限,但验证库增强可显著提升性能。 | Benchmarking Agents for Proving Theorems in Quantum Algorithms and Quantum Information |
| 2026-07-23 | LLM驱动的自主AI代理在进攻安全领域引发三重不可预测性(行动非确定性、影响开放性、用户群体不确定性),结合进攻防御成本不对称,导致进攻能力工业化,短期利于攻击者。 | The Ethics of Autonomous AI Agents for Offensive Security |
| 2026-07-23 | PRO-LONG通过程序化记忆框架显著提升LLM代理在长时程任务中的性能。 | PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning |
| 2026-07-22 | ResearchArena框架评估显示,自动化AI研发中隐藏在训练数据的破坏最难检测,监控系统仅能标记少于一半的此类破坏,且常因表面检查或错误测试而失效。 | ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D |
| 2026-07-22 | BioSecBench-Surveillance为AI代理在病原体基因组监测中的可靠性提供了一个可验证的基准测试标准。 | BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance |
| 2026-07-21 | 该论文指出,AI-native 6G网络作为SOVA(Service-Oriented Virtualization-Based Architecture)框架的潜在基础,能有效促进AI代理通信,但其对SOVA的支持能力需进一步评估以确保未来网络原生赋能agentic AI环境。 | AI Agent Communications in AI-Native 6G Network: Status, Challenges and Opportunities |
| 2026-07-21 | 自适应多轮攻击将LLM代理安全漏洞率从单轮0-1%显著提升至15轮5.4-14.0%。 | Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security |
| 2026-07-20 | 代理机制通过反思和记忆能优化信息提取任务的行为可控性并提升完成率,但需结合动态工具选择等优化设计。 | Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents |
| 2026-07-20 | 该研究揭示了LLM代理中代理反应式(AR)错误的挑战,并推动设计针对AR错误的测试oracle、复现支持和故障定位技术。 | Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports |
| 2026-07-19 | SYNAPSE是一个采用神经多样性优先设计的多LLM协调AI辅导平台,用于安全软件开发教育。 | SYNAPSE: A Multi-LLM Orchestrated AI Tutor for Secure Software Development Education with Neurodivergent-First Design |
| 2026-07-19 | AdaTurn通过预算感知框架有效解决主动视觉感知代理在低预算条件下的catastrophic truncation问题,显著提升任务准确性。 | AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents |
| 2026-07-18 | 该研究提出Agent-Client Protocol (ACP)作为统一通信协议,有效解决人机交互层碎片化问题,实现高效实时人机协作。 | Human-Robot Interaction in GenAI Architectures via the Agent-Client Protocol |
| 2026-07-18 | SEED通过自进化框架将完成轨迹转化为训练时hindsight skills,弥合RL中轨迹级奖励与token级策略学习的监督间隙。 | SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning |
| 2026-07-17 | 论文提出成本-成功评估框架,主张安全代理评估需兼顾经济效率与操作适应性,而非仅关注成功率,以反映实际安全操作中的预算约束。 | Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents |
| 2026-07-17 | 研究发现,AI基准测试中项目反应理论(IRT)的可靠性因数据特性与人类测试不匹配而受限,经典估计器在大型设置中不可行,可扩展估计器在小或非正态分布模型集上导致不可靠推断。 | Can We Trust Item Response Theory for AI Evaluation? |
| 2026-07-16 | 可重用代理技能的安全漏洞贯穿生命周期各阶段,需生命周期感知的安全分析。 | Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation |
| 2026-07-16 | NNStar为核物质和中子星观测分析提供了一种新的AI驱动框架,显著提升模型约束效率。 | NNStar: An end-to-end AI agent for nuclear matter and neutron star physics |
| 2026-07-15 | MCPEvol-Bench揭示了LLM代理在动态工具环境中的适应性缺陷,为评估代理适应性提供了新基准。 | MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers |
| 2026-07-15 | MathCoPilot实现了人-AI共生的数学研究新范式,但当前大型语言模型在领域特定定理上仍面临挑战。 | MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research |
| 2026-07-14 | FlowGuard通过运行时证据验证执行相关风险和语义风险,实现了MCP安全检测的可靠评估。 | FlowGuard: From Signals to Evidence for MCP Security Detection |
| 2026-07-14 | MemPoison揭示了LLM代理持久内存威胁的结构盲点,倡导从静态过滤转向自适应、上下文敏感的内存防御策略。 | MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents |
| 2026-07-13 | CAMB v2通过创新的超球面贝塞尔函数处理和多项优化,实现了高精度宇宙学功率谱预测,满足未来CMB和大尺度结构调查的数值误差要求。 | CAMB v2: cosmological power spectra for high-precision surveys |
| 2026-07-13 | 本文提出Satellite Mission Compiler,一个四阶段管道,将人类编写的卫星任务计划编译为云原生卫星运行时可消费的容器工作流工件,确保结构合规与策略安全。 | Ground-Side Mission Plan Compilation with Policy-as-Code Guardrails for Cloud-Native Satellite Platforms |
| 2026-07-12 | LongStraw在固定GPU预算下实现了超过200万token的长上下文强化学习后训练。 | LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget |
| 2026-07-12 | 结构工程中,基于工件的评估能暴露工作流级故障,提供更严格的评估基础,避免奖励流畅但工作流不完整或非可执行的输出。 | StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows |
| 2026-07-11 | ANet Patu-1协议通过自组织协作使异质AI代理网络的集体价值随规模增长并超越同质强模型网络,揭示协作缩放律而非规模缩放。 | ANet Patu-1: The Value of Connection in the Agent Network |
| 2026-07-11 | OmniaBench为通用AI代理在多样化场景中的能力评估提供了全面基准。 | OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios |
| 2026-07-10 | 该框架构建了一个透明、可扩展的测试平台,用于事前探索政党兼容性和形式主义者调解的妥协。 | Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents |
| 2026-07-10 | BrainPilot通过多代理系统实现脑科学发现的自动化,提供可追溯日志和代理验证结果,性能媲美先进框架且成本更低。 | BrainPilot: Automating Brain Discovery with Agentic Research |
| 2026-07-09 | ADE-PRF框架通过主动预测可靠性风险,为长期LLM多智能体系统提供前瞻性健康监控,解决基础设施监控无法检测的退化问题。 | Agent Delivery Engineering Predictive Reliability Framework |
| 2026-07-09 | SkillCenter是目前已知最大的开源技能库,包含216,938个结构化技能,覆盖24个领域。 | SkillCenter: A Large-Scale Source-Grounded Skill Library for Autonomous AI Agents |
| 2026-07-08 | 该研究通过隐藏状态探针实现LLM代理任务的早期失败预测,显著减少计算资源浪费。 | Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade |
| 2026-07-08 | AgentTether 提出了一种运行时修复框架,能自动诊断LLM代理故障并引导恢复,无需修改底层代理或环境。 | AgentTether: Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operation |
| 2026-07-07 | CompactionRL通过上下文压缩技术显著提升长时域智能体LLM的性能。 | CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents |
| 2026-07-07 | 多用户LLM代理系统中,LLM判断错误导致隐私泄露风险无法可靠控制,现有模型难以过滤不当内容或限制授权用户访问。 | PiSAs: Benchmarking Contextual Integrity in Multi-User Agentic Systems |
| 2026-07-06 | PACE框架通过小规模代理基准可靠预测大型代理评估性能,实验表明其成本仅为全评估的1%以下,预测精度高(MAE<4%,Spearman相关>0.80),显著降低开发与评估开销。 | PACE: A Proxy for Agentic Capability Evaluation |
| 2026-07-06 | ATMA通过显式状态角色管理,有效缓解长期代理记忆中的幽灵记忆问题,提升系统准确性。 | A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory |
| 2026-07-05 | 该论文提出Guard Rail Validation (GRV)框架以标准化AI代理在自主电信网络中的实时决策验证。 | Criticality-Based Guard Rail Validation for AI Agent Decisions in Autonomous Telecom Networks |
| 2026-07-05 | ContextNext 通过构建上下文治理层,确保AI代理使用的知识库具备来源可追溯、版本准确、完整性验证等特性,有效解决检索管道的可靠性问题。 | ContextNest: Verifiable Context Governance for Autonomous AI Agent |
| 2026-07-04 | AgenticSTS构建了一个有界记忆测试平台,使长周期LLM代理的决策研究可控制且可隔离,避免上下文混杂问题。 | AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents |
| 2026-07-04 | Copewell通过多代理群集架构在心理健康支持中实现了公平与安全原则的早期操作化。 | Copewell: A Multi-Agent Swarm Architecture for Equitable Mental Wellness Support |
| 2026-07-03 | LLM代理在社交结构中会因关系压力产生公开与私下表达的系统性分歧,表明代理评估需超越显式目标检测涌现目标。 | What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates |
| 2026-07-03 | 开源框架生态系统健康应基于贡献者密度、跨生态参与度和留存率,而非仅依赖GitHub星标。 | Adoption and Ecosystem Health: A Longitudinal Analysis of Open-Source Multi-Agent Frameworks |
| 2026-07-02 | LLM代理系统在仓库兼容性救援任务中表现有限,但通过系统互补可提升效果,需结合实际验证以确保可用性。 | RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue |
| 2026-07-02 | 该研究提出两步方法优化自主实验室资源利用,显著提升金属有机框架合成效率。 | Optimal Resource Utilization for Autonomous Laboratory Orchestrators |
| 2026-07-01 | QVal通过Q值对齐直接评估密集监督信号,无需训练即可实现方法公平比较。 | QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents |
| 2026-07-01 | SkillComposer通过结构化技能组合显著提升LLM代理任务成功率,在SkillsBench测试中使GPT-5.2-Codex和Gemini-3-Pro-Preview的通过率分别提高23.1%和18.2%。 | Generative Skill Composition for LLM Agents |