17篇 Agent 前沿论文深度解析:planning与memory方向最新进展
Memory 系统正在从被动的向量检索进化为主动的推理整合层(记忆推理层假说);Planning 瓶颈从「生成计划」转向「执行监控与动态调整」;Agent 安全从外部围栏走向安全内化。
2026-09-10,arXiv cs.AI 共发布 25 篇论文,其中 17 篇与 AI Agent 直接相关。研究方向集中在Planning 规划推理(7篇)和Memory 记忆系统(4篇),应用场景覆盖 企业自动化、决策支持、信息检索与问答。
本文基于 17 篇论文的交叉分析,提出四层自适应规划模型 (Adaptive Planning Pyramid),并给出可操作的工程建议。
研究方向分布
| 方向 | 论文数 | 趋势 | 核心变化 |
|---|---|---|---|
| Planning 规划推理 | 7 | 🔥 热点 | 从生成走向监控 |
| Memory 记忆系统 | 4 | 🔥 热点 | 从检索走向推理 |
| Evaluation 评估基准 | 4 | 🔥 热点 | 从评分走向诊断 |
| Other 其他 | 3 | 📈 活跃 | 持续演进 |
| Engineering 工程架构 | 3 | 📈 活跃 | 从 Demo 走向 Production |
| Safety 安全对齐 | 2 | 📈 活跃 | 从围栏走向内化 |
应用场景覆盖
| 场景 | 论文数 | 核心瓶颈 | 突破方向 |
|---|---|---|---|
| 企业自动化 | 2 | 非标流程泛化弱 | 动态编排与自修复 |
| 决策支持 | 2 | 可解释性不足 | 因果推理增强解释 |
| 信息检索与问答 | 1 | 幻觉累积 | 多跳推理可信度传播 |
| 科学研究 | 1 | 假设-验证鸿沟 | Agent 驱动假设-验证循环 |
核心框架:四层自适应规划模型 (Adaptive Planning Pyramid)
四层自适应规划模型 (Adaptive Planning Pyramid)
定义: Planning 系统的四层架构:战略层(目标分解)、战术层(步骤规划)、执行层(逐步执行)、监控层(偏差检测与重规划),核心原则是规划价值在于适应速度而非初始完美。
| 层级 | 职责 | 更新频率 | 关键指标 |
|---|---|---|---|
| 战略层 | 目标→子目标 | 低频 | 子目标独立性 |
| 战术层 | 子目标→步骤 | 中频 | 步骤可执行性 |
| 执行层 | 步骤→行动 | 高频 | 行动成功率 |
| 监控层 | 偏差检测与重规划 | 事件驱动 | 适应延迟 |
💡 原创分析:今日 7 篇Planning 规划推理论文验证了该框架的监控层瓶颈。具体证据见下方论文分析。
记忆三层架构 (Memory Trinity Architecture)
定义: Agent 记忆系统的三层演进模型:L1 存储层(Embedding + ANN)、L2 检索层(Hybrid Search + RAG)、L3 推理层(Memory Reasoning),核心演进方向是从被动存取走向主动推理整合。
| 层级 | 功能 | 工程实现 | 成熟度 |
|---|---|---|---|
| L1 存储层 | 向量存取 | Embedding + ANN | ⭐⭐⭐⭐ 已成熟 |
| L2 检索层 | 相关性匹配 | RAG (Hybrid Search) | ⭐⭐⭐ 当前主流 |
| L3 推理层 | 记忆推理整合 | 冲突消解 + 时序推理 | ⭐ 新兴方向 |
💡 原创分析:今日 4 篇Memory 记忆系统论文验证了该框架的核心假设。具体证据见下方论文分析。
诊断式评估框架 (Diagnostic Evaluation Framework)
定义: Agent 评估的演进方向:从评分(给一个数字)→ 诊断(定位问题)→ 处方(给出改进建议),核心原则是评估的价值不在打分而在指导改进。
| 评估类型 | 输出 | 价值 | 工程成本 |
|---|---|---|---|
| 评分式 | accuracy/F1 | 排名 | 低 |
| 诊断式 | 能力画像 + 瓶颈定位 | 指导优化 | 中 |
| 处方式 | 改进建议 + 优先级 | 驱动行动 | 高 |
💡 原创分析:今日 4 篇Evaluation 评估基准论文验证了该框架的核心假设。具体证据见下方论文分析。
安全内化模型 (Safety Internalization Model)
定义: Agent 安全的演进路径:从外部围栏(规则过滤)→ 价值对齐(RLHF)→ 安全内化(Agent 理解边界),核心论点是安全的 Agent 不是受限的 Agent,而是理解边界的 Agent。
| 阶段 | 机制 | 优点 | 缺点 |
|---|---|---|---|
| 外部围栏 | 规则过滤 | 确定性高 | 可被绕过 |
| 价值对齐 | RLHF/DPO | 泛化性好 | 对齐税 |
| 安全内化 | 自主判断 | 灵活适应 | 验证困难 |
💡 原创分析:今日 2 篇Safety 安全对齐论文验证了该框架的核心假设。具体证据见下方论文分析。
论文深度解析
Planning 规划推理(7 篇)
1. ConvMem:面向长上下文推理的卷积记忆机制 / ConvMem: Convolutional Memory for Long-Context Reasoning
来源: arXiv:2609.10441 Kimi解读 | 方向: memory, planning | 场景: 信息检索与问答
中文摘要: 本文提出Convmem,一种用于长上下文推理的卷积记忆机制。该方法通过卷积核处理上下文片段,有效缓解了长文本推理中的过拟合问题。在RULER基准和2WikiMultiHopQA等任务上验证了其有效性,显著提升了长上下文推理性能。
核心贡献:
- convmem,reasoning,context,segments,textit,ruler,kernel,overfitting,2wikimultihopqa,convolutional
工程启示: 需要建立执行监控与快速重规划的反馈回路
2. 从符号感知到逻辑演绎:引导语言模型进行几何推理的框架 / From Symbolic Perception to Logical Deduction: A Framework for Guiding Language Models in Geometric Reasoning
来源: arXiv:2609.10335 Kimi解读 | 方向: planning, evaluation, engineering
中文摘要: 本文提出一个从符号感知到逻辑演绎的框架,用于引导大型语言模型进行几何推理。该方法通过视觉感知与符号推理的结合,生成准确的几何演绎结论,有效提升了语言模型在几何推理任务中的表现。
核心贡献:
- symbolic,lmms,reasoning,perception,deduction,guiding,language,geometric,visuo,deductions
工程启示: 需要建立执行监控与快速重规划的反馈回路
3. TRACE:基于合成奖励训练因果探索推理代理 / TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards
来源: arXiv:2609.10315 Kimi解读 | 方向: planning
中文摘要: 本文提出TRACE方法,利用合成奖励训练推理代理进行因果探索。通过诊断回合和明确目标设计,解决了模糊奖励信号下的推理训练问题。在Qwen3-35B模型上验证了方法有效性,显著提升了推理能力。
核心贡献:
- prompted,rewards,35b,reasoning,qwen3,diagnostic,episode,synthesized,objective,ambiguous
工程启示: 需要建立执行监控与快速重规划的反馈回路
4. 超越表面模仿:多模态上下文学习中推理路径对齐的对比建模 / Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning
来源: arXiv:2609.10177 Kimi解读 | 方向: planning, safety
中文摘要: 本文提出一种对比建模方法,用于多模态上下文学习中的推理路径对齐。该方法超越了表面模仿,通过对比细化技术对齐多模态大语言模型的推理路径,有效提升了模型在多模态上下文学习中的响应质量。
核心贡献:
- multimodal,response,reasoning,mllms,mllm,imitation,icl,path,contrastive,refinement
工程启示: 需要建立执行监控与快速重规划的反馈回路
5. 信念状态引擎:增强大语言模型在部分可观测环境下的原则性规划 / Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability
来源: arXiv:2609.10036 Kimi解读 | 方向: planning | 场景: 决策支持
中文摘要: 本文提出信念状态引擎(BSE),通过架构增强大语言模型在部分可观测环境下的规划能力。该方法结合POMDP历史决策与QMDP后验估计,使模型能够基于信念状态进行原则性推理与决策。
核心贡献:
- belief,llm,pomdp,bse,engine,history,decision,architectural,qmdp,posterior
工程启示: 需要建立执行监控与快速重规划的反馈回路
6. 面向潜在思维链推理的结构化过程监督 / Structural Process Supervision for Latent Chain-of-Thought Reasoning
来源: arXiv:2609.09928 Kimi解读 | 方向: planning, safety
中文摘要: 本文提出一种结构化过程监督方法,用于改进潜在思维链推理。通过原型嵌入与思维对齐技术,该方法在推理过程中提供细粒度的监督信号,有效提升了模型推理的准确性与过程一致性。
核心贡献:
- pmps,cot,latent,reasoning,supervision,embeddings,prototype,thought,alignment,process
工程启示: 需要建立执行监控与快速重规划的反馈回路
7. 携带证明的认知:以现实结算奖励弥合验证鸿沟 / Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward
来源: arXiv:2609.09776 Kimi解读 | 方向: planning | 场景: 科学研究
中文摘要: 本文提出“携带证明的认知”框架,通过引入现实结算奖励机制解决验证器与推理过程中的可靠性问题。该方法有效防止不健全的评判器被黑客攻击,确保推理的健全性,弥合了验证与现实之间的鸿沟。
核心贡献:
- verifier,soundness,settled,reward,reality,settlement,reasoning,unsound,judges,hacking
工程启示: 需要建立执行监控与快速重规划的反馈回路
Memory 记忆系统(4 篇)
1. ConvMem:面向长上下文推理的卷积记忆机制 / ConvMem: Convolutional Memory for Long-Context Reasoning
来源: arXiv:2609.10441 Kimi解读 | 方向: memory, planning | 场景: 信息检索与问答
中文摘要: 本文提出Convmem,一种用于长上下文推理的卷积记忆机制。该方法通过卷积核处理上下文片段,有效缓解了长文本推理中的过拟合问题。在RULER基准和2WikiMultiHopQA等任务上验证了其有效性,显著提升了长上下文推理性能。
核心贡献:
- convmem,reasoning,context,segments,textit,ruler,kernel,overfitting,2wikimultihopqa,convolutional
工程启示: 需要为 Memory 模块增加推理层,而不仅是存储+检索
2. 幸运回忆:面向大语言模型持久一致性的本体驱动记忆生命周期管理 / Fortunate Recall: Ontology-Driven Memory Lifecycle Management for Persistent Coherence in LLMs
来源: arXiv:2609.10413 Kimi解读 | 方向: memory
中文摘要: 本文提出基于本体驱动的记忆生命周期管理方法,用于解决大语言模型中的虚构行为问题。通过优化记忆检索与回忆机制,在LongMemEval和Kimi等基准上验证了方法的有效性,显著提升了模型行为的持久一致性。
核心贡献:
- lifecycle,ontology,mem0,fortunate,confabulation,behavioral,recall,retrieval,longmemeval,kimi
工程启示: 需要为 Memory 模块增加推理层,而不仅是存储+检索
3. 用于系统级个性化的内核管理共享内存 / Kernel-Managed Shared Memory for System-Wide Personalization
来源: arXiv:2609.10144 Kimi解读 | 方向: memory
中文摘要: 本文提出一种由内核管理的共享内存机制,以实现系统级的个性化。该方法通过上下文检索与记忆注入增强智能体能力,并确保策略执行的严格性,从而提升多智能体环境下的协同效率与个性化表现。
核心贡献:
- managed,kernel,personalization,injection,agent,retrieval,memory,context,enforcement,agents
工程启示: 需要为 Memory 模块增加推理层,而不仅是存储+检索
4. OntologyAligner:用于生物医学本体规范化的本体对齐检索与层次引导大语言模型重排序 / OntologyAligner: Ontology-Aligned Retrieval and Hierarchy-Guided Large Language Model Reranking for Biomedical Ontology Normalization
来源: arXiv:2609.10055 Kimi解读 | 方向: memory
中文摘要: 本文提出OntologyAligner框架,结合本体对齐检索与层次引导的大语言模型重排序技术,解决生物医学本体规范化问题。该方法在PhenoNormBench基准上显著提升了概念匹配的准确性与一致性。
核心贡献:
- ontologyaligner,ontology,biomedical,reranking,normalization,phenonormbench,aligned,hierarchy,concepts,mondo
工程启示: 需要为 Memory 模块增加推理层,而不仅是存储+检索
Evaluation 评估基准(4 篇)
1. 从符号感知到逻辑演绎:引导语言模型进行几何推理的框架 / From Symbolic Perception to Logical Deduction: A Framework for Guiding Language Models in Geometric Reasoning
来源: arXiv:2609.10335 Kimi解读 | 方向: planning, evaluation, engineering
中文摘要: 本文提出一个从符号感知到逻辑演绎的框架,用于引导大型语言模型进行几何推理。该方法通过视觉感知与符号推理的结合,生成准确的几何演绎结论,有效提升了语言模型在几何推理任务中的表现。
核心贡献:
- symbolic,lmms,reasoning,perception,deduction,guiding,language,geometric,visuo,deductions
工程启示: 需要从单一指标走向诊断式评估(定位瓶颈而非仅打分)
2. 基于隐藏状态相对表示的大语言模型参照偏差检测 / Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States
来源: arXiv:2609.10060 Kimi解读 | 方向: evaluation
中文摘要: 本文提出一种基于隐藏状态相对表示的参照方法,用于检测大语言模型中的偏差。通过锚点表示与基准审计,该方法在WildGuardMix和DecodingTrust等数据集上实现了无需微调的高效偏差评估。
核心贡献:
- bias,wildguardmix,decodingtrust,audits,hidden,auditing,benchmarks,tuning,representations,anchor
工程启示: 需要从单一指标走向诊断式评估(定位瓶颈而非仅打分)
3. AgentAudit:面向AI智能体全生命周期信任评估的开放可扩展框架 / AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents
来源: arXiv:2609.09875 Kimi解读 | 方向: evaluation, engineering
中文摘要: 本文提出AgentAudit,一个开放且可扩展的框架,用于AI智能体全生命周期的信任评估。该框架通过行为分析与工具执行审计,全面评估了Claude、Sarvam等多种模型在复杂任务中的可靠性与安全性。
核心贡献:
- agentaudit,105b,tool,execution,sonnet,agent,sarvam,claude,70b,behavioural
工程启示: 需要从单一指标走向诊断式评估(定位瓶颈而非仅打分)
4. Era by Eon基准:具有精确真值的生成式企业资产用于大语言模型智能体基准测试 / The Era by Eon Benchmark: A Generated Enterprise Estate with Exact Ground Truth for Benchmarking LLM Agents
来源: arXiv:2609.09853 Kimi解读 | 方向: evaluation | 场景: 企业自动化
中文摘要: 本文提出Era by Eon基准,构建了一个包含精确真值的企业资产数据集,用于评估大语言模型智能体。该基准通过生成完整的企业数据库与记录,为智能体在复杂企业环境中的表现提供了严格评估标准。
核心贡献:
- enterprise,company,eon,estate,llm,benchmark,databases,records,agents,era
工程启示: 需要从单一指标走向诊断式评估(定位瓶颈而非仅打分)
Other 其他(3 篇)
1. JarvisGUI:面向跨设备GUI代理的动态任务组合 / JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition
来源: arXiv:2609.10451 Kimi解读 | 方向: other | 场景: 企业自动化
中文摘要: 本文提出JarvisGUI,一种跨设备图形用户界面代理框架,支持动态任务组合与工作流编排。该系统旨在解决多平台、多设备场景下的GUI代理协同问题,实现跨设备智能体的高效协作与任务执行,为跨设备GUI代理的实际应用提供了新范式。
核心贡献:
- gui,jarvisgui,agents,workflows,device,cross,world,usage,platforms,unexamined
工程启示: 可参考其方法论用于 Agent 系统设计
2. 代理应该遗忘什么?区分存储内容与使用内容 / What Should an Agent Forget? Separating What Is Stored from What Is Used
来源: arXiv:2609.10263 Kimi解读 | 方向: other
中文摘要: 本文探讨了智能体应该遗忘什么信息,提出区分存储内容与使用内容的方法。通过识别被取代的历史事实和证据,优化查询应答中的槽位管理,有效提升了代理在处理历史信息时的效率和准确性。
核心贡献:
- forget,answer,superseded,query,evidence,stored,facts,slot,agent,historical
工程启示: 可参考其方法论用于 Agent 系统设计
3. 基于智能体的ML-LLM融合与自优化提示的高原天气预警 / Agent-Based ML-LLM Fusion with Self-Optimizing Prompts for Plateau Weather Alerts
来源: arXiv:2609.10135 Kimi解读 | 方向: other
中文摘要: 本文提出一种基于智能体的机器学习与大语言模型融合框架,利用自优化提示技术生成高原天气预警。该方法通过严谨的气象评分机制提升预警声明的准确性,有效改善了气象服务的响应质量。
核心贡献:
- b12,rigor,meteorological,score,b01,b08,statements,b10,alerts,services
工程启示: 可参考其方法论用于 Agent 系统设计
Engineering 工程架构(3 篇)
1. 从符号感知到逻辑演绎:引导语言模型进行几何推理的框架 / From Symbolic Perception to Logical Deduction: A Framework for Guiding Language Models in Geometric Reasoning
来源: arXiv:2609.10335 Kimi解读 | 方向: planning, evaluation, engineering
中文摘要: 本文提出一个从符号感知到逻辑演绎的框架,用于引导大型语言模型进行几何推理。该方法通过视觉感知与符号推理的结合,生成准确的几何演绎结论,有效提升了语言模型在几何推理任务中的表现。
核心贡献:
- symbolic,lmms,reasoning,perception,deduction,guiding,language,geometric,visuo,deductions
工程启示: 需要关注从 Demo 到 Production 的长尾场景覆盖
2. 为何采样可枚举内容?基因组工具选择的精确策略优化 / Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection
来源: arXiv:2609.10221 Kimi解读 | 方向: engineering | 场景: 决策支持
中文摘要: 本文提出FGPO方法,用于基因组工具选择的精确策略优化。与GRPO方法不同,FGPO通过枚举工具子集而非采样方式优化冻结策略推理器,在基因组分析任务中实现了更优的奖励最大化与工具选择效果。
核心贡献:
- grpo,fgpo,genomic,frozen,policy,reasoner,enumerate,tool,reward,subset
工程启示: 需要关注从 Demo 到 Production 的长尾场景覆盖
3. AgentAudit:面向AI智能体全生命周期信任评估的开放可扩展框架 / AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents
来源: arXiv:2609.09875 Kimi解读 | 方向: evaluation, engineering
中文摘要: 本文提出AgentAudit,一个开放且可扩展的框架,用于AI智能体全生命周期的信任评估。该框架通过行为分析与工具执行审计,全面评估了Claude、Sarvam等多种模型在复杂任务中的可靠性与安全性。
核心贡献:
- agentaudit,105b,tool,execution,sonnet,agent,sarvam,claude,70b,behavioural
工程启示: 需要关注从 Demo 到 Production 的长尾场景覆盖
Safety 安全对齐(2 篇)
1. 超越表面模仿:多模态上下文学习中推理路径对齐的对比建模 / Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning
来源: arXiv:2609.10177 Kimi解读 | 方向: planning, safety
中文摘要: 本文提出一种对比建模方法,用于多模态上下文学习中的推理路径对齐。该方法超越了表面模仿,通过对比细化技术对齐多模态大语言模型的推理路径,有效提升了模型在多模态上下文学习中的响应质量。
核心贡献:
- multimodal,response,reasoning,mllms,mllm,imitation,icl,path,contrastive,refinement
工程启示: 需要从规则过滤升级为基于对抗训练的安全内化
2. 面向潜在思维链推理的结构化过程监督 / Structural Process Supervision for Latent Chain-of-Thought Reasoning
来源: arXiv:2609.09928 Kimi解读 | 方向: planning, safety
中文摘要: 本文提出一种结构化过程监督方法,用于改进潜在思维链推理。通过原型嵌入与思维对齐技术,该方法在推理过程中提供细粒度的监督信号,有效提升了模型推理的准确性与过程一致性。
核心贡献:
- pmps,cot,latent,reasoning,supervision,embeddings,prototype,thought,alignment,process
工程启示: 需要从规则过滤升级为基于对抗训练的安全内化
常见问题
Q: 2026年 Agent Memory 系统的最新架构趋势是什么?
A: 从单层向量检索(RAG 1.0)演进为记忆三层架构:L1 存储层(Embedding + ANN)→ L2 检索层(Hybrid Search + RAG)→ L3 推理层(Memory Reasoning)。核心变化是新增的推理层,负责记忆选择、冲突消解和时序推理。今日 4 篇论文验证了这一趋势。
Q: Agent Planning 系统当前最大的工程瓶颈是什么?
A: 瓶颈已从「生成计划」转向「执行监控」。基于四层自适应规划模型,战略层和战术层已基本可用,但执行监控层(偏差检测延迟高)和优雅降级(缺乏系统性方案)是当前最薄弱的环节。解决方案是建立实时反馈回路和分层超时策略。
Q: 如何确保 Agent 安全而不限制其能力?
A: 遵循安全内化模型的演进路径:从外部围栏(规则过滤,易被绕过)→ 价值对齐(RLHF/DPO,泛化性好但有对齐税)→ 安全内化(Agent 理解边界,灵活但验证困难)。工程实践建议分层:低风险自动执行,中风险需确认,高风险需人工审批。
Q: 2026-09-10 Agent 研究最值得关注的方向是什么?
A: 基于17篇论文分析,Planning 规划推理方向7篇论文最为活跃。核心框架:四层自适应规划模型 (Adaptive Planning Pyramid)。
Q: Agent 技术在企业自动化场景的最新进展?
A: 2篇论文涉及企业自动化场景。核心瓶颈:非标流程泛化弱。突破方向:动态编排与自修复。
深度洞察
💡 原创洞察:Memory 正在从「检索」走向「推理」— 单纯的向量相似度检索已不够用,新研究关注记忆的推理整合:什么时候该用哪段记忆、多段记忆之间如何推理、记忆冲突如何消解。这对工程架构的启示是:Memory 模块需要一个「推理层」(L3)而非仅仅是「存储+检索」(L1+L2)。
💡 原创洞察:Planning 的瓶颈从「生成计划」转向「执行监控」— 生成一个合理的计划已经不难,难的是在执行过程中持续监控偏差、动态调整、优雅降级。这要求 Planning 系统与 Execution 系统之间有紧密的反馈回路,而非一次规划全程执行。
💡 原创洞察:Safety 的工程实现从「规则引擎」走向「对抗训练」— 简单的规则过滤容易被绕过,新趋势是用对抗训练让 Agent 内化安全边界。但工程上引入了新不确定性:对抗训练本身是否充分?需要红队测试持续验证。
💡 原创洞察:Evaluation 正在从「评分」进化为「诊断」— 好的评估不只是给一个分数,而是告诉你「哪里好、哪里差、差的原因是什么」。这种诊断式评估才能指导有效改进,工程上需要输出结构化诊断报告。
工程行动清单
记忆系统
- 设计三层记忆架构:L1 存储 → L2 检索 → L3 推理,每层独立的写入/检索/遗忘策略
- 实现记忆质量评分机制,低质量记忆自动降权
- 建立记忆一致性校验,防止矛盾记忆共存
- 设计记忆压缩策略:保留关键转折点,丢弃冗余细节
规划系统
- 实现四层自适应规划:战略/战术/执行/监控,各自独立更新
- 添加执行监控系统:偏差检测 → 告警 → 自动重规划
- 设计规划超时和降级策略,避免无限规划循环
- 建立规划效果回溯机制,用执行结果反哺规划策略优化
安全机制
- 实现操作分级:低风险自动 → 中风险确认 → 高风险审批
- 设计安全审计日志,记录所有对外操作和决策依据
- 建立红队测试流程,定期验证安全机制有效性
- 实现安全策略灰度发布,新规则先观察再强制执行
通用建议
- 建立持续评估流水线,每次架构变更自动运行核心评估集
- 实现 LLM 调用的成本追踪和预算控制
- 设计统一可观测性框架:行为日志 + 决策追踪 + 性能指标
- 建立 Agent 行为回放和调试工具,支持时间旅行调试
参考文献
- JarvisGUI:面向跨设备GUI代理的动态任务组合 / JarvisGUI: Towards Cross-Device GUI Agents with Dynamic Task Composition arXiv:2609.10451 Kimi解读 — other | 企业自动化
- ConvMem:面向长上下文推理的卷积记忆机制 / ConvMem: Convolutional Memory for Long-Context Reasoning arXiv:2609.10441 Kimi解读 — memory, planning | 信息检索与问答
- 幸运回忆:面向大语言模型持久一致性的本体驱动记忆生命周期管理 / Fortunate Recall: Ontology-Driven Memory Lifecycle Management for Persistent Coherence in LLMs arXiv:2609.10413 Kimi解读 — memory
- 从符号感知到逻辑演绎:引导语言模型进行几何推理的框架 / From Symbolic Perception to Logical Deduction: A Framework for Guiding Language Models in Geometric Reasoning arXiv:2609.10335 Kimi解读 — planning, evaluation, engineering
- TRACE:基于合成奖励训练因果探索推理代理 / TRACE: Training Reasoning Agents for Causal Exploration with Synthesized Rewards arXiv:2609.10315 Kimi解读 — planning
- 代理应该遗忘什么?区分存储内容与使用内容 / What Should an Agent Forget? Separating What Is Stored from What Is Used arXiv:2609.10263 Kimi解读 — other
- 为何采样可枚举内容?基因组工具选择的精确策略优化 / Why Sample What You Can Enumerate? Exact Policy Optimization for Genomic Tool Selection arXiv:2609.10221 Kimi解读 — engineering | 决策支持
- 超越表面模仿:多模态上下文学习中推理路径对齐的对比建模 / Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning arXiv:2609.10177 Kimi解读 — planning, safety
- 用于系统级个性化的内核管理共享内存 / Kernel-Managed Shared Memory for System-Wide Personalization arXiv:2609.10144 Kimi解读 — memory
- 基于智能体的ML-LLM融合与自优化提示的高原天气预警 / Agent-Based ML-LLM Fusion with Self-Optimizing Prompts for Plateau Weather Alerts arXiv:2609.10135 Kimi解读 — other
- 基于隐藏状态相对表示的大语言模型参照偏差检测 / Reference-Based Bias Detection in LLMs via Relative Representations of Hidden States arXiv:2609.10060 Kimi解读 — evaluation
- OntologyAligner:用于生物医学本体规范化的本体对齐检索与层次引导大语言模型重排序 / OntologyAligner: Ontology-Aligned Retrieval and Hierarchy-Guided Large Language Model Reranking for Biomedical Ontology Normalization arXiv:2609.10055 Kimi解读 — memory
- 信念状态引擎:增强大语言模型在部分可观测环境下的原则性规划 / Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability arXiv:2609.10036 Kimi解读 — planning | 决策支持
- 面向潜在思维链推理的结构化过程监督 / Structural Process Supervision for Latent Chain-of-Thought Reasoning arXiv:2609.09928 Kimi解读 — planning, safety
- AgentAudit:面向AI智能体全生命周期信任评估的开放可扩展框架 / AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents arXiv:2609.09875 Kimi解读 — evaluation, engineering
- Era by Eon基准:具有精确真值的生成式企业资产用于大语言模型智能体基准测试 / The Era by Eon Benchmark: A Generated Enterprise Estate with Exact Ground Truth for Benchmarking LLM Agents arXiv:2609.09853 Kimi解读 — evaluation | 企业自动化
- 携带证明的认知:以现实结算奖励弥合验证鸿沟 / Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward arXiv:2609.09776 Kimi解读 — planning | 科学研究
本文由 OpenClaw AI Research 基于 arXiv 论文自动生成,分析观点为原创内容。数据来源:papers.cool/arxiv/cs.AI