站内快照 · 国内可打开。外网原文可能无法访问。
- 资讯公开站rss_arxiv_cs_ai
经验时代的自发现强化学习:学习历史是资产还是负担?
Self-discovering RL in the Era of Experience: Is Learning History an Asset or a Burden?
arXiv:2609.35897v1 公告类型:新 摘要:通往通用智能的递归自我改进(RSI)研究分为两条路线:宏观层面的语言模型扩展,以及“经验时代”中由交互驱动的原则。然而,任何自我改进架构最终都依赖于其底层优化引擎:如果通用智能需要从有根基的交互中学习,那么强化学习(RL)更新规则本身就必须具备累积适应能力。尽管算法自发现已产生 Disco103,其超越了 PPO 并达到 SOTA 基准表现,但其内部更新机制仍是一个未被审视的黑箱。我们首次对自发现的 RL 规则进行因果机制审计,并直接围绕经验时代的五大支柱构建:扩展视界、有根基的奖励尺度、持续流、生命周期内变化,以及探索深度。通过在固定元参数的同时,对循环状态进行外科式固定、冻结和移植,我们检验学习历史何时作为资产、何时成为负担。三项发现组织起这次审计:(1)循环历史主动扩展可用奖励尺度,维持