- 论文公开站arXiv
FrugalEvo: Towards Cost-Aware LLM-Guided Program Evolution
LLM-guided evolutionary methods, such as AlphaEvolve, have emerged as powerful approaches for challenging computational optimization problems, such as circle packing. However, prior work typically optimizes performance g…
- 论文公开站arXiv
转导学习的更锐界及其应用
Even Sharper Bounds for Transductive Learning and Its Applications
摘要显示,该论文提出 Sharper Transductive Local Complexity(STLC)方法,用于无放回均匀采样下的转导学习。其构造基于测试-训练经验过程上确界的 Bernstein 型集中不等式,证明使用 swap walk 的修正 log-Sobolev 不等式与双参数熵闭合。通过剥离论证与替代定位泛函,得到与经典归纳局部 Rademacher 复杂度界具有相同不动点与置信项的过量风险界,且去掉了早期转导结果中额…
意义:为转导学习提供更紧的泛化界,去掉对数置信因子,对少样本与核方法场景的理论分析与算法设计有参考价值。
- 论文公开站arXiv
AI4AI-Bench:面向递归自我改进的算法设计LLM智能体基准测试
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
AI4AI-Bench包含10个冻结的研究代码库,覆盖10种训练算法族。智能体需在4小时内重写训练算法,随后重新运行最多12小时,由固定评估器评分。基准将指标统一映射,0表示无信息模型,0.1为原始算法,1.0为任务最优。在6个系统的29种配置下,平均得分为0.166,最佳系统达0.250,表明现有智能体在算法设计上仍有很大提升空间。
意义:该基准首次隔离评估LLM智能体的算法设计能力,对递归自我改进可行性研究至关重要,为AI自我提升提供量化测试平台。