全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

今日 125 条 · 论文 15 · 资讯 110 查看今日归档

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「代码库」共 3 条

  • 论文公开站arXiv

    CodeMidas:从代码本身扩展智能体编码RL环境

    CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

    摘要显示,现有编码智能体 RL 环境多依赖 issue、commit 等开发痕迹,任务来源受限。CodeMidas 提出一种智能体流水线,仅以源代码为任务专属输入,将代码库中已实现的功能转化为可执行 RL 环境,通过智能体探索形成行为规格、基于原始代码执行构建测试,并经执行校验与多次解轨迹筛选任务。其数据集含来自 3,185 个开源代码库的 5,545 个训练任务,覆盖 23 种语言与 15 个技术领域。

    意义:为编码智能体 RL 训练提供低成本、可扩展的任务生成路径,降低对 issue/commit 等人工痕迹的依赖,利于开发者构建自有代码库训练环境。

  • 开源项目公开站GitHub

    ArduPilot 自动驾驶固件源码仓库

    ArduPilot/ardupilot — ArduPlane, ArduCopter, ArduRover, ArduSub source

    这是 ArduPilot 在 GitHub 上的官方源码仓库,涵盖 ArduPlane、ArduCopter、ArduRover、ArduSub 四个自动驾驶固件项目,适用于固定翼、多旋翼、地面车辆与水下航行器,获约 15871 颗星标。

    意义:为开发者提供统一的开源自动驾驶固件代码库,可覆盖空中、地面与水下多类无人平台,便于二次开发与算法验证。

  • 论文公开站arXiv

    AI4AI-Bench:面向递归自我改进的算法设计LLM智能体基准测试

    AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

    AI4AI-Bench包含10个冻结的研究代码库,覆盖10种训练算法族。智能体需在4小时内重写训练算法,随后重新运行最多12小时,由固定评估器评分。基准将指标统一映射,0表示无信息模型,0.1为原始算法,1.0为任务最优。在6个系统的29种配置下,平均得分为0.166,最佳系统达0.250,表明现有智能体在算法设计上仍有很大提升空间。

    意义:该基准首次隔离评估LLM智能体的算法设计能力,对递归自我改进可行性研究至关重要,为AI自我提升提供量化测试平台。