全球科技每日监测AI 与全技术每日扫描

中文读懂 AI 与全技术今天发生了什么

邮箱轻订阅 · 免费开订每日精选技术情报:中文标题 → 要点 → 详情链。主题月卡加量 · 数据 API 可对接。

AI 与全技术每日扫描

全球科技每日监测

中文读懂今天发生了什么 · 按时间更新 · 全量浏览

免费邮箱订阅 主题月卡 数据 API →

数据源:本地 Harness 库 · 搜索「智能体」共 112 条

  • 开源项目公开站GitHub

    OpenHuman:你的个人AI超级智能,构建本地优先的生活记忆与智能体编排器

    tinyhumansai/openhuman — Your Personal AI super intelligence. A brain that builds a local-first memory of your life, a fantastic orchestrator of agent fleets and workflows, and a deep researcher.

    OpenHuman是一个开源项目,旨在打造个人AI超级智能。它构建本地优先的生活记忆,作为智能体舰队和工作流的编排器,并具备深度研究能力。项目在GitHub上获得约3.9万星标,受到开发者关注。

    意义:该项目代表了个人AI助手向本地优先、智能体编排方向发展的趋势,对开发者构建自主AI系统具有参考价值。

  • 论文公开站arXiv

    SPO++:面向异步智能体强化学习的流对齐策略优化

    SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL

    摘要介绍SPO++,一种改进的异步智能体强化学习算法。针对组相对强化学习等待同提示兄弟rollout的高成本,SPO使用持久提示级价值估计,但轨迹中心化未能正确居中行动者消费的token加权量。SPO++通过标准化行动token度量下的终端结果优势来修正,并依据策略事件而非接收顺序组织提示证据。在ALFWorld和Math-TIR上的实验显示,SPO++相比SPO提升了在线学习效率,消融实验表明行动token度量归一化是最有效的组件。

    意义:为异步智能体强化学习提供更高效的策略优化方法,减少等待成本,提升在线学习效率,对长工具使用轨迹的智能体训练有重要意义。

  • 论文公开站arXiv

    递归经验-工作记忆演化:面向长周期智能体框架的自我改进架构

    Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

    摘要介绍Recuris架构,通过工作记忆追踪任务进度并引导技能选择,将执行转化为结构化证据,定位失败至记忆组件。固定元代理将证据转化为局部验证的更新,形成有界递归记忆演化循环。在四个长周期基准和十个模型上,35/37对任务成功提升,如tau-bench上GPT-5.6 Sol提升17.8点,Claude Opus 5提升15.6点至87.9%。

    意义:为长周期智能体提供可扩展的递归自我改进机制,显著提升任务成功率,对AI代理的长期自主性发展具有重要意义。

  • 论文公开站arXiv

    交互税:多智能体团队中的通信如何抹杀多样性

    The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams

    摘要显示,多智能体LLM交互效果不一,部分研究显示辩论、批评循环等有增益,但另一些在同等预算下无改进。作者提出“交互税”概念:当智能体读取完整输出时,一轮内提案趋同,抹杀多样性。在11个验证器评分优化任务中,完整解决方案交互为弱默认,独立生成可避免崩溃;批评仅在规则易找易修时有效。

    意义:该研究揭示多智能体性能的关键在于信息交换类型而非数量,对设计高效多智能体系统、避免无效交互成本具有指导意义。

  • 广告雪茜曼带胸垫瑜伽服背心新款春夏季防震运动内衣健身普拉提训练上衣外穿京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥79 · 精选自 全球电商每日爆款去看看
  • 论文公开站arXiv

    Prime Agent:一种自我改进的递归语言模型工具链

    Prime Agent: A Self-Improving RLM Harness

    Prime Agent是一个开源工具链,用于长时程评估和编码智能体工作流。它采用递归语言模型抽象,通过持久化IPython REPL进行程序化上下文处理,并持续保存历史、记忆、技能和子智能体配置。递归子智能体可直接通信,人类可通过代理视图监控会话。该工具标准化执行、恢复、验证和资源核算,将策略构建留给模型,防止工具链故障影响模型表现。在ARC-AGI-3上,其RHAE Best@1从30%提升至95.5%,并在多项任务上达到或超过其他主…

    意义:提供标准化工具链,减少环境故障干扰,提升模型真实能力评估,对长时程智能体开发具有参考价值。

  • 论文公开站arXiv

    MidTool:面向智能体工具使用的中期训练数据合成

    MidTool: Mid-training Data Synthesis for Agentic Tool Use

    摘要显示,MidTool是一个用于智能体工具使用中期训练的开源语料构建流程,整合大规模网页、PDF和代码数据,并利用真实工具API、MCP技能和文档相关工作流合成监督信号。该流程旨在教会模型识别工具功能、从上下文获取参数、组合工具调用工作流并从不完整信息中恢复。在Qwen3-4B-Base和Qwen3-8B-Base上进行中期训练,并配合监督微调和强化学习,MidTool-Mix在BFCL、tau2-Bench和MCP Universe…

    意义:为通用工具使用提供专门的中期训练方法,提升模型在真实工具调用场景中的能力,对智能体开发具有重要意义。

  • 论文公开站arXiv

    AI4AI-Bench:面向递归自我改进的算法设计LLM智能体基准测试

    AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

    AI4AI-Bench包含10个冻结的研究代码库,覆盖10种训练算法族。智能体需在4小时内重写训练算法,随后重新运行最多12小时,由固定评估器评分。基准将指标统一映射,0表示无信息模型,0.1为原始算法,1.0为任务最优。在6个系统的29种配置下,平均得分为0.166,最佳系统达0.250,表明现有智能体在算法设计上仍有很大提升空间。

    意义:该基准首次隔离评估LLM智能体的算法设计能力,对递归自我改进可行性研究至关重要,为AI自我提升提供量化测试平台。

  • 论文公开站arXiv

    基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测

    An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

    摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…

    意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。

  • 广告自由系运动上衣女春夏季新款跑步健身短袖训练速干紧身瑜伽服显瘦T恤京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥79 · 精选自 全球电商每日爆款去看看
  • 开源项目公开站GitHub

    LangChain:智能体工程平台

    langchain-ai/langchain — The agent engineering platform.

    LangChain是一个智能体工程平台,旨在帮助开发者构建基于大型语言模型的应用程序。它提供了模块化组件,用于链式调用、记忆管理、工具集成等,支持多种模型提供商。该平台拥有庞大的社区和丰富的文档,是构建LLM应用的主流框架之一。

    意义:作为主流LLM框架,LangChain降低了构建复杂智能体的门槛,其生态和工具链对AI应用开发至关重要。

  • 开源项目公开站GitHub

    Dify:一站式构建智能体工作流与RAG管道的开源平台

    langgenius/dify — Build Agentic workflows, RAG pipelines, with rich AI model and tool support on one collaborative workspace. Deploy on cloud, VPC, or self-hosted, so teams move from prototype to production without rebuilding the stack.

    Dify是一个开源平台,支持在协作工作空间中构建智能体工作流和RAG管道,提供丰富的AI模型和工具支持。可部署于云端、VPC或自托管,使团队无需重建技术栈即可从原型过渡到生产环境。该项目在GitHub上拥有超过15万星标。

    意义:对开发者而言,Dify提供了从原型到生产的无缝路径,降低了AI应用开发门槛,其开源特性与多部署选项增强了灵活性和可控性。

  • 开源项目公开站GitHub

    NousResearch/hermes-agent:随你成长的智能体

    NousResearch/hermes-agent — The agent that grows with you

    摘要显示,hermes-agent 是 NousResearch 推出的一个开源智能体项目,其核心理念是“随你成长”,即能够根据用户需求和使用情况逐步演进和增强能力。该项目在 GitHub 上已获得 234431 星标,显示出社区的高度关注。具体功能和技术细节尚未在摘要中提供。

    意义:该智能体强调自适应成长,可能为开发者提供更灵活、个性化的 AI 助手方案,值得关注其实现机制。

  • 开源项目公开站GitHub

    e2b-dev/awesome-ai-agents:AI自主智能体资源列表

    e2b-dev/awesome-ai-agents — A list of AI autonomous agents

    该项目是一个精选的AI自主智能体(AI autonomous agents)列表,由e2b-dev维护,在GitHub上已获得约29622颗星。它整理了各类AI智能体框架、工具和资源,为开发者提供参考。摘要显示,该项目旨在汇总AI自主智能体的相关项目,帮助开发者发现和学习。

    意义:为开发者提供AI智能体相关的精选资源,便于快速发现和学习优秀项目,对AI应用开发具有参考价值。

  • 广告自由系瑜伽服上衣女春夏季新款速干显瘦短袖普拉提跑步健身训练T恤京东新款样本,适合先看规格与上架节奏再决定是否入手。京东¥79.9 · 精选自 全球电商每日爆款去看看