- 论文公开站arXiv
读取不等于使用:检索、判断与AI金融研究工作流的设计
Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows
摘要显示,大型语言模型在金融分析中的评估通常基于检索能力,而非检索信息对判断的影响。研究发现,在长上下文金融分析中存在“检索-整合缺口”:当无关上下文从2000增至128000个token时,风险披露对投资判断的影响降至噪声水平,尽管直接检索仍准确。该现象在多个模型家族和任务中复现,且更强大的模型仅推迟而非消除此缺口。因果记忆干预表明,压缩摘要和源文本查找共同传递披露信息,而工作流架构(如分块-总结流水线会逐出相关信息)决定传递成败。因…
意义:对AI行业而言,提示了仅靠检索评估的不足,强调工作流设计对模型实际决策的影响,为金融AI系统开发提供关键考量。
- 论文公开站arXiv
离线强化学习中的边际重要性加权:保序贝尔曼校准方法
Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning
摘要提出了一种名为保序贝尔曼校准的一维模型无关后处理方法,用于减少离线强化学习中边际重要性加权估计的占用率平衡违规。该方法通过拟合非递减变换类来校正初始估计的尺度和形状,并具有校准-细化界限,保证小校准误差的估计性能接近最优后处理。同时建立了有限样本校准保证和KL oracle不等式。
意义:该方法为离线强化学习中的重要性加权估计提供了可诊断的校正手段,有助于提升策略评估的可靠性,对模型选择和超参数调优有实际意义。
- 论文公开站arXiv
交互税:多智能体团队中的通信如何抹杀多样性
The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams
摘要显示,多智能体LLM交互效果不一,部分研究显示辩论、批评循环等有增益,但另一些在同等预算下无改进。作者提出“交互税”概念:当智能体读取完整输出时,一轮内提案趋同,抹杀多样性。在11个验证器评分优化任务中,完整解决方案交互为弱默认,独立生成可避免崩溃;批评仅在规则易找易修时有效。
意义:该研究揭示多智能体性能的关键在于信息交换类型而非数量,对设计高效多智能体系统、避免无效交互成本具有指导意义。
- 论文公开站arXiv
BPCO:一种稳定高效的评论家训练方法
How to Train a Critic Stably and Efficiently
摘要显示,基于组的强化学习方法(如GRPO)通过采样多个响应避免训练评论家,但标准评论家训练常不稳定。研究者提出BPCO配方,结合DPPO、奖励范围限定的值预测、蒙特卡洛值目标、未归一化策略优势及长度自适应GAE,并可在训练时向评论家提供奖励定义信息。在数学推理任务中,BPCO一致提升强评论家基线,并匹配或超越组基线,同时每个提示仅采样一个响应。
意义:为LLM强化学习提供稳定高效的评论家训练方案,减少采样成本,提升训练可靠性,对在线RL算法设计有重要参考价值。
- 论文公开站arXiv
从法规到实施:LLM辅助行业合规的关键评估
From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry
欧盟在可持续发展和隐私法规方面处于领先地位,但合规文档如数字产品护照(DPP)和数据保护影响评估(DPIA)的创建面临挑战。工业数据格式异构且分散,DPIA缺乏标准化。研究提出使用LLM生成合规文档,但数据提取指令和法规模糊性对输出质量的影响未充分探讨。本文通过基准测试不同模型与人工创建的真实模式对比,评估了这些因素对LLM生成的合规工件质量和一致性的影响。
意义:为LLM在合规文档生成中的应用提供了关键评估,揭示了数据提取和法规模糊性对输出的影响,对开发可靠的合规自动化工具具有重要意义。
- 论文公开站arXiv
自精炼流水线中的非对称容量分配研究
Asymmetric Capacity Allocation in Self-Refinement Pipelines
自精炼(生成、批评、修订)是提升大模型生成能力的常用范式,但现有方法多将模型大小视为实现细节而非研究对象。本文首次对自精炼流程进行分阶段模型规模研究,基于Qwen3和Gemma 3的多个尺寸在5个基准上实验,发现较大生成器和修订者通常提升性能,而过小的修订者可能损害性能;批评者大小对性能影响不敏感,但包含小型批评者仍优于完全省略。
意义:为多阶段LLM系统提供容量分配指导,避免资源浪费,助力构建计算高效的自精炼流水线。
- 论文公开站arXiv
LLM缓存应使用哪种驱逐策略?跨工作负载、容量和编码器的系统研究
Which Eviction Policy Should an LLM Cache Use? A Systematic Study Across Workloads, Capacities, and Encoders
摘要显示,使用CLEVER协议评估了FIFO、LRU、LFU、ARC、GDSF、流式SISO及语义冗余策略,在18种设置中,无策略优于LFU超过0.041个百分点。FIFO和流式SISO在紧容量下落后LFU达8.67和8.55个百分点。条件打包结果解释了改进缺失。审计发现,在MiniLM中位阈值下,仅2.1-3.9%的命中可替换答案,质量调整后命中率从51-60%降至1.1-2.2%。阈值不跨编码器迁移。LFU是最强简单默认策略。
意义:为LLM缓存驱逐策略提供了系统比较,指出LFU作为强默认选择,并强调答案有效性验证的重要性,对缓存系统设计有指导意义。
- 论文公开站arXiv
注入、对齐、恢复:面向无检索文档知识内化的分阶段后训练框架
Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization
大型语言模型在推理时无法检索源文档时,往往难以回答关于特定文档集的问题。为此,本文提出IAR(注入、对齐、恢复)三阶段后训练框架,将固定语料转化为可用的参数化知识,实现无检索问答。注入阶段采用续写、改写和指令条件重建目标;对齐阶段使用仅答案的问答监督;恢复阶段合并领域适配模型与基础指令模型以恢复通用能力。实验显示,在多个模型家族和数据集上,IAR在领域问答准确率上平均提升3.6个百分点,通用性能平均提升12.1个百分点。
意义:该框架为无需检索的文档知识内化提供了新方法,提升领域问答准确率的同时保持通用能力,对构建高效、实用的领域专用模型具有重要意义。
- 论文公开站arXiv
潘多拉AI模型路由盒:代价高昂的价值估计下的高效分配
Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation
摘要显示,异构AI系统通过路由查询至最有效且成本最低的专家模型,可提升质量与效率,但价值估计需付出代价。该研究将这一权衡形式化为潘多拉盒子问题,在高斯信号模型下推导出闭式信息价值表达式,提出集中式路由策略Pandora's Router和去中心化策略Pandora's Bidder。实验表明,Pandora's Router在匹配穷举估计路由质量的同时,显著减少昂贵估计器的调用次数。
意义:为AI系统提供成本感知的路由策略,降低多模型推理开销,对构建高效、经济的LLM服务具有直接指导意义。
- 论文公开站arXiv
AI4AI-Bench:面向递归自我改进的算法设计LLM智能体基准测试
AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
AI4AI-Bench包含10个冻结的研究代码库,覆盖10种训练算法族。智能体需在4小时内重写训练算法,随后重新运行最多12小时,由固定评估器评分。基准将指标统一映射,0表示无信息模型,0.1为原始算法,1.0为任务最优。在6个系统的29种配置下,平均得分为0.166,最佳系统达0.250,表明现有智能体在算法设计上仍有很大提升空间。
意义:该基准首次隔离评估LLM智能体的算法设计能力,对递归自我改进可行性研究至关重要,为AI自我提升提供量化测试平台。
- 论文公开站arXiv
基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…
意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。