- 论文公开站arXiv
部分知识下的约束实体选择:面向LLM知识图谱问答
Constrained Entity Selection under Partial Knowledge for LLM-Based Knowledge Graph QA
该论文研究大语言模型在知识图谱问答中的实体选择问题,提出CES-PK框架,利用轻量级符号约束(类型、关系、排除)过滤无效候选答案,并采用三值语义(满足、违反、未知)处理不完整知识图谱。在Hetionet生物医学知识图谱上的实验显示,该方法能提升精确率,同时保持召回率。
意义:提供一种无需完整语义解析即可提升KGQA可靠性的方法,对构建可验证的LLM问答系统有参考价值。
- 论文公开站arXiv
双维度LLM框架用于大规模测评中题目非内容相似性自动分析
A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments
该研究提出一种基于大语言模型的双维度自动题目相似性分析框架,通过结构化分解和语义相关性来检测题目中非内容冗余。心理测量验证显示,LLM指标比传统文本指标更接近构念无关局部依赖,并产生更一致的题目参数分组。在计算机自适应测试中,基于LLM的相似性约束提高了估计稳定性并减少了偏差。
意义:为大规模题库管理提供新方法,提升自适应测试的准确性和效率,对教育测评AI应用有重要价值。
- 论文公开站arXiv
读取不等于使用:检索、判断与AI金融研究工作流的设计
Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows
摘要显示,大型语言模型在金融分析中的评估通常基于检索能力,而非检索信息对判断的影响。研究发现,在长上下文金融分析中存在“检索-整合缺口”:当无关上下文从2000增至128000个token时,风险披露对投资判断的影响降至噪声水平,尽管直接检索仍准确。该现象在多个模型家族和任务中复现,且更强大的模型仅推迟而非消除此缺口。因果记忆干预表明,压缩摘要和源文本查找共同传递披露信息,而工作流架构(如分块-总结流水线会逐出相关信息)决定传递成败。因…
意义:对AI行业而言,提示了仅靠检索评估的不足,强调工作流设计对模型实际决策的影响,为金融AI系统开发提供关键考量。
- 论文公开站arXiv
LAION-BVD:千万小时级开放视频数据集,助力多模态预训练
LAION-BVD: A 10-Million-Hour Open Video Dataset for Multimodal Pre-training
LAION-BVD是LAION发布的大规模开放视频数据集,包含从CommonCrawl收集的13亿条平台视频URL,成功下载8000万段视频,总时长1000万小时。该数据集旨在支持视频、音频和图像多模态预训练,通过场景检测提取片段并合成字幕。基于此训练的模型在视频-文本和音频-文本基准上表现优异,且性能随规模提升。此外,提取的场景帧作为图像-文本数据源,展现出与网络图像不同的分布,模型在图像-文本检索上表现强劲。数据集已开源,显著扩大了…
意义:为多模态预训练提供千万小时级开放视频资源,填补大规模视频数据空白,推动视频、音频、图像联合学习研究。
- 论文公开站arXiv
FedV-KGQA:垂直分区知识图谱上的多跳问答框架
FedV-KGQA: Multi-Hop Question Answering over Vertically Partitioned Knowledge Graphs
FedV-KGQA 是一种用于垂直分区知识图谱的多跳问答框架,其中各组织共享实体但拥有不相交的关系集。它结合局部图增强和知识图谱嵌入,确保原始三元组和关系参数不离开各自数据孤岛,建立结构数据边界,无需集中式图访问。引入主题实体锚定机制,在无运行时跨孤岛通信的情况下将问题定位到正确图邻域。在三个基准测试的12种配置中,性能接近集中式,可泛化至3跳推理,并对嵌入扰动具有鲁棒性。
意义:为数据治理和隐私约束下的知识图谱问答提供可行方案,实现多跳推理而无需集中数据,对联邦学习和隐私保护AI有重要价值。
- 论文公开站arXiv
离线强化学习中的边际重要性加权:保序贝尔曼校准方法
Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning
摘要提出了一种名为保序贝尔曼校准的一维模型无关后处理方法,用于减少离线强化学习中边际重要性加权估计的占用率平衡违规。该方法通过拟合非递减变换类来校正初始估计的尺度和形状,并具有校准-细化界限,保证小校准误差的估计性能接近最优后处理。同时建立了有限样本校准保证和KL oracle不等式。
意义:该方法为离线强化学习中的重要性加权估计提供了可诊断的校正手段,有助于提升策略评估的可靠性,对模型选择和超参数调优有实际意义。
- 论文公开站arXiv
通过局部增强偏好与表示解缠改进跨问题车辆路径规划
Improving Cross-Problem Vehicle Routing with Locally Augmented Preferences and Representation Disentanglement
摘要显示,多任务车辆路径问题求解器面临训练监督弱和架构纠缠的挑战。为此,提出POLAR训练算法,通过局部搜索细化最佳解码路径以形成更优偏好对,以及PLE编码器,利用门控机制分离共享专家与任务特定专家,逐步解缠通用路由结构与约束特定编码。实验表明,两者结合可提升当前最先进性能。
意义:对开发者而言,该研究提供了训练算法与架构设计的改进,有望提升多任务VRP模型的泛化能力与训练效率,推动实际物流调度应用。
- 论文公开站arXiv
输入凸神经网络L_p-Lipschitz常数的参数化复杂度及Zonotopes上L_p-范数最大化
Parameterized Complexity of $L_p$-Lipschitz Constants for Input Convex Neural Networks and $L_p$-Norm Maximization over Zonotopes
摘要显示,该研究探讨了两层输入凸神经网络(ICNNs)计算L_p-Lipschitz常数的问题,该问题等价于在Zonotope上最大化对偶范数。对于固定的p∈(1,∞)∩Q,在d维Zonotope上最大化L_p-范数是W[1]-难的,且暴力枚举算法在指数时间假设下本质最优。通过二元性,相同难度适用于两层ReLU ICNN的L_p-Lipschitz常数计算。证明先建立L_2情形,再通过泰勒近似推广至任意固定p。该结果解决了COLT'25…
意义:该研究明确了ICNN Lipschitz常数计算的计算复杂性边界,对神经网络的鲁棒性验证和安全性分析有重要指导意义,也为相关算法设计提供了理论依据。
- 论文公开站arXiv
SPO++:面向异步智能体强化学习的流对齐策略优化
SPO++: Stream-Aligned Policy Optimization for Asynchronous Agentic RL
摘要介绍SPO++,一种改进的异步智能体强化学习算法。针对组相对强化学习等待同提示兄弟rollout的高成本,SPO使用持久提示级价值估计,但轨迹中心化未能正确居中行动者消费的token加权量。SPO++通过标准化行动token度量下的终端结果优势来修正,并依据策略事件而非接收顺序组织提示证据。在ALFWorld和Math-TIR上的实验显示,SPO++相比SPO提升了在线学习效率,消融实验表明行动token度量归一化是最有效的组件。
意义:为异步智能体强化学习提供更高效的策略优化方法,减少等待成本,提升在线学习效率,对长工具使用轨迹的智能体训练有重要意义。
- 论文公开站arXiv
递归经验-工作记忆演化:面向长周期智能体框架的自我改进架构
Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses
摘要介绍Recuris架构,通过工作记忆追踪任务进度并引导技能选择,将执行转化为结构化证据,定位失败至记忆组件。固定元代理将证据转化为局部验证的更新,形成有界递归记忆演化循环。在四个长周期基准和十个模型上,35/37对任务成功提升,如tau-bench上GPT-5.6 Sol提升17.8点,Claude Opus 5提升15.6点至87.9%。
意义:为长周期智能体提供可扩展的递归自我改进机制,显著提升任务成功率,对AI代理的长期自主性发展具有重要意义。
- 论文公开站arXiv
生成评估中FID掩盖的偏差:检测、排序与诊断
What FID Hides: Detecting, Ranking, and Diagnosing Deviations in Generative Evaluation
摘要显示,生成模型常用FID和KID评估,但FID仅基于前两阶矩,可能忽略分布差异,且标量差距未校准采样变异。在ImageNet上,仅优化匹配Inception均值和协方差的不可识别图像,其FID为24.7,而保留的真实图像为58.6。FID和KID为对称标量,无法编码离散度变化方向。为此,引入ZID,结合六个位置和离散敏感指标,输出排序指数、置换p值和符号离散读数,以检测偏差并排序严重性。
意义:为生成模型评估提供更全面的诊断工具,帮助开发者识别模型与真实数据的细微偏差,优化模型调优。
- 资讯公开站Entrepreneur
签署加盟协议前的7个验证电话技巧
7 Tips for Franchise Validation Calls Before You Sign an Agreement
摘要显示,验证是加盟考察过程中最被忽视却最重要的环节之一。与目标品牌现有加盟商进行验证电话沟通,能帮助潜在加盟商了解真实经营情况。本文提供了7个技巧,以帮助在签署协议前有效进行验证电话,从而做出更明智的加盟决策。
意义:对考虑加盟的开发者或创业者,验证电话能降低信息不对称风险,避免盲目签约,提升创业成功率。
- 资讯公开站Entrepreneur
哈佛推出699美元企业家训练营,但有一个条件
Harvard Is Offering a New $699 Bootcamp for Entrepreneurs, But There’s a Catch
哈佛大学推出了一项新的企业家训练营,费用为699美元。该训练营旨在为创业者提供培训,但有一个条件。摘要未明确说明具体条件,可能涉及申请资格或课程要求。这一价格相对较低,可能吸引众多创业者关注。
意义:哈佛大学以较低价格提供企业家培训,可能降低创业者获取顶尖教育资源门槛,对创业生态有积极影响。
- 资讯公开站Entrepreneur
运营YouTube频道比想象中更耗时?三大耗时环节的优化策略
Running a YouTube Channel Takes More Time Than You Think. Here’s How to Streamline the 3 Most Time-Consuming Parts.
摘要显示,许多创作者低估了运营YouTube频道所需的时间投入,导致失败。文章针对最耗时的三个环节提出优化建议,帮助创作者避免这一陷阱,提高效率。
意义:对内容创作者和视频平台开发者有参考价值,提示工具或服务可针对耗时环节优化,提升创作效率。
- 资讯公开站Entrepreneur
Walk-On's连锁餐厅反其道而行之:缩小门店规模以加速扩张
‘The Script Is Flipped’: This Chain Is Shrinking Its Restaurants to Grow Faster
Walk-On's体育酒吧连锁创始人Brandon Landry曾花二十年证明大餐厅的必要性,如今却反其道而行之,认为缩小门店规模能加速增长。摘要显示,该公司正调整策略,以更小的店面实现更快扩张,这可能反映了餐饮业对灵活性和效率的新追求。
意义:餐饮连锁调整门店规模策略,表明行业对灵活性和成本效益的重视,对餐饮科技和连锁管理有启示意义。
- 开源项目公开站GitHub
计算机科学视频课程列表
Developer-Y/cs-video-courses — List of Computer Science courses with video lectures.
这是一个GitHub仓库,收集了计算机科学领域的视频课程列表,目前拥有超过83000颗星标。该列表涵盖了广泛的CS主题,为学习者提供了丰富的视频资源。
意义:为开发者提供一站式视频课程资源导航,方便自学和提升技能,是学习CS的宝贵参考。
- 资讯公开站Entrepreneur
休斯顿警察跳进优步司机车内追捕嫌疑人
Watch: Houston Police Officers Jump Into an Uber Driver’s Car to Chase Down a Suspect
摘要显示,优步司机安东尼·贝恩斯原本在寻找下一位乘客,却意外遭遇两名休斯顿警察跳进他的车内,追捕一名嫌疑人。事件细节未披露,但表明该司机在追捕过程中提供了协助。
意义:此事件展示了网约车司机在紧急情况下可能被卷入执法行动,对共享出行平台的安全政策与司机培训有启示意义。
- 论文公开站arXiv
老年人下肢骨折或髋关节置换术后功能恢复与社会隔离的多结局预测
Predicting Multiple Clinical Outcomes Related to Functional Recovery and Social Isolation Among Older Adults After Lower-Limb Fracture or Hip Replacement
摘要显示,该研究利用MAISON-LLF数据集,包含18名社区老年人的多模态传感器和临床评估数据,监测长达8周。提取46个日度特征,每两周评估5项临床结局。采用多输出回归算法联合预测临床评分,结果显示联合预测优于单独预测,其中NODE模型表现最佳(MSE=3.96,MAE=1.02)。SHAP分析强调了多模态传感器的重要性。
意义:对开发者而言,该研究展示了多模态传感器数据在多输出回归中的潜力,可启发健康监测AI模型设计,提升对老年康复过程的综合评估能力。
- 论文公开站arXiv
基于适配器的少样本持续学习用于恶意数据包识别
Adapter-Based Few-Shot Continual Learning for Malicious Packet Recognition
摘要显示,针对恶意软件变体持续演化,作者提出一种基于适配器的少样本类增量学习框架,用于恶意数据包识别。该方法使用自监督学习骨干网络,并通过领域特定预训练初始化,在基础会话中采用低秩适配(LoRA)微调,同时冻结核心骨干以保留旧知识,增量会话使用原型分类头。实验表明,该方法在多个数据集上优于现有恶意软件FSCIL基线,达到最先进性能。
意义:该研究为恶意软件检测提供了一种高效的持续学习方案,能适应新威胁而不遗忘旧知识,对网络安全领域的AI模型部署具有实用价值。
- 论文公开站arXiv
局部蒸馏:实现可解释AI的新方法
Interpretable AI with Local Distillation
摘要提出局部蒸馏方法,通过黑箱教师模型指导正则化线性学生模型,在查询点附近实现高精度与可解释性。教师通过加权相似预测结果的训练观测定义局部性,并利用伪观测锚定拟合。通过高斯随机化评估特征选择稳定性,并在17个基准数据集上验证,局部蒸馏在保持高精度的同时提供透明解释。
意义:该方法为高 stakes 决策提供兼顾准确性与可解释性的模型,有助于增强AI信任度,推动可解释AI在金融、医疗等领域的应用。
- 论文公开站arXiv
交互税:多智能体团队中的通信如何抹杀多样性
The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams
摘要显示,多智能体LLM交互效果不一,部分研究显示辩论、批评循环等有增益,但另一些在同等预算下无改进。作者提出“交互税”概念:当智能体读取完整输出时,一轮内提案趋同,抹杀多样性。在11个验证器评分优化任务中,完整解决方案交互为弱默认,独立生成可避免崩溃;批评仅在规则易找易修时有效。
意义:该研究揭示多智能体性能的关键在于信息交换类型而非数量,对设计高效多智能体系统、避免无效交互成本具有指导意义。
- 论文公开站arXiv
AI辅助如何影响人类技能发展:一项基于逻辑谜题的学习研究
How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles
摘要显示,研究者通过逻辑谜题实验考察AI辅助对技能发展的影响。实验设置不同AI请求成本,发现低成本辅助导致更频繁使用AI。参与者在AI辅助阶段请求帮助后,在移除辅助后表现更差,且其后续无辅助表现被高估。贝叶斯潜在能力模型显示,独立解决问题的努力与能力提升正相关,表明AI替代独立推理会削弱技能发展。
意义:对开发者与AI行业而言,此研究提示AI工具设计需平衡效率与用户长期技能发展,避免过度依赖导致能力退化,对AI辅助学习系统设计有重要参考价值。
- 论文公开站arXiv
惯性流形神经算子用于耗散时间相关偏微分方程
Inertial Manifold Neural Operator for Dissipative Time-Dependent Partial Differential Equations
本文提出惯性流形神经算子(IMNO),用于求解耗散时间相关偏微分方程。摘要显示,该算子利用耗散系统的低维结构,相比标准神经算子(如傅里叶神经算子)在长时间自回归训练和预测中具有更好的物理可解释性、准确性和稳定性。针对平移等变PDE,还提出了平移等变变体(IMNO-SE),通过保持对称性提升性能。
意义:为耗散PDE的长期预测提供更稳定、可解释的神经算子,并引入对称性保持的归纳偏置,对科学计算和AI4Science有重要意义。
- 论文公开站arXiv
训练时数据污染对工业控制系统异常检测模型鲁棒性的影响评估
Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination
该研究评估了工业控制系统(ICS)中基于机器学习的异常检测模型在训练数据受污染时的鲁棒性。在SWaT基准上,对11种检测器采用三种污染策略(随机注入、相似性目标注入、特征噪声注入)进行测试,污染预算为1%至10%。结果显示,鲁棒性高度依赖模型,注入式污染影响最大,局部密度和距离检测器退化严重,而PCA、SVM等相对稳定。
意义:提醒开发者训练数据可能被污染,影响异常检测模型可靠性;评估不同检测器的鲁棒性,为选择安全关键的ICS检测方案提供参考。
- 论文公开站arXiv
ConvergeFlow:具有可证明收敛到词元嵌入的语言流模型
ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings
ConvergeFlow是一种基于嵌入空间的流式语言模型,将数据预测器限制在词元嵌入的凸包内,并仅使用流匹配的均方误差目标进行训练。在适当正则条件下,证明该流能收敛到有效词元嵌入,无需交叉熵解码器即可直接预测词元。实验表明其在OpenWebText上性能与现有连续和离散扩散模型相当。
意义:该研究简化了连续语言模型的训练流程,无需交叉熵解码器,为流式语言建模提供了理论基础,可能提升生成效率与可控性。