- 资讯公开站rss_arxiv_cs_ai
BioDyad:同步生物医学发现与机器学习工程
BioDyad: Synchronize Biomedical Discovery and Machine Learning Engineering
arXiv:2609.31939v1 公告类型:新 摘要:智能体生物医学机器学习(ML)依托生物医学证据获取与可执行程序搜索两方面的互补进展。现有系统连接了这些能力的部分方面,但在整个程序搜索过程中协调它们仍具挑战性。新证据必须指导候选构建,执行结果必须为后续发现与复用提供信息,验证需求必须契合搜索预算。我们提出 BioDyad,通过蒙特卡洛图搜索中的两个层级将生物医学发现与 ML 工程耦合。其科学层级将先验生物医学指导与迭代发现相结合…
- 资讯公开站rss_arxiv_cs_ai
面向昂贵进化优化的排名可靠教师引导适应度近似:一项TinyML架构搜索研究
Rank-Reliable Teacher-Guided Fitness Approximation for Expensive Evolutionary Optimization: A TinyML Architecture Search Study
arXiv:2609.30553v1 公告类型:新 摘要:昂贵的进化搜索并不总是需要对每个候选个体进行精确的适应度估计。它往往只需要对一个更简单的问题给出可靠答案:哪个候选个体更好?我们通过教师引导学习NSGA-II(TGL-NSGA-II)来满足这一需求,这是一个用于带约束的微型机器学习(TinyML)神经网络架构搜索的低保真框架。一个预训练教师将样本组织为由难度和类别共同定义的分层。随后,每个候选个体都要经过KD-Lite,即在紧凑…
- 资讯公开站iccircle_rss
【VISION GUIDE - 36】片上网络 NoC 大科普
【关键词】#前端 #NoC。【摘要】基于NoC的多处理器系统是一种使用网络互连的架构,将多核CPU、GPU、FPGA等处理器和加速器通过高带宽、低延迟的通信通道连接起来,实现高性能、可扩展的并行计算。它提供了灵活性、节能性和可靠性,适用于高性能计算、嵌入式系统等领域,加速图形处理、人工智能和机器学习等任务。
- 论文公开站arXiv
通过发现时间解释中的重复概念揭示音频分类器中的捷径学习
Uncovering shortcut learning in audio classifiers by discovering recurring concepts in temporal explanations
机器学习数据集中事件间的相关性可能导致捷径学习,模型基于相关事件的出现来预测目标事件。当这些相关性是虚假的(源于数据收集偏差)时,模型很可能学到错误关联。
- 论文公开站arXiv
在 CP2K 中原生实现机器学习 Skala 交换关联泛函:统一单中心重建
Native implementation of the machine-learned Skala exchange-correlation functional in CP2K: Unified one-centre reconstruction for molecular and condensed-phase calculations
我们使用 CP2K 的高斯与平面波(GPW)及高斯与增强平面波(GAPW)方法,原生实现机器学习 Skala 交换关联(XC)泛函。对密度、密度梯度和动能密度进行联合单中心重建。
- 论文公开站arXiv
面向高斯数据的无间隙差分隐私PCA
Gap-free Differentially Private PCA for Gaussian Data
摘要显示,该论文提出了一种针对高斯数据主成分分析(PCA)问题的无间隙差分隐私算法。原文仅给出简短声明,未披露具体技术细节、误差界或实验验证,因此该算法相对已有方法的改进幅度与适用条件尚不明确。
意义:隐私保护机器学习方向的新算法声明,若成立可改善隐私PCA的精度与可用性,但需关注后续全文细节。
- 开源项目公开站GitHub
500个AI机器学习深度学习计算机视觉NLP项目含代码
ashishpatel26/500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code — 500 AI Machine learning Deep learning Computer vision NLP Projects with code
GitHub 仓库 ashishpatel26/500-AI-Machine-learning-Deep-learning-Computer-vision-NLP-Projects-with-code 汇集了 500 个涵盖 AI、机器学习、深度学习、计算机视觉与自然语言处理的项目,每个项目均附带代码。该仓库已获得约 36,990 个 Star,摘要仅提供项目数量与领域覆盖信息。
意义:为开发者提供一站式项目实践索引,便于按领域查找可运行代码,加速学习与原型开发。
- 资讯公开站MIT Technology Review
五角大楼拟投3000万美元研发AI测谎仪
The Pentagon wants $30 million to build an AI-powered lie detector
摘要显示,美国国防部预算申请计划在未来五年投入3030万美元,用于改进测谎技术。该项目名为「Polygraph+」或「Polygraph Next」,重点研发基于人工智能与机器学习的评分算法,以及一种名为「远距离传感」的技术。摘要未披露该技术的具体应用场景与部署时间表。
意义:显示AI正被引入高敏感的国家安全与审讯场景,开发者需关注算法可信度、误判责任与伦理监管风险。
- 资讯公开站CNX Software
Soulart Station:面向VR与VTuber的无标记全身动作追踪器(众筹)
Soulart Station – A markerless full-body motion tracker for VR and VTubers (Crowdfunding)
韩国初创公司 Soulart 推出 Soulart Station,一款面向 VR、VTubing 与动作捕捉的无标记全身动捕设备。摘要显示,该设备采用 ToF 传感器与板载双核 NPU,在本地运行机器学习模型处理 3D 点云,无需 PC GPU 或云端算力,可输出 23 关节 6DoF 动作数据,官方宣称 ML 延迟低于 10 毫秒;仅传输动作数据以保护隐私,支持 Wi-Fi,ToF 模块为 940nm 红外,SoC 型号尚未公布。
意义:端侧 NPU 完成动捕推理,可降低 VR/VTuber 使用成本与隐私风险,反映边缘 AI 在实时感知设备中的落地趋势。
- 资讯公开站Semiconductor Engineering
检测综合后门级网表中的硬件木马(威斯康星大学麦迪逊分校、Marist)
Detecting Hardware Trojans in Synthesized Gate-Level Netlists (UW-Madison, Marist)
摘要显示,威斯康星大学麦迪逊分校与Marist大学的研究者发表论文《Demystifying Gate-Level Localization of RTL Trojans》,发现RTL木马在综合后呈现稳定的结构与信号流模式,可借助针对性启发式方法而非通用机器学习特征学习进行有效检测,并提出轻量级启发式方案LoRD。
意义:为芯片设计安全提供轻量级、可解释的硬件木马检测思路,降低对大规模ML训练的依赖。
- 论文公开站arXiv
可用护栏:跨ML系统认证选择性预测
Available Guardrails: Certifying Selective Prediction across ML Systems
摘要显示,该论文将选择性预测器视为安全门,要求在每个报告单元上以目标精度认证可靠性。作者用经典精确二项式反演使“可用性”可计算,并将固定组序下的报告分区选择建模为动态规划,揭示安全、粒度与覆盖流量之间的权衡。结果显示,真实信息规划者比支持平衡平均覆盖率提升0.157,而朴素估计器仅恢复0.005;跨规划/选择分割可部分弥补差距,提升0.060,方向在60个模型效应中59个复现。
意义:为需要按工具、策略标签或患者亚组认证精度的ML部署提供可计算框架,提示有限校准数据下认证可用性是核心瓶颈。
- 论文公开站arXiv
分布偏移如何影响神经PDE代理模型的预训练收益?
How Does Distribution Shift Shape Pretraining Gains in Neural PDE Surrogates?
摘要显示,研究者在254,909个RANS解上预训练神经PDE代理模型,再在具有匹配来流范围的新翼型族上微调,比较相同SA模型与加入e^N转捩建模两种目标设定。结果显示,预训练收益取决于目标数据预算、目标数据覆盖度以及源域与目标域是否在建模物理上存在差异,且随样本量变化收益排序会反转。
意义:为科学机器学习中预训练代理模型的迁移策略提供量化依据,提示开发者需根据目标数据量与物理差异权衡预训练收益。
- 资讯公开站Semiconductor Engineering
常关型p-GaN HEMT的预测性TCAD建模:动态导通电阻、漏电、击穿及机器学习辅助设计探索
Predictive TCAD Modeling of Normally-Off p-GaN HEMTs for Dynamic RDS(on), Leakage, Breakdown, and ML-Based Design Exploration
摘要显示,该工作提出一套常关型p-GaN HEMT的预测性仿真工作流,重点涵盖器件物理校准、漏电建模、动态导通电阻(RDS(on))与击穿行为,并引入机器学习辅助的设计探索。原文未披露具体器件数据、模型精度或实验验证结果。
意义:为功率GaN器件的TCAD仿真与ML辅助设计提供可参考的方法框架,有助于缩短器件开发迭代周期。
- 开源项目公开站GitHub
哈佛CS249r《机器学习系统》教材:基础、扩展、智能体AI与物理AI(第I–IV卷)
harvard-edge/cs249r_book — Machine Learning Systems: Foundations, Scaling, Agentic AI, and Physical AI (Vols I–IV) • Harvard CS249r | https://mlsysbook.ai
摘要显示,哈佛大学CS249r课程教材《机器学习系统:基础、扩展、智能体AI与物理AI》四卷本已在GitHub开源,获得约2.8万星标。该项目由harvard-edge维护,配套网站为mlsysbook.ai,内容覆盖机器学习系统从基础到前沿方向的多个主题。
意义:为开发者与AI从业者提供系统化、免费且高关注度的机器学习系统学习资源,覆盖从基础到智能体AI与物理AI的前沿内容。
- 论文公开站arXiv
训练时数据污染对工业控制系统异常检测模型鲁棒性的影响评估
Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination
该研究评估了工业控制系统(ICS)中基于机器学习的异常检测模型在训练数据受污染时的鲁棒性。在SWaT基准上,对11种检测器采用三种污染策略(随机注入、相似性目标注入、特征噪声注入)进行测试,污染预算为1%至10%。结果显示,鲁棒性高度依赖模型,注入式污染影响最大,局部密度和距离检测器退化严重,而PCA、SVM等相对稳定。
意义:提醒开发者训练数据可能被污染,影响异常检测模型可靠性;评估不同检测器的鲁棒性,为选择安全关键的ICS检测方案提供参考。
- 论文公开站arXiv
牛顿法的原始加速方法
Primal Acceleration of Newton's Method
我们开发了一种新的直接加速牛顿法,用于最小化具有Lipschitz连续Hessian的凸函数。该算法仅使用原始变量,每次迭代只需一次线性求解。通过简单的预定参数选择,它在函数残差方面达到O(1/k^3)的全局收敛率。据我们所知,这是此类问题中第一种在每次迭代仅依赖一次线性系统求解(无需求解辅助非线性正则化子问题,如三次正则化,执行非线性参数搜索或使用对偶外梯度校正)就达到此速率的一阶方法。我们的方法可以以无Hessian方式实现,使用非…
意义:该算法在保持二阶方法快速收敛的同时,大幅降低了计算成本,为大规模凸优化提供了新选择,可能推动机器学习中相关问题的求解效率。
- 主题公开站Google News · 机器学习
机器学习算法演进路线图:从线性回归到深度学习
摘要显示,本文梳理了机器学习算法的发展脉络,从线性回归等经典方法演进到深度学习,比较了各类算法的适用场景,旨在帮助读者建立知识体系并规划学习路径,解决面对众多算法时不知如何选择的问题。
意义:为开发者提供算法选型参考,帮助梳理知识体系,优化学习路径,提升技术决策效率。
- 论文公开站arXiv
基于智能体方法的活动数据收集、出行行为建模与天气敏感需求预测
An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction
摘要显示,本研究提出一个三智能体工作流,整合对话式数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查,收集了454条学生通勤者在五种天气情景下的出行方式选择数据。使用多项逻辑模型分析天气关联,并以逻辑回归和随机森林作为机器学习基准。评估了九个本地部署的大语言模型,范围从2亿到350亿参数,在四种零样本提示条件下,并扩展了角色、少样本和视觉配置。最佳文本零样本LLM达到69.9%的准确率,而最佳视觉配置达到71.…
意义:该研究展示了大语言模型在出行行为预测中的潜力,并比较了不同提示策略的效果,为开发天气敏感的智能出行服务提供了新思路。
- 论文公开站arXiv
轨迹上的信息:鞅与随机时间
Information on trajectories: martingales and random times
摘要显示,在非负鞅的轨迹路径空间上考虑信息流,可得到精确的变分恒等式,即使在任意随机时间也成立。该恒等式统一了从Ville不等式到PAC-Bayes的经典集中不等式,并量化了每个不等式所丢弃的信息。尾部界限控制的是相对熵,通过链式法则分解为逐步骤的条件散度。在三种几何中,丢弃的松弛量具有精确形式:Gibbs倾斜(用于Azuma-Hoeffding和PAC-Bayes界)、交叉本身(用于Ville和合并检验)以及支配证书(用于Lp最大界)…
意义:该研究为鞅不等式提供了统一框架,可量化各界的松弛量,对在线统计和机器学习中的安全测试、置信序列设计有重要指导意义。
- 开源项目公开站GitHub
scikit-learn:Python 机器学习库
scikit-learn/scikit-learn — scikit-learn: machine learning in Python
scikit-learn 是 Python 中用于机器学习的开源库,提供分类、回归、聚类、降维等算法,以及模型选择和预处理工具。基于 NumPy、SciPy 和 matplotlib,拥有简洁一致的 API,广泛用于学术与工业。GitHub 星标超过 67000,社区活跃,文档完善。摘要显示其功能全面,是 Python 机器学习生态的核心组件。
意义:scikit-learn 是 Python 机器学习的基石,为开发者提供标准化工具,广泛应用于学术与工业,其稳定性和社区支持对 AI 领域至关重要。
- 开源项目公开站GitHub
微软机器学习初学者课程:12周26课52测验
microsoft/ML-For-Beginners — 12 weeks, 26 lessons, 52 quizzes, classic Machine Learning for all
该GitHub仓库是微软提供的机器学习入门课程,为期12周,包含26节课和52个测验,面向所有初学者。课程覆盖经典机器学习,旨在通过实践项目帮助学习者掌握基础概念。仓库已获得近9万星标,广受欢迎。
意义:为开发者提供免费、系统的ML入门路径,降低学习门槛,助力AI人才培养。
- 开源项目公开站GitHub
PyTorch:具有强大GPU加速的Python张量与动态神经网络库
pytorch/pytorch — Tensors and Dynamic neural networks in Python with strong GPU acceleration
摘要显示,PyTorch是一个开源的机器学习库,提供张量计算和动态神经网络构建功能,并具有强大的GPU加速能力。该项目在GitHub上拥有超过10万星标,是深度学习领域广泛使用的框架之一。
意义:PyTorch是AI开发者的核心工具之一,其动态图和GPU加速特性对研究和生产部署至关重要,星标数反映其社区影响力和可靠性。
- 开源项目公开站GitHub
Hugging Face Transformers:支持文本、视觉、音频及多模态模型的先进机器学习框架
huggingface/transformers — 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and multimodal models, for both inference and training.
摘要显示,Hugging Face Transformers是一个用于定义最先进机器学习模型的框架,涵盖文本、视觉、音频及多模态模型,支持推理和训练。该项目在GitHub上拥有超过164k星标,表明其广泛的使用和社区认可。
意义:作为AI模型开发的核心工具,Transformers库为开发者提供了统一的模型定义和训练接口,加速了多模态模型的部署,是AI工程实践的重要基础设施。
- 开源项目公开站GitHub
TensorFlow:面向所有人的开源机器学习框架
tensorflow/tensorflow — An Open Source Machine Learning Framework for Everyone
TensorFlow是一个开源的机器学习框架,旨在为所有人提供易用的工具。该仓库拥有超过19万星标,表明其广泛认可和社区支持。它支持从研究到生产的各类机器学习任务,包括深度学习模型的构建、训练和部署。
意义:TensorFlow是AI领域的基础工具,广泛用于研究和生产,对开发者而言是必备技能,其生态和社区影响力巨大。