- 论文公开站arXiv
基于 β 积分局部深度与自适应分组的自动深度局部中心聚类
Automatic depth-based local center clustering via $β$-integrated local depth and adaptive grouping
摘要显示,该研究提出全数据驱动的自动深度局部中心聚类方法 A-DLCC,无需用户指定簇数或邻域大小等数值参数。方法利用 β-积分局部深度识别在多个局部层级上持续居中的稳定样本点作为局部中心,并按代表性排序;每个局部中心诱导一个相似点群,群体相似度由所提出的非参数群级局部相似性度量。合并过程借鉴图论瓶颈路径思想,设计单一凝聚规则,自动估计簇数并决定何时停止合并。合成与真实数据实验显示其可产生可解释的聚类结果且无需调参。
意义:免调参的自动聚类对无监督学习与数据分析流程有实用价值,可降低模型选择成本。
- 论文公开站arXiv
GPT模型中的危害洗白:性别歧视在安全训练中被转化而非减少
Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations
摘要显示,研究分析GPT-2至GPT-5共15个模型、45万条性别指向生成内容,发现显性歧视内容在代际迭代中被转化而非移除,作者称之为「危害洗白」。GPT-2中针对女性的性暴力聚类在GPT-4后消失,但男性指向内容获得照护、情感表达等正向表征,女性指向内容则未获得。GPT-5中主题聚类将乳腺癌框定为男性权利议题,三个独立分类器均判其为非毒性;女性指向内容的主题多样性在GPT-4对齐边界相对男性下降36%。
意义:提示仅靠表面毒性分类器评估安全对齐可能系统性漏检表征危害,开发者需引入主题多样性与表征危害指标。
- 论文公开站arXiv
MDTE:面向时序边事件的少数类感知扩散框架用于不平衡节点分类
MDTE: Minority-Aware Diffusion over Temporal Edge Events for Imbalanced Node Classification
MDTE是一个针对时序图类别不平衡节点分类的少数类感知扩散框架,通过条件扩散去噪重建稳定且可区分的时序边事件表示。它包含分布感知选择性传播,利用LOF过滤和聚类感知低频传播缓解多数类信息同化;以及多视图判别融合,通过特征重建和拓扑预测提取互补判别信号。在五个真实数据集上,MDTE在少数类指标上优于最强基线,少数类召回率最高提升23.53个百分点。
意义:为时序图上的类别不平衡问题提供了新思路,通过扩散模型和分布感知传播提升少数类识别能力,对异常检测和稀有事件预测等应用有重要价值。
- 开源项目公开站GitHub
scikit-learn:Python 机器学习库
scikit-learn/scikit-learn — scikit-learn: machine learning in Python
scikit-learn 是 Python 中用于机器学习的开源库,提供分类、回归、聚类、降维等算法,以及模型选择和预处理工具。基于 NumPy、SciPy 和 matplotlib,拥有简洁一致的 API,广泛用于学术与工业。GitHub 星标超过 67000,社区活跃,文档完善。摘要显示其功能全面,是 Python 机器学习生态的核心组件。
意义:scikit-learn 是 Python 机器学习的基石,为开发者提供标准化工具,广泛应用于学术与工业,其稳定性和社区支持对 AI 领域至关重要。