• 博客园logo
  • 会员
  • 周边
  • 新闻
  • 博问
  • 闪存
  • 赞助商
  • Chat2DB
    • 搜索
      所有博客
    • 搜索
      当前博客
  • 写随笔 我的博客 短消息 简洁模式
    用户头像
    我的博客 我的园子 账号设置 会员中心 简洁模式 ... 退出登录
    注册 登录

security-hyacinth

  • 博客园
  • 联系
  • 订阅
  • 管理

公告

View Post

数据清洗对模型性能的真实影响:安全视角下的防投毒实践

作者:HOS(安全风信子)
日期:2026-01-09
来源平台:arXiv
摘要: 数据清洗是机器学习流水线中的关键步骤,直接影响模型的性能和安全性。在安全攻防场景下,数据清洗不仅关系到模型的检测效果,更关系到模型是否会被恶意投毒攻击。本文深入分析数据清洗对模型性能的真实影响,重点探讨安全视角下的防投毒实践,结合arXiv上最新的研究成果和安全实践,通过3个完整代码示例、2个Mermaid架构图和2个对比表格,系统阐述安全数据清洗的设计方法。文章揭示了数据清洗的常见误区和最佳实践,提供了防投毒数据清洗的具体实现,为安全工程师构建可靠的数据清洗流程提供了全面的实践指南。


1. 背景动机与当前热点

1.1 数据清洗的核心地位

数据清洗是机器学习流水线的基础环节,负责去除数据中的噪声、处理缺失值、纠正错误数据和检测异常值。在安全领域,数据清洗的重要性更加凸显:

  • 数据质量决定模型性能:高质量的训练数据能显著提高模型的检测准确率和召回率
  • 数据安全性关系模型安全:被投毒的数据会导致模型误判,甚至被攻击者操纵
  • 数据一致性影响模型稳定性:不一致的数据会导致模型在不同场景下表现差异较大
  • 数据时效性影响响应速度:实时数据清洗能及时处理新出现的攻击数据

posted on 2026-01-15 20:32  安全风信子  阅读(12)  评论(0)    收藏  举报  来源

刷新页面返回顶部
 
博客园  ©  2004-2026
浙公网安备 33010602011771号 浙ICP备2021040463号-3