审核风险等级划分

  1. 风险等级判定逻辑

风险等级不是单纯只看模型输出分数,是「模型风险分 + 业务场景标签 + 高危实体 / 关键词命中」的组合判定;模型风险分数仅作为内部输入特征,对外不会披露固定的分数切割阈值。 一条会话如果多轮出现不同风险,整条会话取本轮所有轮次里面最高风险等级;风险判定对象支持两种粒度:单轮 AI 回复粒度,以及整条会话聚合判定。

  1. 三层风险定义 + 典型场景
  • 🔴高风险(资金损失、隐私泄露、重大合规) 定义:一旦发生会直接造成用户资金损失、用户 / 平台隐私泄露、严重平台合规事故,属于必须阻断的风险。 典型场景:大模型诱导用户转账、索要验证码、错误引导退款赔付、泄露用户手机号 / 身份证、输出违法违规内容。
  • 🟡中风险(误导、政策错误,不会立刻资损,但容易衍生客诉) 定义:不会直接产生资金损失,但模型输出事实错误、平台政策乱承诺,会造成用户误解,后续大概率产生客诉。 典型场景:错误解答售后规则、错误告知时效、夸大平台权益、无关的误导性话术,无直接资金诱导。
  • 🟢低风险(轻微瑕疵,不影响业务结果) 定义:话术表达瑕疵,事实、政策、资金全部无误,仅表达啰嗦、口语化、轻微语病,不会引发客诉与损失。 典型场景:回答啰嗦冗余、小的措辞不严谨,但核心业务信息全部正确。
  1. 各层级对应的处置策略
    风险等级机审实时处置(AI 生成后还未下发用户)会话流转策略事后质检 & 样本回流告警
    高风险 直接拦截大模型原始输出,禁止下发给用户 强制切断 AI 会话,会话立即流转人工坐席接管 1. 会话 100% 进入人工复审池;2. 强制回流 bad case,必须标注,进入模型迭代样本库; 触发实时告警,同步给到风控、业务值班
    中风险 不直接阻断会话;改写 / 替换 AI 回复为标准兜底话术;或者打上风险标记放行 会话可以继续 AI 执行,但该会话强制标记风险标签,进入复审池 抽样或者高比例送入人工复审;case 按需回流,评估是否需要迭代模型; 不触发强实时告警,进入日度风险报表
    低风险 不拦截、不替换原始回复,直接放行给用户 会话完全正常继续 AI 对话 不做实时复审;仅日度批量随机抽样质检,用于统计体验指标;一般不强制回流样本 无告警

posted on 2026-09-08 15:36  limingqi  阅读(36)  评论(0)    收藏  举报

导航