审核风险等级划分
- 风险等级判定逻辑
风险等级不是单纯只看模型输出分数,是「模型风险分 + 业务场景标签 + 高危实体 / 关键词命中」的组合判定;模型风险分数仅作为内部输入特征,对外不会披露固定的分数切割阈值。 一条会话如果多轮出现不同风险,整条会话取本轮所有轮次里面最高风险等级;风险判定对象支持两种粒度:单轮 AI 回复粒度,以及整条会话聚合判定。
- 三层风险定义 + 典型场景
- 🔴高风险(资金损失、隐私泄露、重大合规) 定义:一旦发生会直接造成用户资金损失、用户 / 平台隐私泄露、严重平台合规事故,属于必须阻断的风险。 典型场景:大模型诱导用户转账、索要验证码、错误引导退款赔付、泄露用户手机号 / 身份证、输出违法违规内容。
- 🟡中风险(误导、政策错误,不会立刻资损,但容易衍生客诉) 定义:不会直接产生资金损失,但模型输出事实错误、平台政策乱承诺,会造成用户误解,后续大概率产生客诉。 典型场景:错误解答售后规则、错误告知时效、夸大平台权益、无关的误导性话术,无直接资金诱导。
- 🟢低风险(轻微瑕疵,不影响业务结果) 定义:话术表达瑕疵,事实、政策、资金全部无误,仅表达啰嗦、口语化、轻微语病,不会引发客诉与损失。 典型场景:回答啰嗦冗余、小的措辞不严谨,但核心业务信息全部正确。
- 各层级对应的处置策略
风险等级 机审实时处置(AI 生成后还未下发用户) 会话流转策略 事后质检 & 样本回流 告警 高风险 直接拦截大模型原始输出,禁止下发给用户 强制切断 AI 会话,会话立即流转人工坐席接管 1. 会话 100% 进入人工复审池;2. 强制回流 bad case,必须标注,进入模型迭代样本库; 触发实时告警,同步给到风控、业务值班 中风险 不直接阻断会话;改写 / 替换 AI 回复为标准兜底话术;或者打上风险标记放行 会话可以继续 AI 执行,但该会话强制标记风险标签,进入复审池 抽样或者高比例送入人工复审;case 按需回流,评估是否需要迭代模型; 不触发强实时告警,进入日度风险报表 低风险 不拦截、不替换原始回复,直接放行给用户 会话完全正常继续 AI 对话 不做实时复审;仅日度批量随机抽样质检,用于统计体验指标;一般不强制回流样本 无告警
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22890792
浙公网安备 33010602011771号