阿里内容审核

标的:淘天集团
 9月7日 21:00
形式:电话入会
 
访谈核心方向:商品 / 商家资质 / 直播间治理机审,聚焦机审召回、机审驳回两大环节大模型应用,覆盖 few‑shot 小模型、主干大模型、规则引擎、传统判别模型;完整审核链路、模型编排、分流策略、角色分工边界。

一、候选人简历(对外访谈版,最小优化,对齐访谈提纲)

2022.11‑至今 淘天集团|模型工程专家
所属:平台事业部‑业务风控部|智能审核机审大模型工程团队
参与淘天电商商品、商家资质、直播间 & 短视频多场景智能审核体系建设,负责机审全链路大模型工程侧设计与落地;完整覆盖:送审→机审粗召(召回)→机审提纯→机审驳回→流转人审全流程。
链路架构:区分同步、异步两套审核任务链路,针对直播间流式切片的高并发特征做链路专项优化;定义机审召回、机审提纯、机审驳回各模块输入输出与数据流转标准;落地多模型混合编排调度,实现主干大模型、few‑shot 少样本模型、传统判别模型、规则引擎线上协同,完成串联 + 多路并行的混合推理架构,配套流量分流、灰度放量、降级熔断容灾机制。
推理工程落地:负责审核域多类模型推理服务建设,完成批处理优化、集群资源调度、端到端时延优化;针对直播切片大促高峰做流量削峰、队列管控,控制送入高成本大模型的流量占比,保障峰值链路稳定性。
实验与数据闭环:对接 A/B 实验平台,打通机审全链路埋点;将机审召回、机审驳回、人审回流的真实业务效果数据回传给算法团队,用于模型迭代、few‑shot 样本沉淀、prompt 调优。
跨角色协同:对接治理算法、治理产品、治理运营、底层平台 PE,明确模型工程 PE 与治理算法的工作边界;配合业务完成机审各环节模型选型、压测、上线、故障复盘,保障机审输出结果可解释、证据可追溯,为人审提供判决依据。
组织汇报口述(访谈口头描述,简历不写人名):团队归属淘天集团平台事业部(总裁汤兴)下的业务风控部(总经理叶智飞);本人直接向机审团队中层负责人汇报,中层负责人汇报叶智飞;中层团队负责人未对外公开,简历不体现具体人名。

二、完整访谈问答(可直接口述,已嵌入测试问题的量化信息 + 淘天落地业务案例)

Q1:治理审核完整链路是什么?召回环节 QPS 量级?送入人审之前会用到哪些模型?每一步流转逻辑?

回答:
 
我们淘天商品、商家资质、直播间 / 短视频整套机审链路为:
【业务送审】商品 / 商家资质提交、直播间流式切片、短视频素材送审 → 机审粗召(召回环节) → 机审提纯 → 机审驳回环节;高置信风险样本直接机审驳回处置;置信度灰色区间、无法机器下定论的样本,流转进入人审队列;人审处理完成后结果回流,反哺样本库、模型迭代、few‑shot 样例更新。
链路分为两类:
 
1)直播间流式切片:异步链路,直播过程持续不断产生音视频切片样本,双 11、618 大促晚间流量会出现尖峰;
👉业务案例【直播间切片】:大促直播间,主播实时口播、画面、弹幕每 3‑5 秒生成一份切片,源源不断送入异步消息队列;不会等整场直播结束再审核,实现事中实时治理。
 
2)商品、商家资质、静态素材提交:以同步审核链路为主,商家主动提交资料触发审核,对端到端时延有硬性 SLA。
 
👉业务案例【商家资质】:商家入驻或者类目更新,上传营业执照、行业许可证、法人授权文件,同步触发机审,需要快速返回审核结果,不能接受长时间排队;
 
👉业务案例【商品发布】:商家上新商品,提交标题、主图、详情页、SKU 素材,同步进入机审流水线,决定商品是否可以直接上架。

召回环节 QPS(直播间切片维度)

直播大促 / 晚间高峰,切片整体入口万级 QPS,区间1‑3 万 QPS;平峰时段为数千 QPS;直播间静态元数据(封面、标题、挂载商品)属于事件触发,高峰仅数百 QPS。
前置经过轻量规则 + 轻量基线模型做过滤裁剪之后,真正流入后面大模型分支的流量仅占原始切片流量的 15%‑25%。召回链路整体时延要求百 ms 级,不会把全部原始切片直接送入高成本主干大模型,通过前置链路做流量削峰,控制算力成本。

送入人审之前全机审环节用到的模型集合:

  1. 机审粗召(召回环节):规则引擎 + 轻量基线模型(CV/BERT/ASR)+ Few‑Shot 少样本模型 + 向量 Embedding 召回模型 + 召回专用主干大模型,采用「前置串联过滤 + 存疑样本多路并行推理」架构;目标是高召回,宁可误召不漏风险,捞取疑似风险样本向下游流转;明确无风险样本直接放行,硬命中规则直接驳回。
👉直播间案例:ASR 把主播口播转文本、CV 解析直播画面、OCR 识别弹幕,轻量基线模型先做第一层过滤。
 
👉商品发布案例:BERT 轻量模型识别标题极限词,CV 识别商品主图 AI 假图风险,做前置粗筛。
 
👉商家资质案例:OCR 轻量基线模型,抽取营业执照、许可证的有效期、经营范围、法人字段,做硬规则前置校验。
  1. 机审提纯环节:对召回捞出来的存疑样本,调用召回专用主干大模型做多模态深度理解,结合 few‑shot 样例 Prompt、历史人审案例做二次校验,输出风险标签、置信度、可解释证据。
👉直播间案例:存疑切片,主干大模型融合画面 + 口播 ASR 文本 + 弹幕做多模态联合判定,比如主播画面展示普通护肤品,口播宣称医疗治疗功效,单一文本或 CV 模型很难识别这种跨模态组合违规,需要主干大模型融合多源信息判断。
 
👉商品发布案例:商品标题写 “100% 纯羊绒”,但详情页小字标注羊毛混纺;主干大模型同时读取标题、详情页全部文本,识别出前后描述矛盾的违规。
 
👉商家资质案例:同时读取营业执照、食品经营许可证、店铺经营类目,交叉核验资质和经营类目是否匹配。
  1. 机审驳回环节:主干大模型提纯输出之后,结合业务规则引擎联合判决;高置信度风险直接机审驳回,不再进人审;置信处于灰色区间,流转人审;确认无风险直接放行。
👉直播间案例:切片多模态证据充分、置信度达到业务红线,直接机审拦截切片对应的直播片段,生成带时间戳、截图、口播文本的完整证据链;证据冲突、置信度不足的切片,不做机器处置,直接推送到人审工作台。
 
👉商家资质案例:识别出 PS 篡改的许可证,证据链完整直接驳回入驻申请;篡改痕迹模糊,机器无法下定论,则流转人审复核。
 
👉商品发布案例:识别标题详情页矛盾,证据充分直接驳回商品上架;部分语义模糊、边界 case,送入人审人工复核。

Q2:机审召回、机审驳回环节,模型架构、流转链路分别是什么?有哪些模型类型?每个类型的模型数量?模型规格参数多少 B?模型之间关系、串联 / 并行?分流设计?模型输出结果?

回答:

1)各环节模型架构 & 流转链路

机审召回(粗召):前置串联过滤 + 存疑样本多路并行推理的混合架构
① 全部切片 / 送审样本先串联过规则引擎 + 轻量基线模型(CV/BERT/ASR,百 M‑1B);明确正常样本直接放行;命中硬违规规则直接机审驳回;只有存疑样本,才会进入下一级多路并行分支。
👉案例(直播间):轻量 ASR 识别出明文极限词 “100% 根治”,命中硬规则,在串联前置阶段直接机审驳回,不再进入后面的 Few‑Shot、主干大模型分支,节省算力。
 
👉案例(商家资质):OCR 识别出许可证已经过期,规则引擎直接硬驳回,不再进入大模型链路。
② 对筛选后的存疑样本,Few‑Shot 模型、召回主干大模型、Embedding 向量召回模型三路并行推理。
👉直播间案例:
 
1)Few‑Shot(7‑14B):识别新型变种话术,比如不直接说 “治病”,用隐晦描述宣称护肤品医疗效果;不需要大规模重新微调,只需要几十条最新 badcase 做成 Prompt 样例即可识别;
 
2)Embedding 向量召回(≤7B):比对历史违规话术向量,识别改写变体违规,例如把 “百分百见效” 改写为 “几乎全部都有效” 这类换说法的违规;
 
3)召回主干大模型(34‑70B):处理画面、口播、弹幕耦合的复杂多模态违规。
③ 聚合三路模型输出的风险标签、置信分,执行召回决策:命中风险则送下游机审提纯;无风险直接放行。
机审驳回环节:属于提纯后的判决分支,串联链路。
 
样本经过机审提纯主干大模型输出结果后,把模型输出的风险标签、置信度、证据,再送入规则引擎做联合判决;按照业务策略阈值做分流:
 
✅高置信风险:直接机审驳回,完成处置,不送入人审;
 
🟡灰色置信区间:流转人审队列;
 
✅确认无风险:直接放行。
⚠️关键:机审驳回不会单独跑一套独立大模型,复用上游提纯阶段主干大模型的推理结果,叠加业务规则做最终处置判断,避免重复推理带来算力与时延浪费。
 
👉业务案例:直播间切片已经在提纯阶段由主干大模型输出完整证据(切片时间戳、口播文本、画面截图);机审驳回环节不再重新调用大模型,只做规则二次校验,判断置信度是否达到自动处置红线。

2)模型类型、规格(参数量)

  1. 轻量基线模型(CV/BERT/ASR):百 M ~ 1B,放在召回最前置串联过滤,做快速识别,承担流量削峰;有多套垂类实例,分别处理画面、音频、文本。
  2. Few‑Shot 少样本模型:7B‑14B,少量 34B 规格;类目定向,识别新出现、少样本的违规话术;分商品、商家资质、直播间话术多个垂类版本。
👉案例:直播话术垂类 Few‑Shot,专门应对直播间层出不穷的变种营销话术;商家资质垂类 Few‑Shot 识别证照 PS 篡改的新型伪造手段。
  1. 召回专用主干大模型:34B‑70B;处理画面 + 口播 + 弹幕组合的复杂多模态违规;不会拿最大底座裸跑全量切片,只处理经过前置过滤后的小部分存疑样本。
  2. Embedding 向量召回模型:≤7B;比对历史违规向量,识别改写变体、变种违规话术。
  3. 配套:传统判别模型、规则引擎(非 LLM)。
注:线上部署实例具体数量属于内部业务信息,不便对外披露;我主要负责这套多模型编排调度工程落地,重点是链路、编排、分流、容灾、数据闭环。

3)模型之间关系:串联 + 并行混合

  1. 第一层:串联:规则引擎 + 轻量基线模型,做第一道过滤,放行 / 硬驳回,仅存疑样本往下流转。
  2. 第二层:并行:存疑样本同时跑 Few‑Shot、召回主干大模型、Embedding 向量召回三路推理。
  3. 第三层:串联:多路结果聚合之后,送入机审提纯主干大模型;提纯输出后串联规则引擎完成机审驳回 / 放行 / 送人审的判决分流。

4)关键分流设计(附带淘天落地业务案例)

  1. 业务样本路由分流:按照样本类型(商品、商家资质、直播切片、短视频)路由到对应垂类 Few‑Shot、轻量模型;直播切片单独走异步队列,商品、商家资质走同步链路。
👉案例:同一条送审流量,系统识别是直播切片,直接路由到异步高优先级队列;如果是商家入驻资质材料,路由同步链路,保障提交审核的响应时延。
  1. 优先级队列分流:直播间流式切片为高优先级异步队列;商品 / 商家提交同步链路保障时延 SLA;大促期间直播切片优先级高于普通商品巡检任务,避免直播实时审核被离线巡检任务抢占算力。
  2. 灰度双跑分流:新版本模型按百分比切流,新旧模型双跑对照,用于 A/B 实验评估效果。
👉案例:迭代新版本直播 Few‑Shot Prompt,先切 10% 直播流量新旧双跑,统计召回、误召指标,对比新版本效果,达标后再逐步放量;如果误召过高,回滚老版本。
  1. 降级熔断分流:主干大模型集群过载时,自动降级切流至「Few‑Shot 模型 + 规则引擎」兜底链路,牺牲部分复杂多模态风险召回能力,保障整条审核链路不雪崩。
👉案例:双 11 晚间直播高峰,主干 34‑70B 大模型 GPU 水位超过阈值,系统自动触发降级;关闭主干大模型分支,保留轻量基线 + Few‑Shot + 向量召回;此时简单话术、变体违规依旧可以识别,只是画面 + 口播耦合的复杂违规会漏一部分;等集群水位回落,自动恢复完整链路。
  1. 流量裁剪分流:直播切片原始大流量,前置轻量层过滤,只把 15‑25% 存疑样本送入高成本主干大模型,控制算力开销。

5)各模型输出结果(结合业务案例)

  1. 轻量基线模型(CV/BERT/ASR):风险类别标签、初步置信分、基础证据片段。
👉直播间案例:ASR 输出【营销极限词】标签,证据:切片 01:23 口播文本。
 
👉商家资质案例:OCR 输出【资质过期】标签,证据:营业执照到期时间字段。
  1. Few‑Shot 模型:垂类风险标签、置信分数、命中 few‑shot 样例编号。
👉直播案例:识别隐晦变种医美宣传,输出命中的 prompt 内样例 ID,方便算法回溯迭代样例库。
  1. Embedding 向量召回模型:历史相似违规样本 ID、向量相似度得分。
👉商品案例:识别改写抄袭的商品宣传文案,输出历史违规 case ID,给到算法复盘 badcase。
  1. 召回 / 提纯主干大模型:多维度风险标签、置信度、可阅读可解释风险依据、证据定位(切片时间点 / 文本片段 / 图片区域),输出内容可以直接作为人审判决参考。
👉商品案例:识别标题‑详情页描述矛盾,输出:标题原文片段、详情页原文片段、矛盾点说明。
 
👉直播间案例:输出切片时间戳、主播口播原文、画面关键帧截图位置,人审同学点开就能直接看证据,不需要人工回溯整段直播。
  1. 规则引擎输出:命中规则 ID、规则触发条件。
多路并行之后会做结果聚合模块,融合多路标签、置信分,输出统一的召回决策,向下游传递。

Q3:送入人审之前的机审环节,涉及哪些职能角色?治理算法和 PE(模型工程)的工作边界是什么?

回答:

涉及职能角色(结合直播间切片 / 商家资质项目真实协作案例)

  1. 治理算法团队:负责模型侧全部迭代工作;包含主干大模型微调、few‑shot Prompt 与样例库迭代、各类模型离线训练;构建评测集、badcase 分析;输出模型、Prompt、few‑shot 样例、模型阈值建议;分析线上回流业务数据,定位模型效果问题,驱动迭代。
👉案例:大促之后收集直播间变种话术漏召 badcase;算法团队标注几十条新样例,迭代 Few‑Shot Prompt,离线评测验证变种话术召回提升,输出新版本 Prompt 和阈值建议。算法不负责怎么把这套 Prompt 在万级 QPS 链路稳定跑起来,不做编排调度。
  1. 治理产品经理:定义机审整体业务策略;定义机审驳回阈值、什么场景送人审、什么场景直接机审处置;定义风险标签体系;输出业务 SLA(召回率、驳回准确率、人审溢出率);评审阈值变更、策略变更。
👉案例:产品定义直播间治理策略:召回环节优先保召回,允许适度误召;只有证据充分、高置信才允许机器自动驳回,模糊 case 强制流入人审;输出置信阈值、人审溢出率的业务约束。
  1. 治理运营(人审运营):提供标注样本、线上 badcase;反馈人审过程中的各类问题;参与策略、阈值评审;产出人审结果,作为数据回流的源头。
👉案例:人审运营处理机器流转过来的灰色直播间切片,把机器误判、漏判的 case 标注,回流给到算法,用于更新 few‑shot 样例库与评测集。
  1. 模型工程 PE(本人所在团队):承接算法交付的模型、Prompt、few‑shot 样例,完成推理服务开发;负责多模型编排调度、同步 / 异步链路建设、队列削峰、流量分流、灰度、降级熔断、全链路埋点、人审结果数据回流链路;负责线上服务的时延、QPS、峰值稳定性;故障定位复盘;把产品输出的业务策略、阈值转化为线上可执行编排逻辑。
👉案例:算法交付新版本 Few‑Shot Prompt;我这边 PE 侧负责完成 Prompt 工程化上线,配置 10% 灰度双跑分流;打通全链路埋点,把机审召回、驳回、后续人审判决结果完整回流;灰度观测发现新版本召回提升,但误召上涨超出产品业务容忍阈值,把线上指标回灌给算法 + 产品,共同决策不做全量放量,继续迭代样例库。PE 不做模型训练、不调 Prompt、不做离线模型效果优化。
  1. 底层平台 PE:提供底层底座资源,K8s 集群、网关、消息队列、存储、算力集群等基础基础设施。

治理算法与模型工程 PE 清晰工作边界

治理算法对「模型本身效果」负责:模型训练、微调、RLHF、few‑shot 样例 / Prompt 迭代;离线评测、版本效果对比;输出模型输入输出 Schema、业务阈值建议;基于线上回流数据做 badcase 分析,产出模型迭代方案。算法不负责线上链路工程实现、不负责推理服务稳定性、不负责调度编排。
模型工程 PE 对「线上全链路工程落地与运行质量」负责:把算法交付的模型、Prompt、样例工程化上线;搭建多模型编排调度、同步异步任务链路;实现分流、灰度、降级熔断;建设埋点与机审召回 / 驳回 / 人审结果回流闭环;做压测、容量评估,保障大促直播高峰 QPS 与时延 SLA;线上故障排查复盘;将产品的业务策略阈值转化为线上编排路由逻辑。PE 不做模型训练、不调 Prompt、不做离线模型效果优化。
协作模式:算法输出模型版本 + 阈值建议;产品确认业务策略与最终阈值;PE 负责把整套能力落地线上,产出线上真实业务指标,回灌给算法、产品,形成闭环。

三、测试问题专项问答(面试官单独追问直接使用)

测试问题:针对直播间的审核,治理召回环节 qps 量级是多少?机审召回环节用到哪些类型的模型、不同模型之间的关联关系是什么?
 
回答:
  1. 召回环节 QPS 量级(直播间切片维度)
     
    直播间审核以切片样本统计 QPS:直播高峰(大促 / 晚间),整体入口切片万级 QPS(1‑3 万),平峰数千 QPS;经前置轻量规则、轻量小模型过滤裁剪后,真正流入大模型分支仅为原流量的 15‑25%;直播间静态元数据(封面、标题、挂载商品)属于事件触发,高峰仅数百 QPS。召回链路时延要求百 ms 级,不会把全量切片直接送入大模型。
  2. 机审召回环节用到的模型类型
     
    召回目标是优先保证高召回,宁可误召不漏风险,捞取疑似风险样本送下游提纯,是规则 + 多模型混合体系:
     
    ①轻量基线模型(CV/BERT/ASR,百 M‑1B):前置串联过滤,快速放行明确正常样本,做流量削峰;
     
    ②Few Shot 模型(7B‑14B,少量 34B):类目定向识别新出现、少样本的违规话术;
     
    ③召回专用主干大模型(34B‑70B):处理画面 + 口播 + 弹幕的复杂组合类违规;不会拿最大底座裸跑全量切片;
     
    ④Embedding 向量召回模型(≤7B):比对历史违规向量,识别改写变体违规话术。
  3. 模型之间关联关系:串联前置 + 多路并行分支的混合架构
     
    ①全部切片先串联过规则引擎 + 轻量基线模型:明确正常直接放行;硬违规直接机审驳回;只有存疑样本才进入下一级;
     
    ②对筛选后的存疑样本,Few Shot、召回主干大模型、向量召回三路并行推理;
     
    ③聚合三路模型输出的风险标签、置信分,做召回决策:命中风险则送下游机审提纯;无风险则放行。
补充业务案例:双 11 晚间直播切片,大量正常切片在前置串联环节直接放行;剩余存疑切片进入三路并行;Few‑Shot 抓新型变种话术,向量召回抓改写变体,主干大模型处理音画弹幕耦合复杂违规;三路输出聚合之后,标记风险样本送入提纯链路。

四、高频追问预判(全部补充业务案例,面试临场)

Q1:为什么召回环节要采用多路并行,而不是全部跑主干大模型?

答:
 
直播切片高峰入口万级 QPS,如果全部切片直接送入 34B‑70B 主干大模型,算力成本会成倍激增,同时时延无法满足百 ms 级召回 SLA。
 
我们采用分层策略:前置轻量模型 + 规则做第一道过滤,放行大量明确正常样本;只有存疑的 15‑25% 切片,才进入三路并行分支。
  • Few‑Shot:解决少量样本的新型违规话术,不需要大规模微调;
  • 向量召回:专门捕获改写变体违规;
  • 主干多模态大模型:只处理画面 + 口播 + 弹幕耦合的复杂违规;
     
    三路各司其职,在保证风险召回的前提下,控制算力成本与链路时延;同时配套降级熔断,大模型过载的时候可以切兜底链路,保障链路可用性。
👉案例:大促直播,9 万左右 QPS 切片流量,前置过滤之后只剩 1‑2 万存疑样本进入三路并行,算力开销下降非常明显;如果全量跑主干大模型,集群算力要扩容数倍,成本不可接受。

Q2:机审环节如何处理大模型输出幻觉,避免错误机审驳回?

答:
 
两层防护:
  1. 主干大模型输出必须附带可定位证据(切片时间戳、文本片段、图片区域),没有证据支撑的高风险标签会被规则引擎拦截,不允许直接机审驳回。
👉案例:主干大模型幻觉输出 “主播宣称医疗功效”,但是没有匹配到对应的口播文本与画面证据,规则引擎拦截,不会触发机审驳回,这条 case 直接流转人审。
  1. 设置严格阈值,只有证据充分、置信度达到业务红线才允许自动机审驳回;模糊、置信度不足的 case,强制流转人审,机器不做最终处置;
  2. 人审的 badcase 结果全链路回流,用来迭代 Few‑Shot 样例库、Prompt,持续抑制幻觉误判。

Q3:直播切片异步链路,出现消息堆积、切片乱序你们怎么处理?

答:
 
①队列做分片、设置优先级,风险相关切片优先处理;②每条切片携带原始时间戳,链路内部做时序校正;③设置队列水位告警;④主干大模型集群水位到达阈值,自动触发降级切流至轻量模型 + 规则兜底,避免消息队列无限堆积;⑤堆积超时的旧切片做丢弃,优先保障实时新切片的审核时效。
👉案例:大促晚间瞬时流量冲高,队列出现堆积;系统触发降级,关闭主干大模型分支,优先处理最新产生的直播切片;堆积超过阈值的几十秒之前的历史切片直接丢弃,优先保障事中实时治理。

Q4:Few‑Shot、主干大模型、向量召回,三者怎么分工,什么时候用哪一个?

答:
  1. Few‑Shot(7‑14B):新型、少样本违规,来不及大规模微调,几十条样例 Prompt 即可识别变种话术;放在并行召回分支;👉案例:直播间新冒出来的隐晦功效宣传话术。
  2. Embedding 向量召回(≤7B):改写、变体抄袭类违规,比对历史违规向量;关键词规则抓不到改写之后的变体话术,向量召回命中变体;👉案例:把 “100% 有效” 改写为 “几乎全部都有效果”。
  3. 主干大模型(34‑70B):多模态、多源信息耦合的复杂 case,画面和口播联合违规、商品标题和详情页跨文档矛盾;算力贵,只处理前置过滤之后的存疑样本;👉案例:主播画面展示普通护肤品,口播宣传医疗治疗效果,单模态模型识别不出来,需要主干大模型融合音画联合判断。

Q5:机审驳回会不会重新调用一遍主干大模型?

答:
 
不会。机审驳回环节复用机审提纯阶段主干大模型已经产出的风险标签、置信度、完整证据链,不会重新发起大模型推理;只串联业务规则引擎做阈值判决。
👉案例:直播切片提纯阶段已经拿到全部证据;驳回环节只是判断置信度是否达到自动处置红线;如果达到,直接生成处置工单;达不到,推送人审工作台,不重复调用大模型,节省算力与时延。

Q6:商家资质审核这条链路,完整跑一遍是什么样?

答:
 
商家提交入驻材料(营业执照、行业许可证、法人授权书)→同步链路送审。
 
1)机审粗召(召回,串联前置):OCR 轻量基线模型抽取全部证照字段;规则引擎做硬校验:营业执照过期、经营范围完全不匹配类目,直接机审驳回;字段无硬错误,判定为存疑样本进入下一级。
 
2)多路并行召回:Few‑Shot 垂类模型识别证照 PS 篡改痕迹;向量召回比对历史伪造证照样本;主干大模型做多材料交叉核验:营业执照、许可证、店铺经营类目三者是否匹配。
 
3)机审提纯:主干大模型进一步交叉校验全部资质材料,输出风险标签、置信度、证据(篡改位置、字段不匹配原文)。
 
4)机审驳回判决:证据充分、置信度高,直接驳回入驻申请;篡改痕迹模糊、材料冲突无法下定论,流转人审工作台,人审同学直接读取模型输出的证据,人工复核。

Q7:商品发布场景,完整链路案例?

答:
 
商家上新,提交商品标题、主图、详情页、SKU 素材同步送审。
 
1)机审粗召(串联前置):BERT 轻量模型识别标题极限词;CV 模型识别 AI 假图、主图明显违规;命中硬规则直接驳回;其余进入存疑样本。
 
2)并行召回分支:Few‑Shot 识别新型变种虚假宣传话术;向量召回比对历史侵权文案、盗图向量;主干大模型做多模态、跨文档理解,识别标题‑详情‑图片互相矛盾的违规。
 
3)机审提纯:主干大模型深度解析全部素材,输出风险标签、证据片段。
 
4)机审驳回判决:证据充分高置信,直接驳回上架;语义边界模糊,流转人审复核。
👉典型 case:标题写 “纯银饰品”,详情页写合金材质;前置规则只能抓到标题极限词,抓不到跨文档矛盾;需要主干大模型提纯识别,证据充足直接驳回商品上架。

五、访谈注意避坑清单

✅可以讲:链路流转逻辑、多模型编排串联并行架构、分流 / 灰度 / 降级策略、同步异步链路差异、直播切片流量削峰思路、各角色分工边界、A/B 实验 + 人审回流闭环;测试问题给到的 QPS、流量占比、模型参数量区间可以正常口述;直播间、商家资质、商品发布的业务场景案例全部可以口述。
⚠️涉密内容不输出:线上具体部署实例数量、内部完整模型清单、业务大盘整体机审召回率 / 驳回准确率 / 人审溢出率、内部完整阈值;被追问时:“该类业务核心大盘指标属于内部业务信息不便对外披露,我可以介绍链路架构、项目实验观测指标、落地业务案例”。
❌不要编造:直属中层 leader 姓名;只讲公开高管:平台事业部总裁汤兴、业务风控部总经理叶智飞,中层内部负责人简历、纪要不写名字。
关键认知区分:机审驳回环节不独立跑一套大模型,复用机审提纯主干大模型的推理结果,叠加规则做判决分流,这点非常容易回答出错。

六、访谈会前一页速记(开会前快速浏览)

  1. 三大业务场景:直播间流式切片(异步、万级 QPS,15‑25% 进入大模型);商家资质入驻(同步,证照交叉核验、PS 篡改识别);商品发布上新(同步,跨文档图文矛盾、AI 假图治理)。
  2. 架构总览:前置串联过滤 → 存疑样本三路并行(Few‑Shot / 主干 / Embedding)→聚合→机审提纯主干大模型→规则引擎判决分流(驳回 / 放行 / 人审);驳回不复用重新调用大模型。
  3. 模型分工:
    • 轻量基线:前置串联、流量削峰;百 M‑1B
    • Few‑Shot:新型少样本变种违规;7‑14B,少量 34B
    • 向量 Embedding:改写变体违规;≤7B
    • 召回提纯主干大模型:多模态复杂耦合 case;34‑70B,仅处理存疑样本
  4. 五大分流:业务路由分流、优先级队列、灰度双跑、降级熔断、流量裁剪。
  5. 角色边界:算法负责模型 / Prompt / 样例、离线评测;PE 负责编排调度、链路、灰度降级、埋点数据回流,不调 Prompt 不训练模型;产品定义业务阈值;运营提供 badcase 与人审结果。
  6. 风险红线:不对外披露大盘业务指标、实例数、中层 leader 名字;强调所有自动机审驳回必须附带完整可追溯证据,无证据不允许机器直接处置。

补充问题 1:召回专用主干大模型(34B‑70B),这个节点输入有多少 qps,以及用了多少 GPU 推理卡,卡型号是什么,输入 prompt 长度和模型输出 token 长度分别有多少

专家口述完整回答

背景:主干大模型不会接收全量原始切片,只接收经过前置串联过滤之后的存疑样本

1)该主干大模型节点入口 QPS 直播大促晚间高峰:原始切片入口 1‑3 万 QPS;经过轻量规则 + 基线模型裁剪,只有15%‑25% 存疑样本流入后续并行分支;并行分支包含三路:Few‑Shot、Embedding 向量召回、召回专用主干大模型。 三路是并行推理,主干大模型实际输入 QPS 区间:大促高峰 1500‑4500 QPS;平峰时段:数百 QPS

业务案例:大促峰值原始切片 2 万 QPS,前置过滤后剩余 3000‑5000 存疑样本 QPS,这部分流量复制分发到三路并行;主干大模型承接其中 1500‑4500QPS 区间,不是 2 万全量直接打进来。 注意:不是全部存疑样本 100% 进主干,内部还会配合动态流量裁剪策略,极端尖峰下会进一步降低主干的输入占比,配合降级熔断兜底链路。

2)GPU 推理卡数量、卡型号(涉密边界重点)

口述:具体 GPU 卡数量、精确硬件型号属于内部基础设施资源信息,不方便对外披露,我可以讲选型的设计原则

  • 选型原则:针对 34B~70B 多模态大模型推理,线上推理集群采用支持 FP8/FP16 量化的高性能 GPU,做模型权重分片分布式推理;结合 vLLM 类推理框架做连续批处理,提升单卡吞吐,降低峰值算力压力。
  • 工程策略:集群做容量压测预留水位,大促前完成全链路压测;设置集群 GPU 水位阈值,当 GPU 利用率到达阈值上限,自动触发降级熔断,切到 Few‑Shot + 向量召回 + 规则兜底链路,保护主干集群不雪崩。

如果面试官继续追问 “大概多少张卡,给个量级”:回复 “这个资源量级会随大促预案动态扩容缩容,不同周期差异很大,没有固定静态量级,这块内部信息不便展开,我们可以重点聊流量裁剪、降级熔断的工程策略”。

3)输入 Prompt 长度(token)、模型输出 token 长度

是多模态输入:图像关键帧 + ASR 口播文本 + OCR 弹幕文本,文本部分统计 token;图像是多模态 embedding 输入不计入文本 prompt token。

  • 输入文本 Prompt token 区间:单条直播切片,把切片内口播 ASR、弹幕 OCR、业务指令、few‑shot 参考样例片段拼接之后: 普通切片:800‑2000 token; 复杂长切片(弹幕密集、口播内容多,附带少量 few‑shot 参考样例)峰值会到2500‑3200 token

工程约束:线上做 Prompt 截断策略,超过阈值会对弹幕做采样、去重裁剪,防止 Prompt 无限膨胀,保证推理时延可控。

  • 模型输出 token 长度区间: 主干大模型输出内容包含:风险标签、风险置信依据、定位证据(口播片段、画面描述、时间戳)、风险原因解释。 绝大多数 case 输出:120‑400 token; 少数复杂多模态耦合违规,需要多源证据交叉说明,上限会到600‑800 token

工程侧设置输出 token 最大上限,避免大模型无限生成,同时配合输出后解析模块,结构化抽取标签、证据,丢弃无效冗余文本。

业务案例:一条 3‑5 秒直播切片,ASR 口播文本很短,弹幕量一般,输入 Prompt 约 1200token;模型输出 220token,输出结构化结论:风险标签【虚假医疗功效宣传】,证据:切片 00:42 口播原文,画面关键帧编号,置信度分数。

补充问题 2:直播高峰(大促 / 晚间):整体入口切片万级 QPS(1‑3 万),平峰数千 QPS。单个切片的时长是多少?

专家口述完整回答

直播流式切片不是固定死时长,是时间窗口切片机制,分基础切片、超长片段二次切分。 1)标准基础切片:3‑5 秒(线上绝大多数切片) 直播间事中实时治理,每 3‑5 秒切割一份音视频切片;输出这份切片对应的:视频关键帧、ASR 语音转文本、该窗口内弹幕 OCR 文本;送入异步审核队列。

业务案例:大促主播直播,系统每 4 秒生成一份切片,持续不断送入异步消息队列,实现事中审核,不需要等整场直播结束。

2)异常场景:瞬时安静、无语音无弹幕的片段,会做聚合切片,最长不超过 10 秒。 如果连续 3‑5 秒切片里面没有口播、没有弹幕,全部是静态画面,为了降低切片数量,工程侧会把相邻窗口聚合,最大聚合到 10 秒,减少无效切片的总 QPS,节约下游推理资源。

3)边界约束:不会做超过 10 秒的切片。 切片如果过长,会带来两个严重问题: ① 事中治理时效性变差,风险发现延迟; ② ASR、画面、弹幕文本输入 Prompt 会爆炸,token 飙升,推理时延、算力开销急剧上涨;

工程策略:超过 10 秒的片段强制二次切分,保证单份切片控制在 10 秒以内。

4)补充说明 QPS 和时长关系: 对外说的 “1‑3 万切片 QPS”,统计对象就是上面 3‑5 秒为主的切片;聚合后的 10 秒切片会降低 QPS 数量,大促高峰优先关闭长聚合策略,全部回到 3‑5 秒标准切片,优先保障事中治理时效,牺牲一部分算力。

总结口述精简版(面试快速作答): 直播绝大多数切片是3‑5 秒标准切片;对于无语音无弹幕的静态画面片段,会聚合最长到 10 秒;不会超过 10 秒,过长会强制二次切分。大促高峰关闭长聚合,全部使用 3‑5 秒切片,优先保障实时治理,所以高峰会观测到 1‑3 万切片的入口 QPS。

新增内容整合进【访谈会前一页速记】(可以复制到备忘录,面试前快速扫一眼)

新增条目:

  1. 召回主干大模型(34‑70B)输入 QPS:高峰 1500‑4500QPS,平峰数百 QPS;来自前置过滤后的 15‑25% 存疑样本;
  2. GPU 卡:卡数量、具体型号不对外披露;选型为支持 FP8/FP16 高性能 GPU,分布式分片推理,连续批处理;依靠水位监控 + 降级熔断保护集群。
  3. Prompt & 输出 Token: 输入文本 Prompt:普通切片 800‑2000token,复杂峰值 2500‑3200token,做截断采样控制上限; 模型输出 token:大多 120‑400token,复杂 case 上限 600‑800token,设置最大生成上限。
  4. 直播切片时长:标准3‑5 秒;静态无交互片段最长聚合 10 秒;禁止超过 10 秒,超长强制二次切分;大促高峰关闭长聚合。

新增避坑点,补充到原有《访谈注意避坑清单》

✅可以讲:主干大模型输入 QPS 区间、切片时长区间、Prompt / 输出 token 区间、GPU 选型原则、连续批处理、水位监控、切片聚合 / 切分工程策略。 ⚠️涉密不输出:GPU 确切卡数量、精确卡型号;集群静态资源规模;大促扩容之后具体硬件总数;被追问时回复:“硬件资源规模会随大促预案动态扩缩容,具体硬件规格与数量属于内部基础设施信息不便对外展开,我可以介绍对应的工程架构与限流降级策略”。 ❌不要编造:不要估算、不要猜 “大概几百张卡” 这类量级,直接回避硬件绝对规模。

面试官延伸追问预判(新增 2 条,临场应答)

追问 A:为什么输入 Prompt token 最高要控制在 3200,不能更大?

答: 两点核心约束: 1)时延约束:token 越大,多模态推理耗时越高;召回链路有百 ms 级 SLA 要求,Prompt 无限膨胀会直接击穿时延; 2)成本约束:token 越高,大模型推理算力消耗线性上涨,直播本身 QPS 基数大,会带来不可控成本; 同时模型本身上下文窗口也有硬上限。 所以工程上做裁剪策略:对于弹幕密集切片,做弹幕采样、去重;超长 ASR 文本做摘要式截断,把输入 token 控制在阈值以内,平衡召回效果、时延、算力成本。

追问 B:切片聚合到 10 秒,会不会漏风险?

答: 我们只对完全没有口播语音、没有弹幕交互的纯静态画面做聚合;一旦切片窗口检测到有主播语音、弹幕消息,立刻停止聚合,使用标准 3‑5 秒切片。 也就是说:有业务风险高概率的活跃片段,永远用短切片;聚合只用于低风险的安静片段。同时离线评测对比过 3‑5 秒 vs 10 秒聚合切片的风险召回指标,确认召回没有明显下跌,线上才落地这个聚合策略;大促高峰直接关闭聚合,全部切回 3‑5 秒,进一步规避风险。

如果你需要,我可以把全部文档(原有全部内容 + 本次新增问题 + 追问)合并成一份完整的访谈文档。

posted on 2026-09-06 21:55  limingqi  阅读(28)  评论(0)    收藏  举报

导航