内容安全课程 — 考试重点整理与习题
内容安全课程 — 考试重点整理与习题
第一部分:考试重点整理
一、计算题重点(3道)
1. Self-Attention 计算
核心公式:
- Attention(Q, K, V) = softmax(Q × K^T / √d_k) × V
- Q = Query 查询矩阵
- K = Key 键矩阵
- V = Value 值矩阵
- d_k = K的维度(缩放因子,防止softmax梯度过小)
矩阵运算要点:
- Q × K^T 得到注意力分数矩阵(Attention Score Matrix)
- 转置计算:注意 K^T 是 K 的转置矩阵
- 矩阵不一定对称(考转置,不考 A→A' 的对称性)
- 经过 softmax 后得到注意力权重
- 最后乘以 V 得到输出
步骤:
- 输入序列 → 生成 Q, K, V(通过乘以权重矩阵)
- 计算 Q × K^T
- 除以 √d_k(缩放)
- Softmax 归一化
- 乘以 V 得到输出
2. DNN 卷积运算
要点:
- 看清步长(stride)
- 一个 filter(滤波器)
- 卷积核(kernel)大小
- Padding(填充)方式
卷积输出尺寸公式:
- 输出尺寸 = ⌊(输入尺寸 - 卷积核大小 + 2 × Padding) / 步长⌋ + 1
例: 输入 6×6,卷积核 3×3,步长=1,padding=0
- 输出 = (6-3+0)/1 + 1 = 4
- 输出 4×4 特征图
3. 池化(Pooling)
最大池化(Max Pooling): 取窗口内的最大值
- 例:2×2 窗口,步长=2 → 取每个2×2区域的最大值
平均池化(Average Pooling): 取窗口内的平均值
- 例:2×2 窗口,步长=2 → 取每个2×2区域的平均值
作用: 降采样、减少参数、防止过拟合、增强平移不变性
二、简答题重点
(一)内容安全简介
1. 什么是内容安全?包括什么产品?
- 定义: 内容安全(Content Security)是信息安全的一个分支,其目的是识别、阻断不良信息传播,例如滥发电子讯息(Spamming)、色情内容、犯罪内容、恐怖主义内容、政治敏感内容等。涉及技术包括自然语言处理、计算机视觉等,涉及内容包括文字、图片、音频、视频等。
- 产品厂商: 阿里、腾讯、百度、网易等
- 阿里:多媒体内容智能识别服务,支持图片、视频、文本、语音等检测
- 腾讯:基于深度学习识别技术,高效识别文字、图片、视频等多媒体的违规内容
2. 超高清内容安全审核包括什么技术?
以人工智能为基础,综合运用:
- 视图像分类技术: 基于CNN对待分析视频进行关键帧抽取、短视频分割后,进行特征提取并形成特征向量,通过LSTM对序列进行识别分析
- 目标检测识别技术: 通过Selective Search提取区域,CNN提取特征,SVM分类,Bounding Box回归
- 人脸识别技术: 参考模板法、人脸规则法、特征子脸法进行人脸检测,预处理后提取人脸特征,与数据库比对
- 超大规模向量检索技术: ANN(近似最近邻搜索),融合分布式应用、并行计算和特征向量提取
系统功能:
- 支持特定人物、特定目标、特定场景提取与分析识别
- 支持内容安全的多维审核
- 支持多角度审核(特定人脸、旗帜、徽标、场景)
3. 内容安全的四个层次(从难到易):
| 层次 | 内容 | 现状 |
|---|---|---|
| 第四层(最难) | 不良价值观识别(炫富、炫官、假丑恶) | 依赖人工识别,几乎尚未开始研究 |
| 第三层 | 多媒体伪造与鉴伪 | 依赖人工识别,属于实验室技术 |
| 第二层 | 个性化推荐算法滥用(信息茧房、大数据杀熟、虚假谣言、用户沉迷等) | 已有测试阶段产品与相关管理规定 |
| 第一层(最成熟) | 传统涉黄涉政涉爆等不良内容识别 | 已相对成熟,已有产品服务 |
(二)视觉内容安全概述
1. 实例分割(Instance Segmentation)
- 将不同类型的实例进行分类,例如用5种不同颜色标记5辆汽车
- 不仅需要将不同对象分类,还要确定对象的边界、差异和彼此之间的关系
- 与语义分割的区别:语义分割是对每个像素标注类别,实例分割还要区分同类不同个体
2. 深度伪造(Deepfake)
- 定义: 利用深度学习等AI技术伪造或合成的图片、音频、视频
- 危害: 敲诈勒索、假冒身份、散布虚假信息、对社会稳定造成不良影响
- 技术原理: 内容自动编码与错位解码(Autoencoder + 错位解码)
- 常见方法:
- GAN(生成对抗网络):生成器+识别器相互博弈
- 视频换脸工具:Deepfake、ZAO等
- 语音深度合成:WaveNet、科大讯飞语音合成
- Sora(扩散模型):一次生成整个视频,使用Transformer架构
(三)文本相关内容
1. 独热编码(One-hot Encoding)
- 每个词对应一个高维向量,其中一维为1,其余为0
- 缺点:无法刻画词语的语法和语义信息;维度灾难;稀疏性
2. 词嵌入(Word Embedding)
- 利用低维连续的实数向量表示一个词
- 语义相近的词在向量空间中也邻近
- Word2vec(CBOW、Skip-gram模型)
3. 独热编码 vs 词嵌入:
| 对比项 | 独热编码 | 词嵌入 |
|---|---|---|
| 维度 | 高维(词表大小) | 低维(自定义) |
| 语义表示 | 无法表示语义相似性 | 可表示语义相近 |
| 稀疏性 | 稀疏 | 稠密 |
| 学习能力 | 固定,无法学习 | 可从数据中学习 |
4. 位置编码(Positional Encoding)
- 因为Self-attention本身不具备位置信息(并行计算,不考虑顺序),需要加入位置编码
- 将位置信息加入输入向量,让模型知道词的位置顺序
5. BERT 与 GPT
| 对比项 | BERT | GPT |
|---|---|---|
| 架构 | Transformer编码器(Encoder) | Transformer解码器(Decoder) |
| 训练方式 | Masking Input(完形填空)+ Next Sentence Prediction | Predict Next Token(文字接龙) |
| 双向/单向 | 双向上下文 | 单向(从左到右) |
6. ChatGPT
- ChatGPT的学习四阶段:
- 预训练 — 得到GPT
- 监督微调 — 引导文字接龙方向
- 训练奖励模型 — 基于人类反馈(RLHF),模拟人类喜好
- 强化学习 — 利用奖励模型进行强化学习
(四)Python及神经网络基础
训练集损失分析:
| 训练集损失 | 问题 | 解决方案 |
|---|---|---|
| 偏大 | 模型偏差(Model Bias):模型过于简单,无法拟合数据 | 重新设计更复杂的模型(更多特征、更深网络) |
| 偏大 | 优化问题(Optimization Issue):梯度下降找不到最优解 | 使用更强的优化算法 |
| 偏小 | 过拟合(Overfitting):训练集好、测试集差 | 更多训练数据、数据增广、简化模型、正则化、Dropout |
| 偏小 | 失配(Mismatch):训练集和测试集分布不同 | 调整数据分布 |
如何区分 Model Bias 和 Optimization Issue?
- 从较浅的模型开始训练,如果更深的网络无法获得更小的损失,可能是优化问题
关键概念:
- 训练集(Training Set):调整神经网络参数
- 验证集(Validation Set):查看训练效果,调整超参数
- 测试集(Test Set):评估最终模型的泛化能力
优化算法:
- SGD(随机梯度下降):Batch = 小批量
- Momentum:考虑前一步移动方向,加速收敛
- RMSProp:自适应学习率
- Adam = RMSProp + Momentum(最常用)
- Epoch:跑完所有batch一次
- Batch Size:一次训练的样本数
- Iteration:一个batch训练一次
(五)音频内容安全
1. 音频内容安全的四种类型:
| 类型 | 技术 | 说明 |
|---|---|---|
| 音频→文本 | ASR(自动语音识别) | 分析语音内容的敏感信息 |
| 文本→音频 | TTS(文本到语音合成) | 生成虚假语音 |
| 音频→音频 | 语音分离(Speech Separation)、语音转换(Voice Conversion) | 分离噪声/分离语者、转换声音 |
| 音频→分类 | 语者识别(Speaker Recognition)、语者验证(Speaker Verification) | 确认语音真实性和身份 |
2. 端到端 vs 非端到端:
| 对比项 | 非端到端 | 端到端 |
|---|---|---|
| 代表方法 | GMM-HMM, DNN-HMM | LAS, CTC, RNA, RNN-T |
| 模型大小 | 大(上GB参数) | 小(几十MB参数) |
| 结构复杂性 | 复杂,分多个模块 | 简单,一个模型直接输出 |
语音识别模型对比:
- LAS(Listen, Attend, Spell): 典型seq2seq模型,含编码器+解码器+注意力机制,需听完一整段音频才能输出
- CTC: 编码器是线性分类器,可实时预测文本
- RNA(Recurrent Neural Aligner): 输入一个特征输出一个token,可实时预测
- RNN-T: 输入一个特征可输出多个token,可实时预测
- Neural Transducer: 每次输入一个窗口的多特征向量
- MoChA: 自适应判定窗口位置
(六)选择题考点
1. 深度学习框架:
- 国外:TensorFlow, PyTorch, Keras
- 国内(国产): PaddlePaddle(百度飞桨)、MindSpore(华为)、MegEngine(旷视)、OneFlow(一流科技)
- match:框架匹配题
2. 显卡/AI芯片:
- 国外:NVIDIA(英伟达)
- 国内: 华为(昇腾Ascend)、寒武纪(Cambricon)、百度(昆仑)、地平线
- Match:芯片厂商对应
3. 卷积计算(百度考点?):
- 向上取整/向下取整:当(输入尺寸 - 核大小) / 步长 不是整数时
- 输出尺寸计算
4. Batch Size, Epoch, Iteration 关系:
- Epoch: 所有训练数据完成一次前向传播和反向传播
- Batch Size: 每次迭代训练使用的样本数
- Iteration: 完成一个batch的训练 = 一次参数更新
- 关系:Iteration = 总样本数 / Batch Size(1个epoch的迭代次数)
5. 分类问题 vs 回归问题:
- 分类(Classification): 输出离散类别标签(如猫/狗、正/负)
- 回归(Regression): 输出连续数值(如预测价格、温度)
6. CNN vs Transformer:
- CNN: 局部连接、参数共享、平移不变性、感受野有限
- Transformer: 全局注意力、捕获长距离依赖、并行计算
7. 常见网络:
- CNN经典网络: LeNet, AlexNet, VGG, ResNet, Inception, DenseNet, MobileNet
- Transformer: BERT, GPT系列, ViT(Vision Transformer)
第二部分:练习题(含答案)
一、计算题
题1:Self-Attention 矩阵计算
假设输入序列有3个词,每个词的维度是4。经过线性变换后得到 Q, K, V 矩阵如下:
Q = [[1, 0, 1, 0], K = [[0, 1, 0, 1], V = [[1, 0, 0],
[0, 1, 0, 1], [1, 0, 1, 0], [0, 1, 0],
[1, 1, 0, 0]] [0, 0, 1, 1]] [0, 0, 1]]
d_k = 4,请计算:
- 注意力分数矩阵 S = Q × K^T
- 计算缩放后的分数矩阵 S / √d_k
- (概念题)简要说明 softmax 后如何得到最终输出
答案:
- Q × K^T(3×4 × 4×3 = 3×3矩阵):
K^T =
[0, 1, 0]
[1, 0, 0]
[0, 1, 1]
[1, 0, 1]
S = Q × K^T:
第一行 [1,0,1,0] × K^T:
- [1×0+0×1+1×0+0×1, 1×1+0×0+1×1+0×0, 1×0+0×0+1×1+0×1] = [0, 2, 1]
第二行 [0,1,0,1] × K^T:
- [0×0+1×1+0×0+1×1, 0×1+1×0+0×1+1×0, 0×0+1×0+0×1+1×1] = [2, 0, 1]
第三行 [1,1,0,0] × K^T:
- [1×0+1×1+0×0+0×1, 1×1+1×0+0×1+0×0, 1×0+1×0+0×1+0×1] = [1, 1, 0]
S = [[0, 2, 1],
[2, 0, 1],
[1, 1, 0]]
- 缩放:√d_k = √4 = 2
S_scaled = S / 2:
S_scaled = [[0, 1, 0.5],
[1, 0, 0.5],
[0.5, 0.5, 0]]
- 对 S_scaled 的每一行做 softmax 得到注意力权重矩阵 A,然后 A × V 得到最终输出。Softmax 将每行的值转换为概率分布(和为1)。
题2:卷积运算
输入图像为 5×5 的矩阵:
输入图像:
[[1, 0, 1, 0, 1],
[0, 1, 0, 1, 0],
[1, 1, 0, 0, 1],
[0, 0, 1, 1, 0],
[1, 0, 0, 1, 1]]
卷积核(Filter)为 3×3:
Filter = [[1, 0, 1],
[0, 1, 0],
[1, 0, 1]]
步长 stride = 1,padding = 0,请计算卷积后的输出特征图。
答案:
输出尺寸 = (5-3+0)/1 + 1 = 3,输出为 3×3 矩阵。
计算过程(每个位置:对应元素相乘后求和):
位置(0,0):
[1,0,1] [1,0,1] 1×1 + 0×0 + 1×1
[0,1,0] × [0,1,0] = 0×0 + 1×1 + 0×0 = 1+0+1 + 0+1+0 + 1+0+1 = 5
[1,0,1] [1,0,1] 1×1 + 0×0 + 1×1
位置(0,1):
[0,1,0] [1,0,1]
[1,0,1] × [0,1,0] = 0×1+1×0+0×1 + 1×0+0×1+1×0 + 1×1+0×0+1×1 = 0+0+0+0+0+0+1+0+1 = 2
[1,0,0] [1,0,1]
位置(0,2):
[1,0,1] [1,0,1]
[0,1,0] × [0,1,0] = 1×1+0×0+1×1 + 0×0+1×1+0×0 + 0×1+1×0+1×1 = 1+0+1+0+1+0+0+0+1 = 4
[0,1,1] [1,0,1]
位置(1,0):
[0,1,0] [1,0,1]
[1,1,0] × [0,1,0] = 0×1+1×0+0×1 + 1×0+1×1+0×0 + 1×1+0×0+0×1 = 0+0+0+0+1+0+1+0+0 = 2
[1,0,0] [1,0,1]
位置(1,1):
[1,0,1] [1,0,1]
[1,0,0] × [0,1,0] = 1×1+0×0+1×1 + 1×0+0×1+0×0 + 0×1+1×0+1×1 = 1+0+1+0+0+0+0+0+1 = 3
[0,1,1] [1,0,1]
位置(1,2):
[0,1,0] [1,0,1]
[0,0,1] × [0,1,0] = 0×1+1×0+0×1 + 0×0+0×1+1×0 + 1×1+1×0+1×1 = 0+0+0+0+0+0+1+0+1 = 2
[1,1,0] [1,0,1]
位置(2,0):
[1,1,0] [1,0,1]
[0,0,1] × [0,1,0] = 1×1+1×0+0×1 + 0×0+0×1+1×0 + 0×1+1×0+1×1 = 1+0+0+0+0+0+0+0+1 = 2
[1,0,1] [1,0,1]
位置(2,1):
[1,0,0] [1,0,1]
[0,1,1] × [0,1,0] = 1×1+0×0+0×1 + 0×0+1×1+1×0 + 0×1+0×0+1×1 = 1+0+0+0+1+0+0+0+1 = 3
[0,1,1] [1,0,1]
位置(2,2):
[0,0,1] [1,0,1]
[1,1,0] × [0,1,0] = 0×1+0×0+1×1 + 1×0+1×1+0×0 + 0×1+1×0+1×1 = 0+0+1+0+1+0+0+0+1 = 3
[1,0,1] [1,0,1]
输出特征图:
[[5, 2, 4],
[2, 3, 2],
[2, 3, 3]]
题3:池化计算
输入为 4×4 的特征图:
[[2, 4, 6, 8],
[1, 3, 5, 7],
[8, 6, 4, 2],
[7, 5, 3, 1]]
池化窗口为 2×2,步长为 2,请分别计算:
- 最大池化(Max Pooling)的结果
- 平均池化(Average Pooling)的结果
答案:
- 最大池化:
- 窗口[左上2×2]: max(2,4,1,3) = 4
- 窗口[右上2×2]: max(6,8,5,7) = 8
- 窗口[左下2×2]: max(8,6,7,5) = 8
- 窗口[右下2×2]: max(4,2,3,1) = 4
输出:
[[4, 8],
[8, 4]]
- 平均池化:
- 窗口[左上2×2]: (2+4+1+3)/4 = 2.5
- 窗口[右上2×2]: (6+8+5+7)/4 = 6.5
- 窗口[左下2×2]: (8+6+7+5)/4 = 6.5
- 窗口[右下2×2]: (4+2+3+1)/4 = 2.5
输出:
[[2.5, 6.5],
[6.5, 2.5]]
二、简答题
题1:什么是内容安全?请从文本、图像、视频、音频角度说明其涉及的内容。
答案:
内容安全(Content Security)是信息安全的一个分支,其目的是识别、阻断不良信息传播,例如滥发电子讯息(Spamming)、色情内容、犯罪内容、恐怖主义内容、政治敏感内容等。
- 文本角度: 涉及敏感词检测、垃圾信息过滤、涉政涉恐文本识别等,使用自然语言处理技术
- 图像内容安全: 涉黄图像检测、暴力图像识别、政治敏感图像过滤、版权图像保护等
- 视频内容安全: 视频中的特定人物、目标、场景提取与分析,深度伪造视频检测等
- 音频内容安全: 语音内容中的敏感信息检测、语音真实性鉴定、语者识别等
题2:超高清内容安全审核系统包括哪些核心技术?请分别介绍。
答案:
超高清视频内容安全审核系统以人工智能为基础,综合运用以下核心技术:
-
视图像分类技术: 基于卷积神经网络CNN,对待分析识别视频进行关键帧抽取、短视频分割后,进行特征提取并形成特征向量,通过长短记忆网络LSTM对序列进行识别分析。
-
目标检测识别技术: 对视频进行关键帧抽取,通过Selective Search从上到下提取约2000个类无关的区域,归一化处理后,采用CNN模型提取特征,通过SVM线性分类器进行分类,最后通过Bounding Box进行回归处理。
-
人脸识别技术: 综合应用参考模板法、人脸规则法和特征子脸法进行人脸检测,进行灰度校正、噪声过滤及归一化等预处理,提取人脸特征建模,与数据库特征比对,根据相似度阈值完成身份判读。
-
超大规模向量检索技术: 使用ANN(近似最近邻搜索),在可接受精度条件下对向量分簇建立索引,提高搜索效率。融合分布式应用、并行计算和特征向量提取,适应大规模向量检索场景。
题3:深度伪造(Deepfake)的定义、危害和技术原理是什么?
答案:
定义: Deepfake(深度伪造)是利用深度学习等AI技术伪造或合成的图片、音频、视频,进行敲诈勒索、假冒身份、散布虚假信息等行为。
危害:
- 敲诈勒索(伪造不雅视频等)
- 假冒身份进行诈骗
- 散布虚假信息、制造谣言
- 对社会稳定造成不良影响
- 破坏媒体可信度
技术原理: 内容自动编码与错位解码(Autoencoder + 错位解码)
- 使用自动编码器提取人脸特征,然后将特征错位解码到目标人脸
- 常见方法包括GAN(生成对抗网络,生成器与识别器相互博弈)
- 视频换脸工具(Deepfake、ZAO)
- 语音深度合成(WaveNet等)
- 扩散模型(如Sora)
题4:请比较独热编码(One-hot Encoding)和词嵌入(Word Embedding)的优缺点。
答案:
独热编码(One-hot Encoding):
- 优点:简单直观,易于实现
- 缺点:
- 维度高(词表大小="10000维"),导致维度灾难
- 无法刻画词语的语法和语义信息
- 向量稀疏,计算效率低
- 任意两个词的内积为0,无法体现语义相似性
词嵌入(Word Embedding):
- 优点:
- 低维连续实数向量表示(通常100-500维)
- 语义相近的词在向量空间中距离近
- 稠密向量,计算效率高
- 可以从数据中学习语义关系
- 支持词类比运算(如king - man + woman ≈ queen)
- 缺点:需要大量训练数据、训练过程复杂
题5:ChatGPT的学习过程分为哪四个阶段?
答案:
ChatGPT的学习四阶段:
- 预训练: 在大规模语料上进行无监督预训练,得到基础GPT模型,学习语言的基本知识
- 监督微调: 以监督学习方式对预训练模型进行微调,引导文字接龙方向,使其符合人类对话风格
- 训练奖励模型: 基于人类老师反馈(RLHF)训练奖励模型,训练它模拟人类老师的喜好,对模型输出进行评分
- 强化学习: 利用训练好的奖励模型进行强化学习,让模型向"模拟老师"学习,不断优化生成策略
题6:音频内容安全的四种类型分别是什么?请简述。
答案:
- 音频到文本(ASR,语音识别): 自动语音识别,将语音转换为文本,分析语音内容中的敏感、涉政、涉恐、涉暴等内容
- 文本到音频(TTS,语音合成): 文本到语音合成,生成虚假语音,对网络空间语音内容的真实性造成威胁
- 音频到音频: 包括语音分离(Speech Separation,将噪声分离或将多人说话分离)和语音转换(Voice Conversion,将A的声音转换为B的声音),对语音内容真实性造成威胁
- 音频到分类: 包括语者识别(Speaker Recognition,识别谁在说话)和语者验证(Speaker Verification,验证两段语音是否同一人所说)
题7:请区分端到端和非端到端的语音识别方法。
答案:
非端到端方法:
- 代表模型:GMM-HMM、DNN-HMM
- 特点:分多个模块(声学模型、语言模型、发音词典等),每个模块独立训练
- 缺点:模型复杂,通常需要上GB的参数;各模块误差累积
端到端方法:
- 代表模型:LAS、CTC、RNA、RNN-T
- 特点:一个统一的深度学习模型直接从语音特征映射到文本
- 优点:模型较小(甚至只需几十MB参数),效果好,简化了训练流程
- 代表方法举例:
- LAS:需听完整段音频再输出
- CTC/RNA/RNN-T:可以实时预测输出
题8:内容安全的四个层次是什么?请由易到难说明。
答案:
由易到难(从成熟到不成熟):
-
第一层(最成熟)— 传统涉黄涉政涉爆等不良内容识别:
- 已相对成熟,已有产品服务
-
第二层 — 个性化推荐算法滥用:
- 针对信息茧房、大数据杀熟、劳动者压榨、虚假谣言传播、用户沉迷等
- 已有测试阶段产品与相关管理规定
-
第三层 — 多媒体伪造与鉴伪:
- 深度伪造检测,识别伪造/合成的图片、音频、视频
- 目前仍较依赖人工识别,属于实验室技术
-
第四层(最难)— 不良价值观识别:
- 炫富、炫官、假丑恶等不良价值观内容识别
- 几乎尚未开始研究,依赖人工识别
题9:什么是实例分割?它与语义分割有何不同?
答案:
实例分割(Instance Segmentation):
将不同类型的实例进行分类,在同一类中区分不同个体。比如用5种不同颜色标记5辆汽车,即不仅需要将不同对象分类,还要确定每个对象的边界、差异和彼此之间的关系。
与语义分割的区别:
- 语义分割(Semantic Segmentation): 对图像中的每个像素进行标注,标注属于哪一类别(如所有汽车标注为同一类),不区分不同个体
- 实例分割: 在语义分割的基础上,进一步区分同类中的不同实例(如汽车A、汽车B、汽车C)
应用: 无人车驾驶技术中的街景分割、医疗影像分析等。
题10:训练集损失偏大可能由哪些原因导致?解决方案分别是什么?
答案:
两种可能原因:
-
模型偏差(Model Bias):
- 原因:模型过于简单,不够灵活,"海里没有针"——模型的假设空间太小,不包含最优解
- 解决方案:重新设计更复杂的模型
- 增加更多特征(More features)
- 使用深度学习(增加神经元数量和层数)
-
优化问题(Optimization Issue):
- 原因:"海里有针但找不到"——梯度下降陷入局部最优,无法找到全局最优
- 区分方法:从较浅模型开始训练,如果更深网络无法在训练集上获得更小损失,可能是优化问题
- 解决方案:使用更强的优化算法(如Adam、更合适的初始化和学习率策略)
三、选择题
题1:以下哪个是国产深度学习框架?
A. TensorFlow B. PyTorch C. PaddlePaddle(飞桨) D. Keras
答案:C(PaddlePaddle是百度推出的国产深度学习框架)
题2:以下哪家公司在国内自主研发了AI芯片?
A. 腾讯 B. 阿里巴巴 C. 寒武纪 D. 美团
答案:C(寒武纪是国产AI芯片公司,华为也有昇腾Ascend芯片)
题3:若总训练样本数为10000,Batch Size为500,则一个Epoch需要多少次Iteration?
A. 10 B. 20 C. 50 D. 100
答案:B(Iteration = 10000/500 = 20)
题4:以下哪个属于分类问题?
A. 预测明天的气温 B. 判断邮件是否为垃圾邮件
C. 预测股票价格 D. 预测房价
答案:B(垃圾邮件判断是二分类问题,其余为回归问题)
题5:以下哪个是CNN的经典网络结构?
A. BERT B. GPT C. ResNet D. Transformer
答案:C(ResNet是CNN经典网络;BERT、GPT、Transformer基于注意力机制,不是纯CNN)
题6:Self-Attention中,Q、K、V分别代表什么?
A. Query, Key, Value B. Quick, Kernel, Vector
C. Quality, Knowledge, Variable D. Question, Answer, Verify
答案:A
题7:以下哪种池化方式取窗口内的最大值?
A. Average Pooling B. Max Pooling C. Min Pooling D. Sum Pooling
答案:B
题8:词嵌入(Word Embedding)相对于独热编码的优点是?
A. 维度更高 B. 计算更简单 C. 能表示词语的语义相似性 D. 不需要训练
答案:C
题9:BERT是基于Transformer的哪个部分构建的?
A. 编码器(Encoder) B. 解码器(Decoder) C. 编码器和解码器 D. 都不是
答案:A(BERT使用Transformer的编码器部分)
题10:以下哪个语音识别模型需要听完一整段音频才能输出文本?
A. CTC B. RNA C. LAS D. RNN-T
答案:C(LAS是典型的seq2seq模型,需要编码完整序列后才能解码)
题11:Epoch的含义是?
A. 一次参数更新 B. 所有训练数据完成一次前向传播和反向传播
C. 一次迭代的样本数 D. 学习率调整的周期
答案:B
题12:以下哪个不属于内容安全的四个层次之一?
A. 传统涉黄涉政涉爆内容识别 B. 个性化推荐算法滥用
C. 网络安全攻防 D. 不良价值观识别
答案:C
题13:在卷积神经网络中,参数共享意味着什么?
A. 所有层使用相同的参数 B. 不同感受野中的神经元有相同的参数
C. 训练和测试使用相同的参数 D. 所有filter有相同的权重
答案:B
题14:Sora是哪家公司发布的视频生成模型?
A. Google B. Meta C. OpenAI D. DeepMind
答案:C
题15:以下哪个音频任务是"音频到音频"类型的任务?
A. 语音识别(ASR) B. 文本到语音合成(TTS)
C. 语音转换(Voice Conversion) D. 语者识别
答案:C(语音转换属于音频到音频任务)
附录:关键公式速记
Self-Attention
- Attention(Q, K, V) = softmax(Q × K^T / √d_k) × V
- Q: Query, K: Key, V: Value
- d_k: Key的维度
卷积输出尺寸
- 输出尺寸 = (输入尺寸 - 卷积核大小 + 2×Padding) / 步长 + 1
- 注意:如果结果不是整数,取决于是否向上/向下取整
池化
- Max Pooling: 取窗口最大值
- Average Pooling: 取窗口平均值
Epoch/Iteration关系
- Iteration(每epoch)= 总样本数 / Batch Size
- 总Iteration = Epoch数 × Iteration数(每epoch)

浙公网安备 33010602011771号