内容安全课程 — 考试重点整理与习题

内容安全课程 — 考试重点整理与习题


第一部分:考试重点整理

一、计算题重点(3道)

1. Self-Attention 计算

核心公式:

  • Attention(Q, K, V) = softmax(Q × K^T / √d_k) × V
  • Q = Query 查询矩阵
  • K = Key 键矩阵
  • V = Value 值矩阵
  • d_k = K的维度(缩放因子,防止softmax梯度过小)

矩阵运算要点:

  • Q × K^T 得到注意力分数矩阵(Attention Score Matrix)
  • 转置计算:注意 K^T 是 K 的转置矩阵
  • 矩阵不一定对称(考转置,不考 A→A' 的对称性)
  • 经过 softmax 后得到注意力权重
  • 最后乘以 V 得到输出

步骤:

  1. 输入序列 → 生成 Q, K, V(通过乘以权重矩阵)
  2. 计算 Q × K^T
  3. 除以 √d_k(缩放)
  4. Softmax 归一化
  5. 乘以 V 得到输出

2. DNN 卷积运算

要点:

  • 看清步长(stride)
  • 一个 filter(滤波器)
  • 卷积核(kernel)大小
  • Padding(填充)方式

卷积输出尺寸公式:

  • 输出尺寸 = ⌊(输入尺寸 - 卷积核大小 + 2 × Padding) / 步长⌋ + 1

例: 输入 6×6,卷积核 3×3,步长=1,padding=0

  • 输出 = (6-3+0)/1 + 1 = 4
  • 输出 4×4 特征图

3. 池化(Pooling)

最大池化(Max Pooling): 取窗口内的最大值

  • 例:2×2 窗口,步长=2 → 取每个2×2区域的最大值

平均池化(Average Pooling): 取窗口内的平均值

  • 例:2×2 窗口,步长=2 → 取每个2×2区域的平均值

作用: 降采样、减少参数、防止过拟合、增强平移不变性


二、简答题重点

(一)内容安全简介

1. 什么是内容安全?包括什么产品?

  • 定义: 内容安全(Content Security)是信息安全的一个分支,其目的是识别、阻断不良信息传播,例如滥发电子讯息(Spamming)、色情内容、犯罪内容、恐怖主义内容、政治敏感内容等。涉及技术包括自然语言处理、计算机视觉等,涉及内容包括文字、图片、音频、视频等。
  • 产品厂商: 阿里、腾讯、百度、网易等
    • 阿里:多媒体内容智能识别服务,支持图片、视频、文本、语音等检测
    • 腾讯:基于深度学习识别技术,高效识别文字、图片、视频等多媒体的违规内容

2. 超高清内容安全审核包括什么技术?

以人工智能为基础,综合运用:

  • 视图像分类技术: 基于CNN对待分析视频进行关键帧抽取、短视频分割后,进行特征提取并形成特征向量,通过LSTM对序列进行识别分析
  • 目标检测识别技术: 通过Selective Search提取区域,CNN提取特征,SVM分类,Bounding Box回归
  • 人脸识别技术: 参考模板法、人脸规则法、特征子脸法进行人脸检测,预处理后提取人脸特征,与数据库比对
  • 超大规模向量检索技术: ANN(近似最近邻搜索),融合分布式应用、并行计算和特征向量提取

系统功能:

  1. 支持特定人物、特定目标、特定场景提取与分析识别
  2. 支持内容安全的多维审核
  3. 支持多角度审核(特定人脸、旗帜、徽标、场景)

3. 内容安全的四个层次(从难到易):

层次 内容 现状
第四层(最难) 不良价值观识别(炫富、炫官、假丑恶) 依赖人工识别,几乎尚未开始研究
第三层 多媒体伪造与鉴伪 依赖人工识别,属于实验室技术
第二层 个性化推荐算法滥用(信息茧房、大数据杀熟、虚假谣言、用户沉迷等) 已有测试阶段产品与相关管理规定
第一层(最成熟) 传统涉黄涉政涉爆等不良内容识别 已相对成熟,已有产品服务

(二)视觉内容安全概述

1. 实例分割(Instance Segmentation)

  • 将不同类型的实例进行分类,例如用5种不同颜色标记5辆汽车
  • 不仅需要将不同对象分类,还要确定对象的边界、差异和彼此之间的关系
  • 与语义分割的区别:语义分割是对每个像素标注类别,实例分割还要区分同类不同个体

2. 深度伪造(Deepfake)

  • 定义: 利用深度学习等AI技术伪造或合成的图片、音频、视频
  • 危害: 敲诈勒索、假冒身份、散布虚假信息、对社会稳定造成不良影响
  • 技术原理: 内容自动编码与错位解码(Autoencoder + 错位解码)
  • 常见方法:
    • GAN(生成对抗网络):生成器+识别器相互博弈
    • 视频换脸工具:Deepfake、ZAO等
    • 语音深度合成:WaveNet、科大讯飞语音合成
    • Sora(扩散模型):一次生成整个视频,使用Transformer架构

(三)文本相关内容

1. 独热编码(One-hot Encoding)

  • 每个词对应一个高维向量,其中一维为1,其余为0
  • 缺点:无法刻画词语的语法和语义信息;维度灾难;稀疏性

2. 词嵌入(Word Embedding)

  • 利用低维连续的实数向量表示一个词
  • 语义相近的词在向量空间中也邻近
  • Word2vec(CBOW、Skip-gram模型)

3. 独热编码 vs 词嵌入:

对比项 独热编码 词嵌入
维度 高维(词表大小) 低维(自定义)
语义表示 无法表示语义相似性 可表示语义相近
稀疏性 稀疏 稠密
学习能力 固定,无法学习 可从数据中学习

4. 位置编码(Positional Encoding)

  • 因为Self-attention本身不具备位置信息(并行计算,不考虑顺序),需要加入位置编码
  • 将位置信息加入输入向量,让模型知道词的位置顺序

5. BERT 与 GPT

对比项 BERT GPT
架构 Transformer编码器(Encoder) Transformer解码器(Decoder)
训练方式 Masking Input(完形填空)+ Next Sentence Prediction Predict Next Token(文字接龙)
双向/单向 双向上下文 单向(从左到右)

6. ChatGPT

  • ChatGPT的学习四阶段:
    1. 预训练 — 得到GPT
    2. 监督微调 — 引导文字接龙方向
    3. 训练奖励模型 — 基于人类反馈(RLHF),模拟人类喜好
    4. 强化学习 — 利用奖励模型进行强化学习

(四)Python及神经网络基础

训练集损失分析:

训练集损失 问题 解决方案
偏大 模型偏差(Model Bias):模型过于简单,无法拟合数据 重新设计更复杂的模型(更多特征、更深网络)
偏大 优化问题(Optimization Issue):梯度下降找不到最优解 使用更强的优化算法
偏小 过拟合(Overfitting):训练集好、测试集差 更多训练数据、数据增广、简化模型、正则化、Dropout
偏小 失配(Mismatch):训练集和测试集分布不同 调整数据分布

如何区分 Model Bias 和 Optimization Issue?

  • 从较浅的模型开始训练,如果更深的网络无法获得更小的损失,可能是优化问题

关键概念:

  • 训练集(Training Set):调整神经网络参数
  • 验证集(Validation Set):查看训练效果,调整超参数
  • 测试集(Test Set):评估最终模型的泛化能力

优化算法:

  • SGD(随机梯度下降):Batch = 小批量
  • Momentum:考虑前一步移动方向,加速收敛
  • RMSProp:自适应学习率
  • Adam = RMSProp + Momentum(最常用)
  • Epoch:跑完所有batch一次
  • Batch Size:一次训练的样本数
  • Iteration:一个batch训练一次

(五)音频内容安全

1. 音频内容安全的四种类型:

类型 技术 说明
音频→文本 ASR(自动语音识别) 分析语音内容的敏感信息
文本→音频 TTS(文本到语音合成) 生成虚假语音
音频→音频 语音分离(Speech Separation)、语音转换(Voice Conversion) 分离噪声/分离语者、转换声音
音频→分类 语者识别(Speaker Recognition)、语者验证(Speaker Verification) 确认语音真实性和身份

2. 端到端 vs 非端到端:

对比项 非端到端 端到端
代表方法 GMM-HMM, DNN-HMM LAS, CTC, RNA, RNN-T
模型大小 大(上GB参数) 小(几十MB参数)
结构复杂性 复杂,分多个模块 简单,一个模型直接输出

语音识别模型对比:

  • LAS(Listen, Attend, Spell): 典型seq2seq模型,含编码器+解码器+注意力机制,需听完一整段音频才能输出
  • CTC: 编码器是线性分类器,可实时预测文本
  • RNA(Recurrent Neural Aligner): 输入一个特征输出一个token,可实时预测
  • RNN-T: 输入一个特征可输出多个token,可实时预测
  • Neural Transducer: 每次输入一个窗口的多特征向量
  • MoChA: 自适应判定窗口位置

(六)选择题考点

1. 深度学习框架:

  • 国外:TensorFlow, PyTorch, Keras
  • 国内(国产): PaddlePaddle(百度飞桨)、MindSpore(华为)、MegEngine(旷视)、OneFlow(一流科技)
  • match:框架匹配题

2. 显卡/AI芯片:

  • 国外:NVIDIA(英伟达)
  • 国内: 华为(昇腾Ascend)、寒武纪(Cambricon)、百度(昆仑)、地平线
  • Match:芯片厂商对应

3. 卷积计算(百度考点?):

  • 向上取整/向下取整:当(输入尺寸 - 核大小) / 步长 不是整数时
  • 输出尺寸计算

4. Batch Size, Epoch, Iteration 关系:

  • Epoch: 所有训练数据完成一次前向传播和反向传播
  • Batch Size: 每次迭代训练使用的样本数
  • Iteration: 完成一个batch的训练 = 一次参数更新
  • 关系:Iteration = 总样本数 / Batch Size(1个epoch的迭代次数)

5. 分类问题 vs 回归问题:

  • 分类(Classification): 输出离散类别标签(如猫/狗、正/负)
  • 回归(Regression): 输出连续数值(如预测价格、温度)

6. CNN vs Transformer:

  • CNN: 局部连接、参数共享、平移不变性、感受野有限
  • Transformer: 全局注意力、捕获长距离依赖、并行计算

7. 常见网络:

  • CNN经典网络: LeNet, AlexNet, VGG, ResNet, Inception, DenseNet, MobileNet
  • Transformer: BERT, GPT系列, ViT(Vision Transformer)

第二部分:练习题(含答案)

一、计算题

题1:Self-Attention 矩阵计算

假设输入序列有3个词,每个词的维度是4。经过线性变换后得到 Q, K, V 矩阵如下:

Q = [[1, 0, 1, 0],    K = [[0, 1, 0, 1],    V = [[1, 0, 0],
     [0, 1, 0, 1],         [1, 0, 1, 0],         [0, 1, 0],
     [1, 1, 0, 0]]         [0, 0, 1, 1]]         [0, 0, 1]]

d_k = 4,请计算:

  1. 注意力分数矩阵 S = Q × K^T
  2. 计算缩放后的分数矩阵 S / √d_k
  3. (概念题)简要说明 softmax 后如何得到最终输出

答案:

  1. Q × K^T(3×4 × 4×3 = 3×3矩阵):

K^T =

[0, 1, 0]
[1, 0, 0]
[0, 1, 1]
[1, 0, 1]

S = Q × K^T:

第一行 [1,0,1,0] × K^T:

  • [1×0+0×1+1×0+0×1, 1×1+0×0+1×1+0×0, 1×0+0×0+1×1+0×1] = [0, 2, 1]

第二行 [0,1,0,1] × K^T:

  • [0×0+1×1+0×0+1×1, 0×1+1×0+0×1+1×0, 0×0+1×0+0×1+1×1] = [2, 0, 1]

第三行 [1,1,0,0] × K^T:

  • [1×0+1×1+0×0+0×1, 1×1+1×0+0×1+0×0, 1×0+1×0+0×1+0×1] = [1, 1, 0]
S = [[0, 2, 1],
     [2, 0, 1],
     [1, 1, 0]]
  1. 缩放:√d_k = √4 = 2

S_scaled = S / 2:

S_scaled = [[0,   1,   0.5],
            [1,   0,   0.5],
            [0.5, 0.5, 0]]
  1. 对 S_scaled 的每一行做 softmax 得到注意力权重矩阵 A,然后 A × V 得到最终输出。Softmax 将每行的值转换为概率分布(和为1)。

题2:卷积运算

输入图像为 5×5 的矩阵:

输入图像:
[[1, 0, 1, 0, 1],
 [0, 1, 0, 1, 0],
 [1, 1, 0, 0, 1],
 [0, 0, 1, 1, 0],
 [1, 0, 0, 1, 1]]

卷积核(Filter)为 3×3:

Filter = [[1, 0, 1],
          [0, 1, 0],
          [1, 0, 1]]

步长 stride = 1,padding = 0,请计算卷积后的输出特征图。

答案:

输出尺寸 = (5-3+0)/1 + 1 = 3,输出为 3×3 矩阵。

计算过程(每个位置:对应元素相乘后求和):

位置(0,0):

[1,0,1]    [1,0,1]    1×1 + 0×0 + 1×1
[0,1,0] ×  [0,1,0]  = 0×0 + 1×1 + 0×0  = 1+0+1 + 0+1+0 + 1+0+1 = 5
[1,0,1]    [1,0,1]    1×1 + 0×0 + 1×1

位置(0,1):

[0,1,0]    [1,0,1]
[1,0,1] ×  [0,1,0]  = 0×1+1×0+0×1 + 1×0+0×1+1×0 + 1×1+0×0+1×1 = 0+0+0+0+0+0+1+0+1 = 2
[1,0,0]    [1,0,1]

位置(0,2):

[1,0,1]    [1,0,1]
[0,1,0] ×  [0,1,0]  = 1×1+0×0+1×1 + 0×0+1×1+0×0 + 0×1+1×0+1×1 = 1+0+1+0+1+0+0+0+1 = 4
[0,1,1]    [1,0,1]

位置(1,0):

[0,1,0]    [1,0,1]
[1,1,0] ×  [0,1,0]  = 0×1+1×0+0×1 + 1×0+1×1+0×0 + 1×1+0×0+0×1 = 0+0+0+0+1+0+1+0+0 = 2
[1,0,0]    [1,0,1]

位置(1,1):

[1,0,1]    [1,0,1]
[1,0,0] ×  [0,1,0]  = 1×1+0×0+1×1 + 1×0+0×1+0×0 + 0×1+1×0+1×1 = 1+0+1+0+0+0+0+0+1 = 3
[0,1,1]    [1,0,1]

位置(1,2):

[0,1,0]    [1,0,1]
[0,0,1] ×  [0,1,0]  = 0×1+1×0+0×1 + 0×0+0×1+1×0 + 1×1+1×0+1×1 = 0+0+0+0+0+0+1+0+1 = 2
[1,1,0]    [1,0,1]

位置(2,0):

[1,1,0]    [1,0,1]
[0,0,1] ×  [0,1,0]  = 1×1+1×0+0×1 + 0×0+0×1+1×0 + 0×1+1×0+1×1 = 1+0+0+0+0+0+0+0+1 = 2
[1,0,1]    [1,0,1]

位置(2,1):

[1,0,0]    [1,0,1]
[0,1,1] ×  [0,1,0]  = 1×1+0×0+0×1 + 0×0+1×1+1×0 + 0×1+0×0+1×1 = 1+0+0+0+1+0+0+0+1 = 3
[0,1,1]    [1,0,1]

位置(2,2):

[0,0,1]    [1,0,1]
[1,1,0] ×  [0,1,0]  = 0×1+0×0+1×1 + 1×0+1×1+0×0 + 0×1+1×0+1×1 = 0+0+1+0+1+0+0+0+1 = 3
[1,0,1]    [1,0,1]

输出特征图:

[[5, 2, 4],
 [2, 3, 2],
 [2, 3, 3]]

题3:池化计算

输入为 4×4 的特征图:

[[2, 4, 6, 8],
 [1, 3, 5, 7],
 [8, 6, 4, 2],
 [7, 5, 3, 1]]

池化窗口为 2×2,步长为 2,请分别计算:

  1. 最大池化(Max Pooling)的结果
  2. 平均池化(Average Pooling)的结果

答案:

  1. 最大池化:
  • 窗口[左上2×2]: max(2,4,1,3) = 4
  • 窗口[右上2×2]: max(6,8,5,7) = 8
  • 窗口[左下2×2]: max(8,6,7,5) = 8
  • 窗口[右下2×2]: max(4,2,3,1) = 4

输出:

[[4, 8],
 [8, 4]]
  1. 平均池化:
  • 窗口[左上2×2]: (2+4+1+3)/4 = 2.5
  • 窗口[右上2×2]: (6+8+5+7)/4 = 6.5
  • 窗口[左下2×2]: (8+6+7+5)/4 = 6.5
  • 窗口[右下2×2]: (4+2+3+1)/4 = 2.5

输出:

[[2.5, 6.5],
 [6.5, 2.5]]

二、简答题

题1:什么是内容安全?请从文本、图像、视频、音频角度说明其涉及的内容。

答案:
内容安全(Content Security)是信息安全的一个分支,其目的是识别、阻断不良信息传播,例如滥发电子讯息(Spamming)、色情内容、犯罪内容、恐怖主义内容、政治敏感内容等。

  • 文本角度: 涉及敏感词检测、垃圾信息过滤、涉政涉恐文本识别等,使用自然语言处理技术
  • 图像内容安全: 涉黄图像检测、暴力图像识别、政治敏感图像过滤、版权图像保护等
  • 视频内容安全: 视频中的特定人物、目标、场景提取与分析,深度伪造视频检测等
  • 音频内容安全: 语音内容中的敏感信息检测、语音真实性鉴定、语者识别等

题2:超高清内容安全审核系统包括哪些核心技术?请分别介绍。

答案:
超高清视频内容安全审核系统以人工智能为基础,综合运用以下核心技术:

  1. 视图像分类技术: 基于卷积神经网络CNN,对待分析识别视频进行关键帧抽取、短视频分割后,进行特征提取并形成特征向量,通过长短记忆网络LSTM对序列进行识别分析。

  2. 目标检测识别技术: 对视频进行关键帧抽取,通过Selective Search从上到下提取约2000个类无关的区域,归一化处理后,采用CNN模型提取特征,通过SVM线性分类器进行分类,最后通过Bounding Box进行回归处理。

  3. 人脸识别技术: 综合应用参考模板法、人脸规则法和特征子脸法进行人脸检测,进行灰度校正、噪声过滤及归一化等预处理,提取人脸特征建模,与数据库特征比对,根据相似度阈值完成身份判读。

  4. 超大规模向量检索技术: 使用ANN(近似最近邻搜索),在可接受精度条件下对向量分簇建立索引,提高搜索效率。融合分布式应用、并行计算和特征向量提取,适应大规模向量检索场景。


题3:深度伪造(Deepfake)的定义、危害和技术原理是什么?

答案:
定义: Deepfake(深度伪造)是利用深度学习等AI技术伪造或合成的图片、音频、视频,进行敲诈勒索、假冒身份、散布虚假信息等行为。

危害:

  1. 敲诈勒索(伪造不雅视频等)
  2. 假冒身份进行诈骗
  3. 散布虚假信息、制造谣言
  4. 对社会稳定造成不良影响
  5. 破坏媒体可信度

技术原理: 内容自动编码与错位解码(Autoencoder + 错位解码)

  • 使用自动编码器提取人脸特征,然后将特征错位解码到目标人脸
  • 常见方法包括GAN(生成对抗网络,生成器与识别器相互博弈)
  • 视频换脸工具(Deepfake、ZAO)
  • 语音深度合成(WaveNet等)
  • 扩散模型(如Sora)

题4:请比较独热编码(One-hot Encoding)和词嵌入(Word Embedding)的优缺点。

答案:

独热编码(One-hot Encoding):

  • 优点:简单直观,易于实现
  • 缺点:
    • 维度高(词表大小="10000维"),导致维度灾难
    • 无法刻画词语的语法和语义信息
    • 向量稀疏,计算效率低
    • 任意两个词的内积为0,无法体现语义相似性

词嵌入(Word Embedding):

  • 优点:
    • 低维连续实数向量表示(通常100-500维)
    • 语义相近的词在向量空间中距离近
    • 稠密向量,计算效率高
    • 可以从数据中学习语义关系
    • 支持词类比运算(如king - man + woman ≈ queen)
  • 缺点:需要大量训练数据、训练过程复杂

题5:ChatGPT的学习过程分为哪四个阶段?

答案:
ChatGPT的学习四阶段:

  1. 预训练: 在大规模语料上进行无监督预训练,得到基础GPT模型,学习语言的基本知识
  2. 监督微调: 以监督学习方式对预训练模型进行微调,引导文字接龙方向,使其符合人类对话风格
  3. 训练奖励模型: 基于人类老师反馈(RLHF)训练奖励模型,训练它模拟人类老师的喜好,对模型输出进行评分
  4. 强化学习: 利用训练好的奖励模型进行强化学习,让模型向"模拟老师"学习,不断优化生成策略

题6:音频内容安全的四种类型分别是什么?请简述。

答案:

  1. 音频到文本(ASR,语音识别): 自动语音识别,将语音转换为文本,分析语音内容中的敏感、涉政、涉恐、涉暴等内容
  2. 文本到音频(TTS,语音合成): 文本到语音合成,生成虚假语音,对网络空间语音内容的真实性造成威胁
  3. 音频到音频: 包括语音分离(Speech Separation,将噪声分离或将多人说话分离)和语音转换(Voice Conversion,将A的声音转换为B的声音),对语音内容真实性造成威胁
  4. 音频到分类: 包括语者识别(Speaker Recognition,识别谁在说话)和语者验证(Speaker Verification,验证两段语音是否同一人所说)

题7:请区分端到端和非端到端的语音识别方法。

答案:
非端到端方法:

  • 代表模型:GMM-HMM、DNN-HMM
  • 特点:分多个模块(声学模型、语言模型、发音词典等),每个模块独立训练
  • 缺点:模型复杂,通常需要上GB的参数;各模块误差累积

端到端方法:

  • 代表模型:LAS、CTC、RNA、RNN-T
  • 特点:一个统一的深度学习模型直接从语音特征映射到文本
  • 优点:模型较小(甚至只需几十MB参数),效果好,简化了训练流程
  • 代表方法举例:
    • LAS:需听完整段音频再输出
    • CTC/RNA/RNN-T:可以实时预测输出

题8:内容安全的四个层次是什么?请由易到难说明。

答案:
由易到难(从成熟到不成熟):

  1. 第一层(最成熟)— 传统涉黄涉政涉爆等不良内容识别:

    • 已相对成熟,已有产品服务
  2. 第二层 — 个性化推荐算法滥用:

    • 针对信息茧房、大数据杀熟、劳动者压榨、虚假谣言传播、用户沉迷等
    • 已有测试阶段产品与相关管理规定
  3. 第三层 — 多媒体伪造与鉴伪:

    • 深度伪造检测,识别伪造/合成的图片、音频、视频
    • 目前仍较依赖人工识别,属于实验室技术
  4. 第四层(最难)— 不良价值观识别:

    • 炫富、炫官、假丑恶等不良价值观内容识别
    • 几乎尚未开始研究,依赖人工识别

题9:什么是实例分割?它与语义分割有何不同?

答案:
实例分割(Instance Segmentation):
将不同类型的实例进行分类,在同一类中区分不同个体。比如用5种不同颜色标记5辆汽车,即不仅需要将不同对象分类,还要确定每个对象的边界、差异和彼此之间的关系。

与语义分割的区别:

  • 语义分割(Semantic Segmentation): 对图像中的每个像素进行标注,标注属于哪一类别(如所有汽车标注为同一类),不区分不同个体
  • 实例分割: 在语义分割的基础上,进一步区分同类中的不同实例(如汽车A、汽车B、汽车C)

应用: 无人车驾驶技术中的街景分割、医疗影像分析等。


题10:训练集损失偏大可能由哪些原因导致?解决方案分别是什么?

答案:
两种可能原因:

  1. 模型偏差(Model Bias):

    • 原因:模型过于简单,不够灵活,"海里没有针"——模型的假设空间太小,不包含最优解
    • 解决方案:重新设计更复杂的模型
      • 增加更多特征(More features)
      • 使用深度学习(增加神经元数量和层数)
  2. 优化问题(Optimization Issue):

    • 原因:"海里有针但找不到"——梯度下降陷入局部最优,无法找到全局最优
    • 区分方法:从较浅模型开始训练,如果更深网络无法在训练集上获得更小损失,可能是优化问题
    • 解决方案:使用更强的优化算法(如Adam、更合适的初始化和学习率策略)

三、选择题

题1:以下哪个是国产深度学习框架?

A. TensorFlow B. PyTorch C. PaddlePaddle(飞桨) D. Keras

答案:C(PaddlePaddle是百度推出的国产深度学习框架)


题2:以下哪家公司在国内自主研发了AI芯片?

A. 腾讯 B. 阿里巴巴 C. 寒武纪 D. 美团

答案:C(寒武纪是国产AI芯片公司,华为也有昇腾Ascend芯片)


题3:若总训练样本数为10000,Batch Size为500,则一个Epoch需要多少次Iteration?

A. 10 B. 20 C. 50 D. 100

答案:B(Iteration = 10000/500 = 20)


题4:以下哪个属于分类问题?

A. 预测明天的气温 B. 判断邮件是否为垃圾邮件
C. 预测股票价格 D. 预测房价

答案:B(垃圾邮件判断是二分类问题,其余为回归问题)


题5:以下哪个是CNN的经典网络结构?

A. BERT B. GPT C. ResNet D. Transformer

答案:C(ResNet是CNN经典网络;BERT、GPT、Transformer基于注意力机制,不是纯CNN)


题6:Self-Attention中,Q、K、V分别代表什么?

A. Query, Key, Value B. Quick, Kernel, Vector
C. Quality, Knowledge, Variable D. Question, Answer, Verify

答案:A


题7:以下哪种池化方式取窗口内的最大值?

A. Average Pooling B. Max Pooling C. Min Pooling D. Sum Pooling

答案:B


题8:词嵌入(Word Embedding)相对于独热编码的优点是?

A. 维度更高 B. 计算更简单 C. 能表示词语的语义相似性 D. 不需要训练

答案:C


题9:BERT是基于Transformer的哪个部分构建的?

A. 编码器(Encoder) B. 解码器(Decoder) C. 编码器和解码器 D. 都不是

答案:A(BERT使用Transformer的编码器部分)


题10:以下哪个语音识别模型需要听完一整段音频才能输出文本?

A. CTC B. RNA C. LAS D. RNN-T

答案:C(LAS是典型的seq2seq模型,需要编码完整序列后才能解码)


题11:Epoch的含义是?

A. 一次参数更新 B. 所有训练数据完成一次前向传播和反向传播
C. 一次迭代的样本数 D. 学习率调整的周期

答案:B


题12:以下哪个不属于内容安全的四个层次之一?

A. 传统涉黄涉政涉爆内容识别 B. 个性化推荐算法滥用
C. 网络安全攻防 D. 不良价值观识别

答案:C


题13:在卷积神经网络中,参数共享意味着什么?

A. 所有层使用相同的参数 B. 不同感受野中的神经元有相同的参数
C. 训练和测试使用相同的参数 D. 所有filter有相同的权重

答案:B


题14:Sora是哪家公司发布的视频生成模型?

A. Google B. Meta C. OpenAI D. DeepMind

答案:C


题15:以下哪个音频任务是"音频到音频"类型的任务?

A. 语音识别(ASR) B. 文本到语音合成(TTS)
C. 语音转换(Voice Conversion) D. 语者识别

答案:C(语音转换属于音频到音频任务)


附录:关键公式速记

Self-Attention

  • Attention(Q, K, V) = softmax(Q × K^T / √d_k) × V
  • Q: Query, K: Key, V: Value
  • d_k: Key的维度

卷积输出尺寸

  • 输出尺寸 = (输入尺寸 - 卷积核大小 + 2×Padding) / 步长 + 1
  • 注意:如果结果不是整数,取决于是否向上/向下取整

池化

  • Max Pooling: 取窗口最大值
  • Average Pooling: 取窗口平均值

Epoch/Iteration关系

  • Iteration(每epoch)= 总样本数 / Batch Size
  • 总Iteration = Epoch数 × Iteration数(每epoch)
posted @ 2026-06-27 18:38  20232307孟月  阅读(25)  评论(0)    收藏  举报