ai 实习 面试题 面经 2

高德大模型实习一面凉经
1. 介绍项目,主要只问了和强化学习相关的那个项目。
2.项目强化学习部分,为什么用 DPO 而不是 PPO?GRPO效果怎么样?为什么要用GRPO
3.DPO 的目标函数 / 损失函数大概是什么思路?和 PPO 区别在哪?为什么要加 KL 散度限制?为什么要防止和原模型偏差太大?
4. 你对 Transformer 的 Encoder-Decoder 结构理解如何?Self-attention 公式是什么?
5. 了解 Multi-Head Attention、Group Attention、MLA、KV Cache 这些优化吗?Group Attention是哪两个可以复用?
无手撕,应该是面的太差了,这些问题感觉都比较基础但有的没答出来所以干脆没有手撕机会了。
#大模型 #算法 #互联网大厂

 

 

 

百度AIGC算法实习生一面
1、自我介绍
2、项目的数据是怎么准备的,自动化的数据扩增和量化打分是怎么做的
3、如果模型给了一版打分,还会人工进行二次评判吗
4、联合训练时数据的时长范围如何
5、详细探讨数据生成策略
6、多任务Loss怎么计算
7、自适应权重怎么动态调整,设计的算法什么样
8、InternVL和千问系列特点,区别
9、模型蒸馏方式详细介绍,多任务上的蒸馏
10、模态对齐上CLIP和siglip的区别
11、手撕算法
还有一些细节想不起来了
整体感受:大概50分钟,面的最烂的一场,逐渐红温。表达上需要再精简一些,逻辑清楚。基础八股遗忘太多。还有太多需要修炼
#大厂 #算法 #面经 #百度校招

 

 

 

 

6月面经
1. 你这GRPO是用哪个框架啊?
2. 你的那个GRPO是在GitLab上面找的一个开源项目,对吧?
3. 是Gallery X还是GitLab / Flow Factory这个框架吗?
4. 那你知道那个GRPO和DPO的那个区别吗?
5. 它们在数据构建上有什么区别?比如说你的训练集怎么构建?这块有什么区别吗?
6. Wan 2.2你有尝试过吗?我看你做的是2.1的那个项目。
7. 你用GRPO是包括哪些目标?就是将它哪些维度有提升还是哪些维度?
8. DeepSpeed训练是开的Zero Stage 2吗?还是开的3?
9. 你知道Zero Stage3和2啥区别吗?
10. 那你那个研究主要是哪个方向?也是视频生成吗?你在学校做的研究是生成图像吗?
11.做这个文生视频的实验出发点、动机是啥?
12. 你的这个实验用到的奖励模型其实主要是与对齐相关的,是吧?
13. 这两个奖励模型在训练的时候有做训练吗?没有对奖励模型做一些训练?
——————————分割线————————
6月初minimind无后续后,6月中旬手搓了两个项目,改成了简历,简历改好次日开始投递。上午投递,约下午面。
    
第一次接到面试,脑子有点懵,直接就答应了下午面。然而简历和八股都没熟悉,面试很快结束,理所当然的没有后续。
    
牢记此次教训,从此之后面试给自己留足准备时间。
    
#科软 #互联网大厂 #多模态 #算法 #百度 #废物日记

 

 

 

 

 

元戎启行感知算法实习生一面面经
1、自我介绍
2、询问到岗时间与实习时长
3、上一段实习做了一个encoder的选型和微调对吧,用了一个什么样的encoder呢
4、一共有几个人来做这个项目呀,怎么分工的
5、你们这个encoder出来接的是什么东西,因为vit出来是一个特征,后面接什么呢
6、这个特征融合是怎么做的,最后出来的shape是什么形状
7、讨论是用到的特征是单尺度还是多尺度的问题
8、微调有没有一些细节啊,比如有没有freeze啊这些,微调的策略是什么样的
9、一开始是做单任务的实验嘛,然后再一起去统一合并对吧,那每个单任务的时候有去调优吗
10、多任务训练的时候,梯度冲突是怎么解决的,有没有梯度规划这些操作
11、损失动态加权策略是每一步都去算然后调整吗
12、蒸馏你们的方案是什么,蒸馏的框架和dino是一样的吗
13、你选的学生模型是什么,有什么特点,为什么选他,选了之后有做什么调整吗
14、如果说你在训练完之后发现效果没有提升或者不好,你排查的策略是什么
15、你刚才讲到看loss的权重是否冲突,是指什么
16、loss归一化是吧,是指?
17、你还记得归一化的范围是?
18、你说做了难样本的动态筛选是怎么做的,详细介绍一下
19、学校的项目上,这个小目标检测,他的痛点和你对应的解决方案是啥
20、算法题:根据我刚才回答的多任务联合训练的损失和调优,面试官写了两个脚本,让我找出里面的bug,并讲解。可以用ai辅助。
    
整体感受:问题涵盖对项目整体的理解和非常详细的细节,面试官问的很好,很有水平,促使我面试结束后又整体复盘了一下自己的项目,但是当时答的一般,因为一些代码结构上的设计有点不记得了。ai coding的时候也出了一些状况,就有点摆烂了晚上七点面的,是我当天面的第四场,已力竭。
#校招 #互联网大厂实习 #秋招面试 #面经 #算法实习 #vibecoding#AICoding面试 #元戎启行面试

 

 

 

 

 

 

 

 

xhs agent 实习一面
感觉已凉,但面试官给了很多思考的方向,值得学习。八股很少,0点评。
    
研究方向?区块链?智能合约?
怎样把做上下文去给大模型识别漏洞的?
使用的是模型微调吗?了解哪些模型微调的方法?
你会希望用什么模型去做呢?
智能客服为什么需要多agent呢?
企业与企业之间的信息怎么保证不泄露,记忆隔离怎么做?
多agent动态路由怎么实现的?
大模型传哪些参数呢?随机值的参数叫什么?
设置的最大MaxToken数够吗?怎么去缩短上下文?
如果skill数量特别多,加载到提示词里,怎么去节省token?
如果用agent loop的话,要好几轮才能加载到你想用的skill怎么办?这么慢是没办法接受的
写过哪些skill?
怎么实现一个agent loop?如果卡死了怎么办?
项目里怎么使用redis的?redis读写大概耗时多久?
redis里是线程安全的吗?
redis服务器和客户端是怎么连接的?
无手撕
反问:业务,改进:项目准备的不太足,多做点实践,调研各种skill,怎么节省token、渐进式加载能不能满足所有场景
#实习#agent开发 #找实习

 

 

 

 

 

 

今天刚面的,开头依旧自我介绍
    
先问实习,你这个实习主要是开发吗?回答他说是,然后说那我们直接看后面的论文吧
    
主要围绕三篇论文来问,没带一点八股,单凭这一点直接给到夯。
    
由于主要问的都是主包的论文,这里就不太方便展示了。论文的话问了问创新点,训练数据,训练成本等。
    
然后聊了聊agent RL,问你认为agent RL的难点在哪,以及部门业务
    
手撕的话先出了到多头注意力机制,然后我跟他说我平常都是刷力扣,他给我换成了力扣,题目是力扣1855,先用暴力求解,然后问有没有O(n)的方法,并提示双指针,做完后跟他聊了聊团队业务以及要负责的事情。
最后问能实习多久,实习几天
    
总结:可以说这次是体验最好的一次面试,比前两次的腾讯还好,没问一点八股,都问的论文
#互联网大厂实习 #字节跳动#剪映#大模型算法岗#日常实习

 

 

 

百度多模态算法50min+
1.自我介绍
2拷打论文
第一篇
介绍背景和内容
数据集构建过程
qwen2.5vl的架构
qwen2.5vl和gwen3vl的区别
SAM3的架构
adapter.具体实现和原理
lora的实现和原理
第二篇
介绍背景和内容
如果引入VM会提升性能吗为什么
CLIP的架构和训练
手撕下降路径最小和(非hot100)
反问

 

 

 

字节大模型日常
实习一面+二面

已挂
二面
1. 项目
- 数据集构建、输入输出
- 用的什么GPU(可拓展讲显存优化和耗时)
- 生成数据的质量评估方法
- 训练时loss表现、训练轮数、停止训练的判断依据
- 是否有优化空间,后续优化方向和具体方法
- badcase处理方式
    
2. 八股
- DPO、PPO、GRPO 分别解释及区别
- LoRA 解释、初始化方式及效果更优的原因
    
3. 手撕
- 二叉树最大路径和
    
4. 反问
- 反作弊大模型应用场景
- 前期技术栈
    
---
    
一面
项目八股与二面项目部分类似
手撕:和为0的最长子数组长度

 

 

 

 

 

得物-大模型算法-实习一面
面试官人很好,聊的比较投缘,无手撕,基本没八股,主要项目拷打,深度一般。
1. 自我介绍,并简单介绍两个项目。
2. Search Agent 项目的三个核心痛点是什么?
3. 针对三个痛点分别做了什么优化?
4. Query 质量怎么评价?
5. 如何验证 LLM-as-a-Judge 的评分可靠性?
6. ReAct Agent 是怎么搭建的?
7. Agent Loop 的停止条件是什么?
8. Qwen3-8B LoRA SFT 的完整流程是什么?
9. Teacher trajectory 是怎么生成和清洗的?
10. SFT 使用了多少条数据?
11. SFT 前后准确率分别是多少?
12. 50% 左右的成功率够不够?剩余 failure case 来自哪里?
13. DPO preference pair 怎么构造?
14. DPO 的原理是什么?
15. GRPO 的原理是什么?
16. 跨域分类项目的背景、困难和解决方案是什么?
17. Domain Generalization 怎么评估?和迁移学习有什么区别?
18. LoRA rank 怎么选择?
19. 大模型幻觉有哪些?怎么缓解?
20. 多久可以到岗?能实习多久?
记录一下攒攒人品,目前拿到了几个比较好的offer,同温层可以交流一下。
#互联网大厂 #面经 #算法 #人工智能就业

 

 

 

阿里淘天研究型算法实习一面面经
面试大概 75min。项目问得比较深,除了 SFT / RL,也追了不少实际训练和工程细节。
    
流程:
自我介绍 → 实习项目深挖 → RL / 训练 → 个人项目 → 手撕 → 反问
    
项目
1、介绍最近一段实习,项目主要解决什么问题,自己负责哪些部分
2、训练数据怎么构造,Teacher 生成的轨迹怎么筛选
3、多轮 Tool-use 的 SFT 数据怎么组织,一条完整轨迹怎么训练
4、哪些 token 参与 SFT loss,Tool Observation 怎么处理
5、SFT 用什么框架,数据规模、上下文长度和训练超参大概怎么设
6、RL 的 Reward 怎么设计,怎么判断一次任务最终有没有完成
7、训练过程中遇到过什么问题,最后是怎么处理的
8、为什么后面换成 DAPO,主要改善了什么训练问题
    
RL / 训练
1、训练时除了 Reward,还会关注哪些指标
2、从 rollout 到参数更新,一个 RL step 大概有哪些环节,哪部分最耗时
3、importance ratio 在 RL loss 里是干什么的
4、一批 rollout 数据一般会用来更新几次参数
5、训练到什么时候停,最终 checkpoint 怎么选
6、如果要提高 GPU / SM 利用率,一般会从哪些地方调,上下文长度会怎么影响利用率
    
个人项目也问了后训练和 Agentic RL 相关的实验.
    
手撕:
LeetCode 416 分割等和子集
    
最后反问了团队方向。
偏 Research 的实习,主要做电商场景下的 Agent Memory,以研究和论文产出为主,也会结合业务做验证。
#面经 #阿里巴巴 #淘天 #研究型实习 #推荐Agent #AgentMemory #大模型后训练 #AgenticRL #强化学习 #算法实习

 

 

 

 

商汤科技 agent开发 二面oc

①你这里用了混合检索和重排序,那混
合检索的具体召回源是什么?
②为什么单一的向量检索
(Embedding-based RAG)在你的场景
中效果不足?
③引入混合检索优化后的召回率(或效
果)能达到多少?
④重排序模型是放在你整个链路(RAG
pipeline)的哪一步?其输入输出分别是什
么?
⑤重排序的策略你具体是怎么设计的?
⑥你怎么证明这个重排序策略提升了效
果?
⑦你使用了什么指标来评估效果?这些
指标是如何计算的?
⑧你用来评估的真值(ground truth)
是什么?是如何定义和构造的?

⑨你怎么判断模型生成的回答是准确的
还是不准确的?你的评估标准是什么?
意图识别
10.说一下你的意图识别模块如何实现
多知识库路由?模型如何决定查询应该路由
到哪个知识库?
11.这个意图识别是不是用大模型做的?
12.如果意图识别置信度较低或者分类◇>
错误时,你的系统如何进行兜底处理?
13.如果后面的兜底机制可以纠正错
误,为什么前面的意图识别仍然会出错?为
什么不将后置的纠错机制放到前面去替代意
图识别?
14.你这个查询改写具体是怎么做的?是
怎么触发的?
15.你怎么避免查询改写把用户原本的

问题带偏?如何控制查询改写引入的语义偏
差或“幻觉问题”?
16.模型是如何决定去调用哪个工具
的?
17.这些工具的定义是你人工设计的,
还是让模型自动生成的?
18.有没有做过提高工具调用成功率的
优化策略?
19.除了结果校验外,你有没有做一些
流程层面的优化,比如参数校验、失败重试
这些?
20.如何避免工具调用中重复执行或死
循环问题?如果调用结果不合理,你是如何处
理的?
21.工具调用结果如何进行有效性检验?
22.短期记忆和长期记忆分别存什么内
容?

23.短期记忆的存储策略和生命周期是
怎样的?
24.长期记忆的写入机制如何设计?它
主要存储哪些类型的信息?
25.在FastAPl服务中,哪些环节采用
了异步(async)实现?
26.哪些操作被放入线程池执行?为什
么这么设计?
Agent架构设计(单
Agent vs多Agent)
27.为什么多Agent架构比单Agent
好?
28.为什么不直接用一个强大的大模型
统一处理所有任务?
29.多Agent系统中是否带来以下问题:
上下文传递错误、任务冲突、重复调用,这些

问题你是怎么解决的?
30.在你的1CD文档生成系统中,最难
的环节是哪一部分?
31.难点主要在:Excel操作和生成结构
化信息,他们具体难在哪里?
33.如何约束大模型生成符合结构化要
求的输出?
34.Prompt工程(正例反例)是否足
够保证正确性?
35.如果不够,系统层面有什么兜底措
施?
知识图谱与Hybrid
Graph RAG
36.为什么传统文本检索不够用,要引
入知识图谱?

37.在Hybrid Graph RAG中:全局社
区检索解决什么问题?局部检索解决什么问
题?
38.这两种检索结果具体是是怎么融合
的?
模型训练与评估
39.为什么选择Qwen2.5而不是更新版
本(如Qwen3)?
40.有没有做数据清洗、指令构造或安
全策略相关的工作?
41.你在奖励模型方面做了哪些改进?
43.医疗问答系统的效果评估方法是什
么?如何评估专业性?如何评估幻觉?如何
评估危险回答?
44.有没有更完善的评估方案?

 

posted @ 2026-08-28 21:22  hrdom  阅读(28)  评论(0)    收藏  举报