AIGC标识 测试开发转大模型应用开发岗全套学习规划(10周70天,每日1~2h)

测试开发转大模型应用开发岗全套学习规划(10周70天,每日1~2h)

前置说明

  1. 岗位定位:只做应用落地,不深入底层模型训练、预训练、完整RLHF算法,跳过复杂数学推导;核心能力:API封装、Prompt、RAG知识库、Agent工具调用、私有化部署、工程化服务、自动化评测,完美匹配你Go/Python/Shell/测试工程基础。
  2. 每日投入:工作日1~1.5h,周末2h;理论40% + 代码实操60%
  3. 总周期:10周70天(砍掉原计划复杂微调底层训练内容,聚焦企业刚需应用开发)
  4. 资源规则:每日任务附带官方文档/B站视频/GitHub开源教程可直接访问链接,全部免费可落地
  5. 你的优势复用:接口封装、异常重试、并发控制、Docker/Shell自动化、自动化测试、性能调优全部融入实战

全套通用核心资源总清单(全程复用)

文档类(必收藏)

  1. Datawhale《动手学大模型应用开发》(入门主线教程)
    https://datawhalechina.github.io/llm-universe/
  2. LangChain 中文官方文档(框架核心)
    https://www.langchain.com.cn/
  3. Qwen通义千问官方开发文档(国内主流开源模型)
    https://qwen.readthedocs.io/
  4. Milvus向量数据库官方文档(生产级RAG)
    https://milvus.io/docs/
  5. FastAPI官方文档(后端服务)
    https://fastapi.tiangolo.com/
  6. vLLM推理加速官方文档(私有化部署)
    https://docs.vllm.ai/
  7. LlamaIndex官方文档(轻量化RAG)
    https://docs.llamaindex.ai/

B站视频(配套实操看)

  1. 全栈大模型应用开发全套实战(2026最新)
    https://www.bilibili.com/video/BV1HF7N68Eyh/
  2. 清华刘知远大模型应用公开课(概念科普)
    https://www.bilibili.com/video/BV1UG411p7zv/
  3. FastAPI AI后端实战教程
    https://www.bilibili.com/video/BV1mY4y1X7qL/

GitHub实战仓库

  1. llm-universe 完整RAG/API示例:https://github.com/datawhalechina/llm-universe
  2. LangChain官方examples:https://github.com/langchain-ai/langchain
  3. Qwen-Agent工具调用Demo:https://github.com/QwenLM/Qwen-Agent

分阶段每日详细学习计划(每日附带学习链接)

阶段1:基础铺垫(第1-2周,14天)|目标:搭建AI环境,掌握LLM核心术语、Python AI工具链

第1周 Day1~Day7

Day1(1.5h)

学习内容:区分大模型应用开发/算法训练岗;主流模型(Qwen/GLM/DeepSeek);基础术语Token、Embedding、上下文窗口、幻觉、流式输出

学习资源:

文档:https://datawhalechina.github.io/llm-universe/ch1/introduction.html

视频:https://www.bilibili.com/video/BV1HF7N68Eyh/?p=1

实操:Conda创建AI独立虚拟环境,安装numpy/pandas/jupyter

产出:可用Python AI开发环境

Day2(1h)

学习内容:向量、余弦相似度极简数学(仅工程需要部分,跳过微积分)
学习资源:
文档:https://datawhalechina.github.io/llm-universe/ch2/embedding.html
实操:Numpy编写向量相似度计算代码,文本向量化基础Demo

Day3(1.5h)

学习内容:NLP发展简史(Word2Vec→BERT→GPT);编码器/解码器区别,Transformer宏观结构(仅模块认知,不抠数学)

学习资源:

视频:https://www.bilibili.com/video/BV1UG411p7zv/?p=3

文档:https://datawhalechina.github.io/llm-universe/ch2/transformer.html

实操:文本清洗通用函数(去换行、分段、过滤特殊字符)

Day4(1h)

学习内容:零样本/少样本/ICL上下文学习、预训练/微调基础概念(仅知道用途,不训练)

学习资源:https://datawhalechina.github.io/llm-universe/ch2/basic_concept.html

实操:Jupyter标准化调试模板封装

Day5(1.5h)

学习内容:Tokenizer分词原理BPE/SentencePiece,Token数量统计、上下文超限问题

学习资源:Qwen官方Tokenizer文档 https://qwen.readthedocs.io/en/latest/tokenizer.html

实操:AutoTokenizer加载Qwen分词,统计不同文本token长度

Day6(1h)

学习内容:国内主流大模型API(通义、智谱、千帆)调用规范、限流、计费

学习资源:阿里云百炼API文档 https://help.aliyun.com/zh/model-studio/user-guide/overview

实操:requests封装通用HTTP请求类,兼容多厂商API入参

Day7(周末2h)

周复盘项目:批量读取本地TXT清洗+向量相似度匹配Top3文本

配套资源:llm-universe第一章完整案例 https://github.com/datawhalechina/llm-universe/tree/main/notebook/ch1

第2周 Day8~Day14

Day8(1.2h)

学习内容:Embedding稠密向量作用、本地轻量向量库Chroma基础概念

资源:https://datawhalechina.github.io/llm-universe/ch3/vector_store.html

实操:Chroma本地入库、查询极简Demo

Day9(1.5h)

学习内容:模型推理参数temperature、top_p、max_tokens、stop词含义

资源:https://help.aliyun.com/zh/model-studio/user-guide/text-generation

实操:封装可自定义参数的LLM调用函数

Day10(1h)

学习内容:SSE流式输出原理,对话上下文拼接逻辑

资源:FastAPI流式响应文档 https://fastapi.tiangolo.com/tutorial/streaming/

实操:实现打字机流式API调用

Day11(1.5h)

学习内容:LangChain整体架构、Chain、Memory基础组件

资源:LangChain中文入门 https://www.langchain.com.cn/docs/get_started/introduction

实操:最简LangChain LLM调用Demo

Day12(1h)

学习内容:文档加载器基础(TXT/PDF),文本分割基础逻辑

资源:https://datawhalechina.github.io/llm-universe/ch3/document_loader.html

实操:单PDF文档读取、分段

Day13(1.2h)

学习内容:RAG完整链路概念(文档→分块→向量入库→检索→问答),解决幻觉原理

资源:https://datawhalechina.github.io/llm-universe/ch4/rag_basic.html

实操:极简单文档RAG问答Demo

Day14(周末2h,阶段1结业小项目)

完整链路:文档清洗→向量化存入Chroma→问题检索匹配片段问答

源码参考:https://github.com/datawhalechina/llm-universe/blob/main/notebook/ch4/rag_simple.ipynb

阶段2:大模型API工程化+Prompt工程(第3-5周,21天)企业最基础业务能力

第3周 Day15~Day21(API封装+后端服务)

Day15(1.5h)

内容:多模型统一客户端封装设计,统一入参出参屏蔽各厂商差异

资源:https://datawhalechina.github.io/llm-universe/ch3/api_call.html

实操:Python通用LLM Client类,兼容通义/智谱API

Day16(1h)

内容:对话Memory实现、超长上下文自动截断策略

资源:LangChain Memory文档 https://www.langchain.com.cn/docs/modules/memory/

实操:多轮对话记忆自动裁剪代码

Day17(1.5h)

内容:FastAPI搭建LLM后端,同步/流式双接口、自动接口文档

资源:FastAPI快速入门 https://fastapi.tiangolo.com/tutorial/first-steps/

实操:/chat对话接口,支持stream参数切换流式

Day18(1h)

内容:LLM调用异常处理:超时、429限流、token超限、服务报错、重试机制

资源:https://datawhalechina.github.io/llm-universe/ch3/error_handle.html

实操:给客户端增加重试、日志捕获、异常分类返回

Day19(1.2h)

内容:批量文档摘要并发控制、线程池限速

资源:Python concurrent.futures官方文档

实操:多线程批量调用LLM生成文档摘要

Day20(1h)

内容:Go语言调用大模型API(发挥你的Go优势)

资源:Qwen Go SDK https://github.com/QwenLM/qwen-go-sdk

实操:Golang HTTP客户端调用通义API,对比Python实现

Day21(周末2h)

项目:完整LLM后端服务:多厂商兼容+异常重试+流式输出;附带Go简易调用Demo

参考项目:https://github.com/datawhalechina/llm-universe/tree/main/notebook/ch3/api_server

第4周 Day22~Day28(Prompt工程核心)

Day22(1.5h)

内容:Prompt四大结构:角色、任务、约束、输出格式;零/少样本提示词

资源:LLM Cookbook提示词教程 https://github.com/datawhalechina/llm-cookbook

实操:结构化JSON提取Prompt,自由文本转JSON

Day23(1h)

内容:CoT思维链原理,复杂推理场景优化

资源:https://datawhalechina.github.io/llm-universe/ch5/prompt_cot.html

实操:普通Prompt vs CoT推理效果对比

Day24(1.5h)

内容:强制结构化输出,规避模型乱输出、JSON解析容错

资源:LangChain OutputParser https://www.langchain.com.cn/docs/modules/model_io/output_parsers/

实操:固定返回JSON模板,增加解析异常捕获

Day25(1h)

内容:行业定制Prompt,测试开发专属Prompt(自动生成接口测试用例)

实操:输入接口文档,输出标准化测试用例JSON

Day26(1.2h)

内容:Prompt效果简易评估方法(输出稳定性、准确率、token消耗)

实操:批量样本对比2版Prompt输出效果量化

Day27(1h)

内容:Prompt注入攻击与输入过滤防御方案

资源:https://owasp.org/www-top-10-for-llm-applications/

实操:输入敏感词过滤、prompt加固逻辑

Day28(周末2h)

实战项目:智能测试用例生成工具,FastAPI对外提供接口

参考:https://github.com/datawhalechina/llm-universe/tree/main/notebook/ch5/prompt_project

第5周 Day29~Day35(Function Calling工具调用)

Day29(1.5h)

内容:Function Calling原理、工具描述JSON规范,模型自主判断调用工具

资源:Qwen Function Calling文档 https://qwen.readthedocs.io/en/latest/toolcall.html

实操:计算器工具调用Demo

Day30(1h)

内容:多工具注册、工具返回结果二次入模型总结

实操:注册日期查询、文本摘要双工具自动调度

Day31(1.5h)

内容:LangChain Tools工具集封装

资源:https://www.langchain.com.cn/docs/modules/tools/

实操:本地文件读取工具封装

Day32(1h)

内容:Few-shot样本库动态插入Prompt提升效果

实操:本地样本检索匹配,自动注入提示词

Day33(1.2h)

内容:长文档分层摘要Prompt(分段摘要+全局汇总)

实操:万字文档分层摘要工具

Day34(1h)

内容:Redis缓存高频问答,减少token消耗、降低调用成本

实操:本地Redis缓存问答逻辑

Day35(周末2h,阶段2结业项目)

工具问答机器人:多工具调用+结构化输出+Redis缓存+FastAPI接口

阶段3:RAG检索增强生成(第6-8周,21天)求职核心项目,企业刚需

第6周 Day36~Day42(基础RAG链路)

Day36(1.5h)

内容:标准Naive RAG完整流程,解决知识截止、幻觉

资源:https://datawhalechina.github.io/llm-universe/ch4/rag_basic.html

实操:单文档LangChain RAG问答

Day37(1h)

内容:文本切分策略、chunk大小/重叠调优,两种分割器对比

资源:LangChain TextSplitter https://www.langchain.com.cn/docs/modules/data_connection/document_transformers/text_splitters/

实操:Recursive分割/语义分割效果对比

Day38(1.5h)

内容:多格式文档加载PDF/Word/TXT/Markdown

资源:https://datawhalechina.github.io/llm-universe/ch3/document_loader.html

实操:批量上传多文件解析入库

Day39(1h)

内容:检索优化:TopK召回、相似度阈值、Rerank重排序

资源:https://datawhalechina.github.io/llm-universe/ch6/rag_rerank.html

实操:接入Rerank模型优化检索精准度

Day40(1.2h)

内容:向量库持久化、知识库新增/删除/更新接口

实操:Chroma封装CRUD知识库接口

Day41(1h)

内容:RAG专属Prompt模板设计,区分检索上下文与用户问题

实操:通用知识库问答提示词模板

Day42(周末2h)

简易本地知识库系统:上传文件→自动入库→问答检索

完整代码:https://github.com/datawhalechina/llm-universe/blob/main/notebook/ch4/rag_full.ipynb

第7周 Day43~Day49(RAG工程优化&生产向量库Milvus)

Day43(1.5h)

内容:父文档检索优化,解决chunk分割丢失上下文问题

资源:https://datawhalechina.github.io/llm-universe/ch6/rag_parent_doc.html

实操:实现父文档检索代码

Day44(1h)

内容:Embedding缓存,重复文本不重复向量化节省算力

实操:本地JSON缓存向量逻辑

Day45(1.5h)

内容:Milvus轻量部署,对比Chroma生产级差异

资源:Milvus快速启动 https://milvus.io/docs/install_standalone-docker.md

实操:Docker启动Milvus,完成文档入库检索

Day46(1h)

内容:RAG检索评估指标:精确率、召回率、MRR

实操:构造测试集量化检索效果(复用测试开发自动化思维)

Day47(1.2h)

内容:FastAPI封装RAG问答接口,并发限制、请求限流

实操:RAG上传/问答全套API服务

Day48(1h)

内容:Shell脚本自动扫描文档目录,增量更新知识库(发挥Shell优势)

实操:定时增量更新向量库Shell脚本

Day49(周末2h)

升级项目:Milvus生产级RAG系统,多文件上传、增量更新、并发问答

第8周 Day50~Day56(高阶RAG场景+可视化页面)

Day50(1.5h)

内容:多知识库路由,自动匹配领域知识库

实操:技术库/产品库双知识库路由检索

Day51(1h)

内容:混合检索BM25关键词+向量多路召回融合

资源:https://datawhalechina.github.io/llm-universe/ch6/rag_hybrid.html

实操:BM25+向量双路召回实现

Day52(1.5h)

内容:RAG+Function Calling联动,知识库+实时工具结合问答

实操:检索文档后自动调用工具补充实时数据

Day53(1h)

内容:向量库元数据过滤(时间、标签、文档类型筛选)

实操:基于元数据条件检索

Day54(1.2h)

内容:多轮对话RAG,携带历史上下文优化检索

实操:多轮记忆+检索联动

Day55(1h)

内容:Gradio快速搭建可视化问答前端页面

资源:Gradio官方文档 https://www.gradio.app/docs

实操:可视化知识库问答界面

Day56(周末3h,阶段3核心简历项目)

企业私有知识库问答平台:混合多路检索、多轮对话、工具联动、Gradio前端、Shell自动增量更新

阶段4:Agent智能体开发(第9周,7天)企业自动化AI刚需

Day57~Day63

Day57(1.5h)

内容:Agent四大核心组件Plan规划/Memory记忆/Tools工具/ReAct反思

资源:Hello-Agents教程 https://github.com/datawhalechina/hello-agents

实操:基础ReAct工具Agent,多步骤任务自主执行

Day58(1h)

内容:Agent任务规划,结构化输出步骤拆解

实操:文档分析→摘要→导出报告多步骤Agent

Day59(1.5h)

内容:LangGraph状态机Agent,分支流程控制

资源:LangGraph文档 https://www.langchain.com.cn/docs/langgraph/

实操:简单对话分支流程

Day60(1h)

内容:Agent分层记忆:短期对话记忆+RAG长期任务记忆

实操:Agent绑定私有知识库长期记忆

Day61(1.2h)

内容:Agent日志追踪、步骤记录、失败自动重试

实操:完整Agent执行日志、异常捕获重试

Day62(1h)

内容:测试自动化Agent场景:需求文档→生成测试用例→评审

实操:测试专属智能体Demo

Day63(周末2h)

自动化测试Agent项目:输入需求自动生成、评审测试用例,输出标准化报告

阶段5:私有化模型部署+工程化落地(第10周,7天)面试加分核心,区分初级应用开发

Day64~Day70(弱化底层微调,只学部署+轻量化推理,不训练模型

Day64(1.5h)

内容:开源模型本地推理方案Transformers、vLLM加速原理

资源:vLLM快速入门 https://docs.vllm.ai/en/latest/getting_started/quickstart.html

实操:vLLM部署Qwen-7B流式推理本地服务

Day65(1h)

内容:模型量化4bit/8bit,降低显存占用,本地低成本推理

资源:GPTQ量化文档 https://github.com/oobabooga/GPTQ-for-LLaMa

实操:4bit量化Qwen本地加载推理

Day66(1.5h)

内容:Docker容器打包大模型推理服务(复用测试CI/CD能力)

资源:vLLM Docker部署文档 https://docs.vllm.ai/en/latest/deployment/docker.html

实操:编写Dockerfile封装推理服务

Day67(1h)

内容:模型服务基础监控:QPS、响应延迟、显存占用埋点

实操:简易吞吐量监控日志打印

Day68(1.2h)

内容:Shell一键启停、更新、重启模型服务自动化脚本

实操:全套运维Shell脚本

Day69(1h)

内容:Go高性能网关开发,统一转发私有模型/云API(发挥Go优势)

资源:Qwen Go SDK https://github.com/QwenLM/qwen-go-sdk

实操:Go网关路由转发LLM请求

Day70(周末3h,结业综合简历大项目)

一站式AI测试开发平台(可直接写进简历)

  1. 底层:Docker vLLM量化私有化Qwen推理服务
  2. 中间层:Milvus混合检索RAG知识库
  3. 上层:LangGraph自动化测试Agent
  4. 网关:Go高性能转发网关
  5. 配套:Shell自动化部署、RAG自动化评测脚本、Gradio可视化页面

转型关键学习取舍(适配应用岗,避开算法岗无用内容)

  1. 不用深入学习:完整Transformer数学推导、预训练大模型、全量微调、RLHF训练、分布式训练、多卡训练;仅知道概念用途即可。
  2. 重点深耕:API工程封装、Prompt优化、RAG全链路、Agent工具调用、向量库运维、私有化推理部署、自动化评测、Go/Shell工程落地。
  3. 差异化求职优势:突出测试开发+大模型交叉能力:RAG检索自动化评测、大模型接口压测、Agent流程回归测试、CI/CD一键部署AI平台,普通纯开发不具备。
posted @ 2026-07-13 16:09  alisleepy  阅读(45)  评论(0)    收藏  举报