AI-day1
大模型核心知识点梳理(通俗版+实例)
一、大模型发展史与核心基础
1. 发展历程(关键时间节点)
大模型的发展核心是“架构突破+模型迭代”,关键节点清晰:2017年Google提出Transformer架构(相当于给大模型搭好了“骨架”)→2022年OpenAI发布GPT-4(大模型能力迎来质变,能处理多类型任务)→2023年Meta开源Llama 2(降低大模型使用门槛,推动行业普及)→2024年OpenAI推出Sora(文本生成视频)和o1系列(强化逻辑推理),让大模型从“处理文本”走向“多维创作”和“深度思考”。
2. 核心技术:从基础模型到Transformer
大模型的技术基础是“机器学习→深度学习→特定神经网络”的递进,不同神经网络各有擅长,用实例一看就懂:
- CNN(卷积神经网络):擅长处理“静态数据”(比如图片、固定格式的表格),核心是提取局部特征。例:手机拍照识别人脸,就是CNN先提取五官的局部特征(眼睛、鼻子的形状),再组合判断是哪个人;再比如识别手写数字“8”,CNN会先捕捉“两个圆圈”的局部特征,再整合识别。
- RNN(循环神经网络):擅长处理“序列数据”(有先后顺序的内容),能记住前序信息。例:做中文翻译“我爱中国”→“I love China”,RNN会根据“我”先翻译出“I”,再结合“我”的语境翻译“爱”为“love”;再比如语音转文字,它能根据前面说的“今天”,判断后面接“天气”比接“电脑”更合理。但RNN有短板:处理长文本(比如一篇5000字文章)时,后面的内容会“忘记”前面的,而且计算慢。
- Transformer架构(核心中的核心):2017年提出,解决了RNN和CNN的局限性,是现在所有主流大模型(如GPT、Llama)的基础。核心是“注意力机制”——能同时关注所有输入内容的相关性,比如处理句子“小明喜欢吃苹果,他每天都买”,Transformer能快速判断“他”指的是“小明”,而不是“苹果”。优势是能高效处理长文本、支持并行计算(速度快)。
3. 主流模型分支:BERT vs GPT(用途差异很明确)
- BERT(双向编码器):能同时看“上下文”,适合“理解类任务”。例:给句子“这个苹果很甜”做情感分析(判断正面/负面),BERT会同时结合“这个”“很甜”等前后信息,快速得出“正面”结论;再比如提取文章关键词,它能从上下文判断“Transformer”是核心词,而不是“架构”。
- GPT(单向解码器):只能根据“前面的内容”预测下一个内容,符合自然语言的说话/写作逻辑,适合“生成类任务”。例:你输入“写一段关于春天的话”,GPT会从“春天”开始,依次生成“来了,花儿开了,鸟儿唱了”;再比如聊天时,你说“今天好热”,它会根据这句话预测你可能需要“降温建议”,从而回复“可以吃点冰西瓜,或者吹吹空调”。
4. 大模型核心概念与训练流程
- 大模型(LM):简单说就是“参数量特别大”(至少十亿级以上)的语言模型,能理解和生成人类语言。例:GPT-3参数量1750亿,Llama 2最大参数量700亿,这些都属于大模型。
-
训练三阶段(从“通用”到“专用”):
- 无监督学习(预训练):让模型“读遍海量通用文本”,学习语言规律。例:用全网的新闻、小说、论文训练模型,让它知道“太阳从东方升起”“下雨要带伞”这些基础常识,以及语法、用词习惯。
- 有监督学习(微调):用“带标注的高质量数据”让模型专注某类任务。例:想让模型做医疗问诊,就用“症状-诊断建议”的标注数据微调,让它知道“发烧38.5℃+咳嗽”对应“可能是感冒,建议多喝水、吃退烧药”。
- 强化学习(奖励模型):给模型的回答“打分”,引导它生成更好的内容。例:模型回答“发烧要吃头孢”(错误),就打低分;回答“发烧先测体温,38.5℃以上再用退烧药,头孢需医生判断是否过敏”(正确),就打高分,慢慢让模型学会输出准确、安全的内容。
5. 关键术语解析(必懂!用实例帮你理解)
- Token(令牌):模型处理文本的“最小单位”,可以是一个字、一个词或一个子词。例:“我爱大模型”这句话,不同模型分词可能是【我/爱/大/模型】(4个Token),也可能是【我爱/大模型】(2个Token);英文“I love AI”通常分为【I/ love/ AI】(3个Token)。
- 上下文长度:模型一次能“记住”的最大Token数量,超过就会“忘记”前面的内容。例:某模型上下文长度是4096个Token(约3000字中文),如果你给它一篇4000字的文章,让它总结最后一段,它可能会忘记前面的内容,总结不准确;而上下文长度16384个Token的模型(约12000字中文),就能轻松处理。
- 模型参数:模型里的“核心权重”,决定模型的“聪明程度”和“处理能力”,参数越多,能力越强,但需要的计算资源也越多。例:GPT-4参数量比GPT-3多,所以它处理复杂逻辑推理(比如数学题、代码调试)的能力更强;而一些小参数模型(如参数量10亿级),只能处理简单任务(比如生成短句子、简单翻译)。
二、大模型的现状、挑战与未来趋势
1. 现状与核心挑战
现在大模型已经能帮我们做很多事,比如写代码、生成文档、做简单的数据分析,但实际用的时候还有不少问题:
- 需求理解不清:你说“帮我写一个简单的登录页面代码”,模型可能不清楚你要“网页版”还是“APP版”,生成的代码不符合预期。
- 研发思维局限:模型只能根据已学的知识生成内容,无法提出“创新的技术方案”,比如面对一个全新的软件架构问题,它可能只能给出常规答案。
- Token限制:处理大型项目的历史代码(比如几十万个Token的代码库)时,模型一次装不下,无法全面分析代码逻辑。
- 研发工作占比低:实际工作中,用大模型做“代码生成”的时间只占10%-20%,大部分时间还是在澄清需求、对接业务、测试验证。
2. 未来趋势(2-3年内):新的人机协作范式
未来不会是“大模型取代人类”,而是“人类+大模型”协同工作:产品经理、研发、测试等角色会共建一个“大模型协作平台”,人类负责“提需求、定方向、做治理”,大模型负责“做执行”。
例:产品经理通过“Skills(技能指令)”告诉大模型“我需要一个电商APP的商品详情页,要包含价格、评价、加入购物车按钮”,大模型会先澄清需求(比如“评价要显示多少条?”),然后生成页面原型和初步代码;研发负责审核代码逻辑,测试负责验证功能;最后人类只需要专注于“这个功能是否符合用户需求”“是否有安全风险”等高阶问题。
三、测试人员的未来角色与能力要求
1. 核心角色转变:从“执行者”到“治理者”
以前测试人员主要是“执行测试用例、找bug”;未来在人机协作模式下,测试人员的核心工作是“管好大模型的输出质量”:评估大模型生成的代码、文档是否符合要求,设计针对性的测试用例验证大模型的输出,确保最终交付的产品安全、可靠。
例:大模型生成了电商APP的“支付功能”代码,测试人员不需要逐行写测试用例,而是设计“边界测试场景”(比如“支付金额为0元”“支付时网络中断”),让大模型先做初步测试,再由自己审核测试结果,重点关注“资金安全”“用户数据保护”等核心风险点。
2. 核心能力要求(3个必须)
- 重度AI工具使用者:熟练掌握Skills(给大模型下精准指令)、RAG(让大模型快速调用企业内部数据,比如历史测试用例)、MCP(模型协同平台)等技术。例:用Skills指令告诉大模型“按照电商行业的测试标准,生成支付功能的测试用例”,让模型精准匹配需求。
- 资深业务专家:深刻理解业务逻辑、软件架构和数据流,能指导大模型规避风险。例:知道电商APP的“支付流程”需要对接银行接口、验证用户身份,能提前告诉大模型“测试时要重点关注接口调用失败的场景”,避免模型遗漏关键测试点。
- 强大的思辨和跨领域整合能力:能应对复杂场景,比如大模型生成的测试用例有逻辑漏洞,能快速发现并修正;还能整合产品、研发、安全等领域的需求,设计全面的测试方案。例:面对“跨境电商的多语言支付功能”,能结合“语言翻译准确性”“不同国家的支付规则”“汇率计算”等多个维度,指导大模型完成测试。

浙公网安备 33010602011771号