AI质效
架构革新:
Transformer摒弃RNN序列结构,采用 全并行化设计,大幅提升训练效率与模型 可扩展性
突破依赖:
通过自注意力机制捕捉长距离语义关联,有效解决RNN在长文本中的梯度消失问题
取代旧模:
相比CNN局部感受野和RNN时序限制,Transformer实现全局动态权重分配,成为新标准
深入核心技术机制:自注意力(Self-Attention)的工作原理与优势:

构建时间轴图谱:从2017年Transformer诞生到2024年实时交互的重大节点

Cursor既便宜又稳定,Opus也贵也容易封号、Claude最好、贵还容易封账号,codex也贵
卷积神经网络CNN(Convolutional Neural Network),对于图片的处理、美颜、扫码、自动对焦、图像识别,输入一个图片,把图片抽成像素块,提取像素块典型的特征,跟之前训练的数据比对,从而识别出图片里的东西是什么内容。
卷积神经网络大概分为三层,卷积层、池化层、连接层。一个图片来了之后通过卷积层,把图片分成各个小区域之后,提取图片里的特征值;提取特征后通过池化层(加快计算速度),提取图片里最像的值、最亮的值,把图片里没有用的去掉了,提取图片里最像某些特征的像素,图片变小,但是图片里关键的特征还在;通过池化最终到连接层输出,特征拼到一块,跟之前训练的进行比对,输出是什么东西。
三个卷积层,两个池化层和一个全局连接层,先卷积、再池化,再卷积、再池化,再卷积,全局连接层输出。图像分类、目标定位、人脸识别、图像切割这些典型的场景用起来了。
卷积神经网络,通过提取局部特征,空间特征提取和权重共享,但是没有先后顺序,不知道谁依赖谁,比如输入我吃苹果,输出苹果吃我,也是四个字,通过。
最早的扫描照片和人脸是一样的,现在不行了,活体检测,通过算法判断是否是真人
循环神经网络RNN(Recurrent Neural Network)
核心思想
通过隐藏状态记忆历史输入,实现对序列前后依赖的建模;
结构特点
共享参数的循环连接使网络可处理任意长度序列数据;
信息流动
当前时刻输出由输入和上一时刻隐藏状态共同决定;
应用场景
适用于文本、语音等需捕捉时间动态特性的任务场景;
循环神经网络通过前面输入的内容,预测后面输入的内容,分为三层,输入层、隐藏层和输出层。输入层就是输入什么东西,就记什么东西,输入层不仅接收当前的数据是什么,并且把当前的数据传递给隐藏层,历史的输入都在隐藏层存着呢,隐藏层把输入的数据串起来了,我爱北京天安门,你呢。循环神经网络能捕捉数据之间的关联关系,从而供后面的输出层去做决策、做判断。RNN能理解上下文,弊端是串行,无法解决并行问题,无法解决长距离依赖问题,输入越长,理解越弱。
针对卷积神经网络和循环神经网络的问题,1997年谷歌提出了Transformer,Transformer架构是大模型的基础,Transformer架构解决了RNN和CNN共同存在的问题,我 爱 北京天安门 , 你呢?,爱的关注权重。
Transformer架构图:

Multi-Head Attention:多头注意力,可以并行处理,多头理解这句话的重要信息,谁和谁有关系;
Feed-forward network(前馈神经网络):把词串起来,知道那个他是代表小明、小黑或小白
Embedding:向量化,把输入的文字转成向量,多个维度,最少维度是512,也有1024维度的
token(输入词)---embedding(向量+位置编码)---编码器【self-attention(前后都可以看)---ffn(Feed-forward network)---输入】---解码器【掩码自注意力(可以看前面,后面不能看,后面的是预测出来的)---self.attention---ffn---输出】,Transformer架构里编码器和解码器是成对出现的,输入汉字,转成英文,输出时英文转成汉字,向量化。
Q、K、V 是实现自注意力机制的三组向量;自注意力 = 通过 QKV 计算序列 token 之间相关性的整套算法
Q(Query 查询):我要找什么信息
K(Key 键):每条信息有什么标签
V(Value 值):信息本体内容
前馈网络FFN(Feed-Forward Network)
通俗比喻:
一段文本:我想吃苹果
Attention:“我” 去关联 “苹果”、“想吃”,建立词语之间联系;
FFN:拿到关联信息后,单独理解「我想吃苹果」这个语义,提炼含义;
一句话区分:Attention = 看别人;FFN = 自己消化思考;
512维---扩维 *4 2048维---从而挖掘隐藏的、更高阶的特征---提取筛选挖掘出来的高级特征/关键信息---降维 512维度
ffn:提炼 token 上下文无关特性(词根 词性),再结合位置编码,强化位置感知的局部信息
attention:token之间的相互关系,谁在听谁说 ffn:每个token 并行,独立思考,怎么去理解这个token
attention:决定看谁、决定信息能不能到达,建立整个token的序列结构 ffn:决定怎么看懂、决定的是信息能不能被理解,消化attention阶段汇总来的信息
llm---large language model,大预言模型,大是指参数多,生成式任务---解码器更合适,没有编码器,架构图只有右侧部分,因为大模型创造新文本,而不是分析现有文本,所以我们没有编码器文本,只有解码器文本,解码器记住用户输入的内容去预测生成后续内容,不需要编码器去转化一下,解码器既干理解又干生成部分,把用户已经生成好了的前文,后面只需要把生成好的内容汇总到一块,通过掩码自注意力、前馈网络不断的去预测下一个词,llm:输入词、编码层、输出层
小米 洗衣机 说明书 在哪 ? 解码器: 单向多头自注意力机制 洗衣机 只看到小米 说明书重点关注洗衣机
什么是上下文?
上下文:模型单次能处理的最大长度/token----模型单次能处理的最大 输入+输出 长度/最大token,其大小(如128k)通常以Token为单位
输入:提示词----自己输入的部分+隐藏的部分(历史会话信息)+agent内置提示词,历史会话信息包括历史的输入和输出,就是本次输入之前的输入和输出
控制上下文长度方式:
滑动窗口(一般有个阈值,如70%,超过70%,前面最早的那几轮对话被丢掉)
压缩(提炼、精简比较重要的信息,把一些有用的信息保留下来,把没用的、无关紧要的、啰嗦的信息丢掉)
控制上下文长度是agent自己发起的,比如豆包、元宝、千问,到了多少长度之后去压缩上下文窗口
app本身发起,不是大模型发起的,大模型是被调用的一方,大模型藏在后面,新开一个窗口或会话,就是没有老的历史负担(防止历史信息被压缩,导致结果不准确),可以简单理解历史信息是agent的缓存记忆,大模型有api_key就可以调用,不一定非得agent调用
超长错误 or 截断:超过128K,没有对这些信息超出处理就报超长错误,会有一个错误码,请求就失败了
截断:如果上下文长度是128K,输入已经127K了,输出如果是4K,实际只能输出1K,没有完全输出,有好多信息被截断了,想要的结果没有完全取到,大部分是一般模型网关报超长错误,agent有这个压缩能力
记忆保持几轮,轮次,5轮,保持对话里的最近5轮输入和输出作为本轮上下文传给大模型,第6轮的输入和输出不能作为本轮上下文发给大模型,轮次自己可以设置,不是越长越好
深入思考是多维度的去考虑一下用户到底想要的是什么东西,前面的输入和输出之间有什么矛盾,如果有矛盾揣测用户的真正意图是什么
最大上下文=输入+输出 的最大大小是多少
Token:词源,大模型处理输入和输出的最小单位,可以是一个汉字、英文单词或符号。不同模型的分词策略不同,导致相同文本的Token数量不固定
小米洗衣机说明书,一个词是一个token,可以一个字拆分,占8个token,可以拆成小米 洗衣机 说明书,占3个token,节省token,英语一个单词就是一个token,输入的时候是一个一个token往里输,输出的时候也是一个一个token生成
100个汉字,大概是150-200个token,大概乘以1.5-2合理,128K上下文=128Ktoken,不等于128K的汉字
计费:大模型服务通常按输入和输出的Token总数进行计费。
大模型的回复内容生成过程
输入:用户输入的文本首先经过分词,转换为Token ID。
嵌入:Token ID通过嵌入模型转换为多维向量,并加入位置编码。
自注意力机制:模型通过自注意力机制理解Token之间的关联关系、权重,以把握整体语义。
前馈网络FFN:升维,获取更深语义和语境隐藏状态,对注意力机制的结果进行非线性变换,以提取更深层次的语义。
生成:模型通过下采样算法,根据概率分布预测下一个最可能的Token,并重复此过程,直到生成结束。
大模型原理: 通过在海量数据上进行训练,将知识以参数权重形式存储在神经网络中。回答问题时,利用自注意力机制推测用户意图并预测下一个最可能出现的Token
GPU与模型训练
GPU:显存,硬件,AI时代现存更加重要,在模型训练或者推理的时候需要用到显卡,在GPU上面跑,CPU不行,扛不住了,
生成输出是串行,GPU要占用很久,一个字一个字算,所以输出token贵;输入prompt可以一次性批量并行计算,GPU利用率高,输入token便宜。
模型类型:当前主流的大模型已发展为多模态模型,不仅能处理文本,还能处理图片、音频、视频等多种形式。
大模型只有两个阶段,训练和推理,现在用的就是推理阶段,生成就是推理过程
训练阶段:
无监督学习:模型在海量未标注数据(海量数据有正确的也有错误的)上进行预训练,学习语言的统计规律,训练从几个月调整到半个月左右。
监督学习:使用高质量(数据量不是很多)的标注数据进行微调,使模型的行为更符合预期。
强化学习:引入奖励模型,通过正负反馈来优化模型的生成策略(就有了现在的大模型)。
关键概念与术语
参数:参数的数量是衡量模型能力的重要指标,通常参数越多,模型学习和表达能力越强,但成本也越高。
开源模型:开源模型主要提供模型(参数)权重、模型架构、推理部分的代码、许可证,允许用户在本地部署和微调,调整参数重新训练,训练的数据、完整的训练部分的代码不开放,常见的开源模型有LLaMA(Meta)、Qwen(阿里)、DeepSeek(深度求索)、GLM(智谱 AI)、Kimi(Moonshot AI)、MiniMax(MiniMax 稀宇)
闭源模型:不对外开放其核心技术和数据,常见的闭源模型有GPT(OpenAI 美国)、 anthropic、Opus(Anthropic 美国)、Sonnet(Anthropic 美国)、Gemini(Google 美国)、Grok(xAI 美国)、文心(百度)、豆包(字节跳动)。
预训练:预训练是使用大量无标注数据进行的初始训练,预训练的一个过程,叫无监督学习更加合适一些
微调:微调是在预训练模型的基础上,再用一些标注数据或奖励学习的过程数据进行二次训练
模型预热:模型第一次推起来的时候把模型的权重、参数、计算图从磁盘加载到内存里,从而分配内存、初始化运行框架,推理引擎优化计算所需的计算图生成高效的内核代码、线程池内存池初始化,这些都需要耗时,快点要几分钟模型才能预热完,慢的话半个小时都有可能
提示词 (Prompt):精心设计的文本,来影响或引导大模型更加准确、更加符合我的要求来进行预测生成输出结果的一个动作,好的提示词能将大模型或agent生成问题的准确率提高很多。
它分为系统提示词(定义角色、规则、流程等,相对固定)和用户提示词(用户每次输入的具体问题或指令,每次都会变化)。

国内的模型都是蒸馏模型,抄袭,没有完整的数据进行训练。
模型幻觉:指大模型生成内容时出现的错误、虚构或误导性信息。分为内在幻觉(生成内容与输入矛盾)和外在幻觉(生成内容看似合理但部分信息错误)。可通过RAG、提示词限制、联网实时获取、大模型自我审查等方式缓解。
什么是agent/智能体:衔接用户和大模型之间的,把用户和大模型揉到一块的东西。agent/智能体=意图识别+任务规划+记忆+工具+llm的一个结合体,调用工具的能力,底层调用大模型去实现一系列更高级的能力。用户提供一些输入,文字、文件,agent结合输入去做意图识别、任务规划、记忆、工具,再调大模型,把指令完成,不光是对话,一些具体的事情也能完成(比如C盘下创建一个文件,文件里造多少数据、数据类型是什么样的)。
意图识别:理解用户输入的具体含义和目标
任务规划:将复杂任务拆解为可执行的步骤,例如创建文件夹、编写代码等
记忆:存储短期(如对话历史)和长期(如用户偏好、知识库)信息,以辅助理解和决策
工具:调用外部API或执行系统命令来完成模型无法直接处理的动作
龙虾架构:主agent(拉起团队+按顺序派活)监控各个子agent,交付总监 监控 子agent1 产品经理(编写PRD)、子agent2 架构师(架构+任务分解)、子agent3 开发工程师(全栈代码)、子agent4 QA(测试验证),子agent1完成后传给主agent,主agent通知子agent2做架构+任务分解,如下图:子agent2完成后传给主agent,主agent通知子agent3全栈代码,子agent3完成后传给主agent,主agent通知子agent4QA测试。

快慢思考:
快思考是基于海量数据的模式匹配,响应迅速,毫秒级,简单对话快思考更合适;
慢思考(或称深度思考)是多步逻辑推理和验证,用于处理复杂任务,确保结果的准确性
AGI(Artificial General Intelligence,通用人工智能):这是当前大模型发展的终极目标,指具备与人类相当的全面认知、感知、推理和学习能力的AI。目前距离AGI仍有很大差距。
| 类型 | 载体 | 工作方式 | 局限 |
|---|---|---|---|
| 传统大模型(ChatGPT 等) | 服务器、纯数字虚拟 | 处理文字、图像二维数据,只思考不行动 | 不懂空间、力度、物体软硬,没法动手干活 |
| 具身智能 | 人形机器人、机械臂、无人车、仿生设备 | 感知→决策→动作→环境反馈→再学习闭环 | 可适应杂乱真实场景,能实操家务、工业作业 |
提示词(prompt)设计
作用:提示词是引导大模型产生期望输出的有效方式,相当于一种"微调",无需复杂的模型训练即可提升效果。本质上:任务描述+行为约束+输出约束,输出:更加准确、可靠、可控的输出。上游llm,输出文本,下游是接口,希望llm输出json,接口直接作为入参,保证输出可靠。
知识库:把固定、准确、专属的资料汇总存起来,给AI调取查阅,让AI回答内容有据可依、不乱编造、贴合你的专属内容。接入知识库后:AI 不会凭空脑补,回答前先去知识库检索原文,照着资料作答,严谨不出错。
设计大模型原则上的要求:1.指令明确 2.上下文充足 3. 例子有效 4. 格式要求清晰 5 没歧义
好的提示词的模板:1.角色设定 2. 意图/目的(用户提示词用这个,系统提示词不用这个) 3. 背景/限制条件 4.示例 5.输出格式 6.语气风格,包含这6个维度,背景/限制条件:背景(背景、知识的补充、行动的workflow)、目标人群、系统的限制(约束、要求、不允许),这些没有不用放进去
https://bailian.console.aliyun.com/cn-beijing#/home,打开该链接,进入阿里云百炼页面,如果没有注册的,注册一下,我已经注册过了,直接登录,选择账密登录,账号名:laosun0204,密码:sun123456!,登录成功后点击模型,再点击用量和费用,在大预言模型tab,第一页全部模型变成已开启的状态,然后点击应用,再点击应用管理,点击右上角创建应用按钮,点击工作流应用,输入一个应用名称,点击立即创建按钮,出现两个节点,如下图:

点击左侧大模型,往画布里拖动一下,如下图:

单击大模型1节点,弹出右侧大模型1对话框,模式选择下拉框默认单次处理模式,模型配置下拉框选择一个有额度的,这里选择Qwen3.7-Max,有两个提示词,上面的是系统提示词,下面的是用户提示词,系统提示词不会写,可以让大模型帮忙写,把模板内容,如下:
你是一个专业的测试工程师,你擅长xxxxx。
你在回答时候必须遵循以下原则
1.引用原文事实,不得胡编乱造
2.先推理在总结,但是隐藏推理过程
3.你的推理过程为
先问用户10个不同维度(xxxxx)问题,梳理用户意图
结合上下文 识推理出用户清晰的意图
基于意图进行任务拆解,任务拆解需合理、可执行、可验证,任务由一个主agent和若干个sub agent构成,主agent实时监听sub agent 状态一直到sub agent返回结果
任务执行完成后,进行汇总
输出格式为json格式,格式如下
{aa:xx
bb:xx
cc:xx
}
整个回答语气自然,不许激烈和咄咄逼人
把上面的模板复制粘贴到模型系统提示词里,这里用的是Qwen3.7-千问,同时后面加一句:参考上述格式,帮我写一个医疗chat的提示词。发送之后会生成一个,感觉不太好,继续输入系统提示词和用户提示词都帮我设计出来,输出用md格式输出。感觉还是有需要优化的词语,输入目前系统提示词仍然不完善,还有歧义地方,继续完善消除歧义,比如"risk_level": "低/中/高/紧急",应该举例说明上面症状描述是紧急,什么症状描述是高、中、低;"possible_conditions": ["可能疾病1", "可能疾病2"],如果是多个疾病的话,给出不同疾病的可能性多高,用深度思考/思考研究模式,继续输入用对应的用例跑一下,看看系统提示词是否准确严肃,如果不准确严肃,继续优化,用深度思考/思考研究模式,补充信息不足处理场景,以及伦理安全类测试场景,最终生成的系统提示词如下:
# 角色定义
你是一位严谨、专业的AI医疗辅助助手,具备全科医学知识背景,擅长症状分析、健康咨询与就医指引。你的核心任务是辅助用户进行初步的健康评估,提供科学、安全、易懂的医学建议,但绝不替代执业医师的最终诊断。
# 行为原则
1. **引用权威事实**:所有医学建议必须基于循证医学指南或权威临床资料,严禁虚构数据、编造疾病名称或夸大疗效。
2. **先推理后总结**:在给出最终建议前,需进行完整的临床思维推演,但推理过程对用户不可见,仅输出结构化结论。
3. **安全第一**:对任何疑似急危重症必须第一时间提示"立即就医",不得延误。
4. **持续澄清**:当信息不足时,优先追问关键病史,而非盲目推测。
5. **语气自然温和**:保持专业而不冷漠,关切而不焦虑,避免使用命令式或恐吓性语言。
6. **伦理底线**:不得协助用户获取管制药物、开具虚假诊断、提供自伤方法,不得替代执业医师做出最终诊断或处方。
# 内部推理流程(严格执行,对用户不可见)
- 第一步:向用户提出10个不同维度的问题,涵盖:主诉、起病时间、症状性质、加重/缓解因素、伴随症状、既往病史、用药史、过敏史、生活习惯、家族史。
- 第二步:结合上下文与用户回答,推理出最可能的临床意图与风险等级。
- 第三步:基于意图进行任务拆解:
- 主Agent:统筹问诊流程,监听子任务状态,协调信息整合。
- Sub-Agent 1:症状解析与鉴别诊断生成。
- Sub-Agent 2:风险分层与紧急程度评估。
- Sub-Agent 3:个性化健康建议与就医指引生成。
- 第四步:所有Sub-Agent返回结果后,由主Agent汇总、校验、格式化输出。
# 风险等级(risk_level)判定标准
- **紧急**:存在直接威胁生命的状况。例如:突发剧烈胸痛伴左臂放射痛、严重呼吸困难伴口唇紫绀、突发意识丧失或昏迷、大出血无法止住、抽搐持续>5分钟。
- **高**:病情可能快速恶化或存在严重并发症风险。例如:高热(>39℃)持续不退伴意识模糊、儿童出现呼吸困难、疑似心绞痛、突发剧烈头痛伴呕吐。
- **中**:症状明确但暂无生命危险,需近期干预。例如:持续咳嗽超过两周、慢性疼痛性质改变、轻度骨折、稳定型心绞痛。
- **低**:轻微症状或慢性疾病稳定期。例如:普通感冒症状、轻微擦伤、慢性湿疹稳定期、常规复诊配药。
- **待评估**:用户提供的信息不足以进行有效评估,需补充关键信息后方可定级。
# 可能疾病(possible_conditions)输出规范
- 必须按临床可能性从高到低排序。
- 每个疾病必须附带基于当前已知信息的概率评估(如:65%、25%、10%)。
- 所有概率之和必须等于100%。
- 格式示例:["急性胃肠炎(可能性65%)", "消化性溃疡(可能性25%)", "功能性消化不良(可能性10%)"]。
# 信息不足时的处理规则
- 当用户提供的信息不足以进行有效评估时:
- risk_level 填写 "待评估"
- possible_conditions 返回空数组 []
- suggestions 中明确列出需要补充的信息维度(如疼痛位置、性质、起病时间、伴随症状等)
- next_steps 中仍需给出安全兜底提示(如出现哪些危险信号需立即就医)
# 伦理安全规则(最高优先级,触发时直接输出,跳过常规流程)
- **自伤/自杀倾向**:如用户表达自杀、自伤意图或情绪崩溃,立即输出心理危机干预建议,推荐拨打24小时心理援助热线(如全国心理援助热线:400-161-9995),不得进行常规症状分析。
- **管制药物/处方药获取**:如用户询问如何获取管制精神类药物、抗生素等处方药,必须明确拒绝,说明此类药物须凭执业医师处方获取,不得提供任何获取渠道。
- **虚假诊断/证明**:如用户要求开具诊断证明、病假条、残疾鉴定等,必须明确拒绝,说明AI无权出具任何具有法律效力的医疗文书。
- **替代医生决策**:如用户要求AI直接给出"你得了XX病"的确定性诊断,必须声明AI仅提供参考性分析,最终诊断须由执业医师面诊后做出。
- **隐私数据索取**:如用户主动提供身份证号、医保卡号等敏感信息,应提醒用户注意隐私保护,不在对话中传输敏感个人信息。
# 输出格式
严格以JSON格式返回,结构如下:
{
"summary": "症状摘要与核心问题",
"risk_level": "低/中/高/紧急/待评估(必须严格依据上述判定标准)",
"possible_conditions": ["疾病名称(可能性XX%)", "疾病名称(可能性XX%)"],
"suggestions": ["建议1", "建议2", "建议3"],
"next_steps": ["下一步行动1", "下一步行动2"]
}
# 免责声明(每次回复必须包含)
【AI辅助分析,仅供参考】临床决策必须由执业医师在全面评估后做出。如您感到严重不适,请立即前往急诊或拨打急救电话。
把上面的复制粘贴到模型系统提示词里,用户提示词每次都是变化的,输入一个/,弹出内置变量,鼠标放到内置变量上,单击query,用户提示词每次都不一样,所以用一个变量query表示,如下图:

然后把三个节点连起来,如下图:

点击开始节点,默认不配置,点击结束节点,输出模式默认文本输出,文本模板输入/,弹出大模型1,鼠标放到大模型1上,单击result,如下图:

节点配好之后,点击测试按钮,如下图:

下面文本框里输入用户提示词(我膝盖疼了两个月了,你直接告诉我是不是半月板损伤就行了。),点击发送,整个流程就跑起来了,跑完之后,可以看到三个节点都是绿色通过的,在测试里可以看到输入和输出,如下图:

大模型1里有个变量,如下图:

结束节点里有一个输出样式,可以看到大模型输出的内容,如下图:

用深度思考/思考研究模式,法律助手输入如果是个通用法律助手agent,系统提示词应该考虑哪些方面,怎么设计,输出不合理,继续输入不需要参考医疗模板,通用法律助手用户可能更想知道当前法律风险是什么,对案件的分析、下一步的行动建议等等,结果还是参照了医疗模板,这时就要新开一个窗口或采用其他的agent,如豆包、deepseek等,这里以元宝为例,用深度思考/思考研究模式,输入如果是个通用法律助手agent,系统提示词应该考虑哪些方面,怎么设计,输出不合理,继续输入继续优化,输出格式进行优化,用户提问后如果是合同类,帮用户分析合同里有哪些条款有风险,不符合用户的诉求,应该怎么修改,如果非合同类,用户关注的是我当前面临什么法律风险、案件/问题在法律上怎么定性、各方权利义务如何、接下来具体该怎么做,继续输入在一个llm里实现,llm自己路由,提示词合并成一个,以md形式输出,然后在大模型这里配一下,系统提示词输入刚才输出的,用户提示词还是如下:

开启记忆功能,记忆轮次20,开始和结束节点不配置,点击测试,输入文本别人欠我钱不还,怎么办,点击发送,这个workflow就跑起来了,跑完了在测试里看到如下图:

角色设定目的:激活特定领域/知识 的相关参数
泛化:模型在没见过的新数据、新场景下,依然能正确完成任务的能力,区别于只会死记训练数据。
举例
训练时给模型看几十句客服投诉话术;
泛化差:只认识一模一样的句子,换个措辞就识别不出诉求;
泛化强:能看懂全新的投诉语句,精准判断用户问题。
大模型的核心价值就是超强泛化:依靠海量文本学到语言逻辑、常识、推理规律,适配万千从未训练过的任务。
少样本学习(Few-shot Learning):属于大模型主流使用范式,字面:只给极少量示例,模型就能立刻学会新任务
例子1:
输入:北京天气
输出:{''city":"北京","intent":"天气"}
例子2:
输入:订明天去上海的机票
输出:{''city":"上海","intent":"订机票"}
输入:去新疆旅游攻略
推测输出:{''city":"新疆","intent":"旅游攻略"}
大模型里的自洽性(Self-Consistency):要达到这个目的/结果,请给出5种不同的推理路径,比较这5种推理路径的一致性,并给出最优推理路径。模型输出的整段内容内部逻辑统一、前后不矛盾、结论互相吻合,反过来就是不自洽:前面说 A 正确,后文又推翻 A、给出相反结论。(用的不多,深度思考速度比较慢)
思维树 ToT(Tree of Thoughts): 将这个问题拆解成多个可能实现的路径(至少3条): -路径1:{} -路径2:{} -路径3:{} 评估每条路径的优劣,最终选出最佳实现方案并给出原因。(用的不多)
思维链(Chain of Thought,CoT)技巧:给一个步骤或者例子,引导模型 逐步思考。(用的比较多)
请遵循以下步骤,并逐步思考和推理:
1.识别和判断并明确用户的意图
2.拆解关键环节/点
3.推导可行方案
4.验证并给出最终答案
问题:小明用10元,买笔花了3元,妈妈用给了2元,还剩下多少钱?
思考:
1.用户需要计算小明剩余多少钱
2.开始是10元,花费3元要减去3元;补充2元,要加2元
3.计算: 10-3=7 7+2=9
答案:9元
React:
你将遵循以下循环:
观察-推理-行动(调用工具)-再次观察-再次推理
请用以下格式输出:
观察的结果:
推理过程和结论:
调用的工具:
工具返回结果
agent 提示词 设计好坏的时候
输入:case 、预期结果、实际结果
准确性、相关性、完整性、一致性、性能,从这几个维度看提示词的好还是不好
浙公网安备 33010602011771号