LLM 推理参数工程基准规范
大模型(LLM)推理参数工程基准规范
一张表看完推荐参数、支持配置和避坑要点。默认建议统一锁定 Top_p=1.0,主要通过 Temperature 控制发散度;
对结构化输出和推理模型则优先靠格式约束与Promp边界管理。
| 任务类型 | 典型场景 | 推荐参数与支持配置 | 核心理由与避坑 |
|---|---|---|---|
|
确定性任务
0 幻觉 / 强约束 |
分类 / 意图路由
标签提取、状态判断
|
Temp0 Top_p1.0
logprobs=true stop=["\n"]
|
稳定优先:相同输入尽量得到相同输出。
置信度兜底:可用 logprobs 标记低置信度样本,再转人工或规则处理。
|
|
数据提取 / SQL
JSON 抽取、Text2SQL
|
Temp0 Top_p1.0
结构化输出 / JSON Schema SQL: stop=[";"]
|
语法零容忍:字段、括号、标点错误都可能直接导致失败。
必须启用模型原生 JSON Mode 或等价结构化约束。
|
|
|
代码生成 / Bug 修复
Coding、补全、重构
|
Temp0 Top_p1.0
max_tokens 尽量给足 禁用 stop=["\n\n"]
|
贪心解码更稳:更利于减少代码路径飘忽和小 Bug。
双换行 stop 容易让长函数、类定义在中途被截断。
|
|
|
约束生成任务
忠于原文 / 自然表达 |
知识库问答
RAG、客服问答
|
Temp0.2 Top_p1.0
frequency_penalty=0.1 Prompt 强制引述依据
|
核心目标:减少胡编,同时避免回答过于僵硬。
回复必须围绕检索证据生成,不能脱离资料自由发挥。
|
|
摘要 / 翻译
长文本处理、润色改写
|
Temp0.4 Top_p1.0
保证充足上下文窗口 必要时补格式约束
|
平衡信达雅:既保留原意,也让表达更顺。
适度随机性可减少直译感和模板感。
|
|
|
开放生成任务
创意 / 多样 / 拟人 |
多轮对话
陪伴、AI 角色、聊天助手
|
Temp0.7 Top_p1.0
携带历史 messages frequency_penalty=0.2
|
目标是自然感:允许表达轻微波动,提升对话连续性。
频率惩罚可减轻复读、口头禅和模板化回答。
|
|
创意写作
营销文案、头脑风暴、灵感发散
|
Temp0.9 Top_p1.0
presence_penalty=0.3 必要时附风格样例
|
鼓励新意:更适合不同切入角度和表达变体。
仍需靠 Prompt 限定边界,避免发散成无关废话。
|
注意点
- 联合调参禁忌:Temperature 和 Top_p 都能控制随机性,日常只调一个。推荐统一锁定 Top_p=1.0,只通过 Temperature 控制发散度,方便复现和排错。
- 惩罚因子区别:Frequency Penalty 用来减少重复,适合 RAG 和防复读;Presence Penalty 用来鼓励引入新话题,适合创意写作和头脑风暴。
- 结果复现:做自动化测试或 Eval 时,优先使用 Temperature=0 并固定 Seed(如 42),方便比较不同 Prompt 的真实效果差异。
- 推理模型特例:对于 o1 / o3 / DeepSeek-R1 这类深度推理模型,通常不要试图靠调低温度强行限制它;更有效的方法是通过 Prompt 明确思考边界。
给团队的建议: 开发新功能时遵循“先稳后优”。先用 Temperature=0 跑通主干流程、解析逻辑和异常分支,确认 Prompt 与输出结构可靠后,再按业务需要逐步加温度,例如让客服更自然、文案更多样。
浙公网安备 33010602011771号