AIGC 提示词工程:文字、图片、视频的提示词结构与技巧
三种模态的提示词本质相同:先固定不变量,再描述变量,最后给约束。区别在于每种模型"读"的重点不同——文字模型读指令层级,图像模型读名词与空间关系,视频模型读时间轴上的动作变化。把这三者的结构和技巧分开梳理一遍。
一、总览:三种模态的差异
| 维度 | 文字(小说) | 图片 | 视频 |
|---|---|---|---|
| 模型读什么 | 指令层级、角色、约束 | 名词、形容词、空间关系 | 时间轴上的状态变化 |
| 权重机制 | 靠标题/分层结构区分优先级 | 靠词序,越前权重越高 | 靠时间分段与分号断句 |
| 一次能生成多少 | 长(数千字),但要分章 | 一张静态画面 | 数秒,动作数量极有限 |
| 最大难点 | 文风漂移、设定遗忘 | 多主体混乱、数量失控 | 动作崩坏、物理连续性 |
| 主要控制手段 | 分层提示词 + 文风选段 | 定向堆叠 + 负向提示词 | 图生视频 + 首尾帧接续 |
二、文字(小说)类提示词
2.1 结构:四层控制
小说提示词的核心是分层——设定层跨章节稳定复用,任务层驱动单次生成,文风层与约束层守住输出质量。
2.2 可复用模板
【设定层】
世界观:<规则、时代、地理、力量体系>
主角:<姓名>,<身份>。核心动机是<…>。说话习惯:<具体语言特征>。
配角:<姓名>,与主角关系<…>,本卷作用<…>。
前情:<上一章结尾发生了什么,主角当前处境>
伏笔:<已埋但未收的线>
【任务层】
本章目标:<这一章必须完成的情节推进>
场景序列:
1. 开场:<钩子,制造问题>
2. 中段:<冲突升级,至少一次反转>
3. 收尾:<留悬念,不要解决问题>
【文风层】
叙述视角:第三人称限制视角,紧跟主角
节奏:对话驱动,避免大段环境描写
参考文风(务必模仿其句长与用词习惯):
<粘贴 200 字你的目标文风选段>
【约束层】
字数:2500~3000 字
禁忌:不要总结陈词;不要用"然而、于是"过度衔接;不要出现现代词汇;不要替角色解释情绪,只写行为
2.3 技巧要点
| 技巧 | 做法 |
|---|---|
| 人物卡写"行为"不写"标签" | 不写"性格开朗",写"习惯用反问句怼人、被夸时会移开视线"——模型只能复现行为,无法执行性格标签 |
| 少量示例胜过形容词 | 贴 200 字目标文风选段,比"文笔优美凝练"有效十倍 |
| 反向指令要具体 | 写成"避免总结陈词"而不是"不要写得太差";禁忌清单放提示词末尾,位置越后越容易被遵守 |
| 长篇靠续写不靠一次生成 | 每章单独一个任务层,设定层保持不变;用"前情提要"替代把全文塞进上下文 |
| 用"行为指令"控制节奏 | "这一章至少一次反转""每 300 字出现一次对话",比"写得精彩一点"可执行 |
| 情绪与心理活动外化 | 要求"只写行为与环境,不写内心独白",比让模型"描写悲伤"更不容易落入俗套 |
三、图片提示词
3.1 结构:七要素定向堆叠
图像模型不理解从句逻辑,它读的是名词、形容词和空间关系。结构上按"主体 → 状态 → 环境 → 构图 → 光影色调 → 风格 → 参数"排列,越靠前的词权重越高。
3.2 可复用模板
正向:
<主体:谁/什么,外观特征>,
<状态:动作或姿态、材质、情绪外化的表情>,
<环境:地点、时间、天气、背景元素>,
<空间关系:左边…右边…前景…背景…>,
<构图:景别(特写/中景/全景)+ 视角(平视/俯视/仰视)+ 镜头(35mm/长焦)>,
<光影:光源方向 + 光质 + 色调>,
<风格:媒介 + 流派 + 参考>,
<参数:画面比例、质量词>
负向:
低分辨率, 模糊, 变形, 多余手指, 多肢体, 水印, 文字, 签名, 杂乱背景, 过曝
3.3 技巧要点
| 技巧 | 说明 |
|---|---|
| 名词优先,少用抽象形容 | "长焦压缩、浅景深、f/1.8"比"很有电影感"可执行;抽象词只能做微调,不能承担主要描述 |
| 多主体必写空间关系 | "左边一只猫、右边一只狗"比"两只猫和一只狗"成功率高得多 |
| 数量词精确 | "两个女孩牵手"有效;"几个女孩在街上"必然失控 |
| 风格用三段式定位 | "媒介 + 流派 + 视觉特征"(水彩 + 扁平插画 + 高饱和低对比),比单独堆艺术家名字稳定 |
| 迭代改词不重写 | 一次只动一个变量,先定构图再调光影,否则不知道哪个词起了作用 |
| 文字交给后期 | 模型画不好画面内的招牌与字幕,用负向提示词排除,出图后再叠 |
| 反向提示词要"正向化" | 不要写"不要模糊",直接写"清晰锐利";负向栏只放具体缺陷名词 |
四、视频提示词
4.1 结构:时间轴上的四段信息
视频的核心差异是时间轴。图片只需要一张画面,视频需要"起点状态 → 变化过程 → 终点状态",再叠上镜头自身的运动。模型最难处理的是动作与物理连续性,所以运动要写得像分镜脚本。
4.2 可复用模板
【首帧】<场景 + 主体外观 + 光线,等同于一条完整的图片提示词>
【动作】<主体> 缓慢地 <单一动作>(分号分隔,不要堆叠多个动作)
【镜头】镜头 <一种运动>,<速度副词>,<焦段/景深>
【氛围】<色调 + 天气 + 情绪基调>,结尾 <状态变化>
示例:
清晨薄雾中的湖面,一只白羽白鹭静立浅滩,柔和冷调自然光;
白鹭低头猛地啄向水面,水花缓慢溅起;
镜头缓慢右移跟随,浅景深;
薄雾渐散,暖光洒落,宁静收尾。
4.3 技巧要点
| 技巧 | 说明 |
|---|---|
| 图生视频比文生视频稳 | 先用图片提示词做好首帧,再让视频模型"让这张图动起来",主体一致性远高于纯文字 |
| 动作要单一 | "她转身并对镜头挥手"可行;"她转身、拿起伞、走出房间、回头微笑"必然崩坏——拆成多段再剪辑 |
| 镜头运动与主体动作分开写 | 用分号或分行隔开"主体动作;镜头缓慢推进",混写会导致两者都失控 |
| 越平凡的词越稳定 | "缓慢、轻微、自然"出好结果;"剧烈、炫酷、史诗感"诱发变形和鬼影 |
| 物理交互是雷区 | 手持物体、打字、吃饭等精细交互最难,能避开就避开 |
| 长视频靠首尾帧接续 | 分段生成时用上一段尾帧做下一段首帧,保持连贯 |
| 时长为先 | 先按模型支持的时长(常见 4~8 秒)规划分镜,再写提示词,而不是写完再裁 |
五、三条通用原则
- 具体压倒抽象——可执行的物理描述 > 情绪形容词。三个模态都一样:写"行为/参数",不写"感觉"。
- 一次只改一个变量——控制变量法迭代,否则无法归因,也复现不出好结果。
- 结构化分隔——文字用分层标题,图片用逗号分隔的定向堆叠,视频用分号分段。本质相同:让模型一眼分清哪部分是设定、哪部分是任务、哪部分是约束。
示例是最强的控制手段:文字贴文风选段,图片与视频贴参考图,都胜过任何形容词。
六、常见失败与对策
| 现象 | 根因 | 对策 |
|---|---|---|
| 小说文风像 AI 味 | 缺少文风锚点 | 贴文风选段,并禁止"总结陈词"类句式 |
| 小说前后设定矛盾 | 设定层没有持久化 | 把设定层固定为独立提示词,每章复用 |
| 图片主体特征漂移 | 主体描述太抽象 | 具体到颜色、材质、服装细节,或用参考图 |
| 图片数量、人数出错 | 数量词模糊 | 写准确数字,并配合负向提示词排除多余肢体 |
| 视频动作变形 | 一次要求太多动作 | 单动作拆段,逐段生成再剪辑 |
| 视频主体换脸 | 纯文生视频缺乏锚点 | 改用图生视频,用首帧锁死外观 |
| 画面出现乱码文字 | 模型文字能力弱 | 负向提示词排除文字,后期叠加 |
如果这篇文章对你有用,可以关注本人微信公众号获取更多ヽ(^ω^)ノ ~


浙公网安备 33010602011771号