Fork me on GitHub

AIGC 提示词工程:文字、图片、视频的提示词结构与技巧

三种模态的提示词本质相同:先固定不变量,再描述变量,最后给约束。区别在于每种模型"读"的重点不同——文字模型读指令层级,图像模型读名词与空间关系,视频模型读时间轴上的动作变化。把这三者的结构和技巧分开梳理一遍。

一、总览:三种模态的差异

维度 文字(小说) 图片 视频
模型读什么 指令层级、角色、约束 名词、形容词、空间关系 时间轴上的状态变化
权重机制 靠标题/分层结构区分优先级 靠词序,越前权重越高 靠时间分段与分号断句
一次能生成多少 长(数千字),但要分章 一张静态画面 数秒,动作数量极有限
最大难点 文风漂移、设定遗忘 多主体混乱、数量失控 动作崩坏、物理连续性
主要控制手段 分层提示词 + 文风选段 定向堆叠 + 负向提示词 图生视频 + 首尾帧接续

二、文字(小说)类提示词

2.1 结构:四层控制

小说提示词的核心是分层——设定层跨章节稳定复用,任务层驱动单次生成,文风层与约束层守住输出质量。

小说提示词分层结构 小说提示词由外到内分为设定层、任务层、文风层、约束层四个嵌套区域 设定层(持久,跨章节复用) 世界观与规则 力量体系 / 时代背景 人物卡 动机 / 口癖 / 关系 前情提要 已发生剧情 / 伏笔 任务层(单次生成的核心) 本章目标:发生什么事、推进到哪 场景序列:钩子 → 冲突 → 悬念 文风层 + 约束层(输出护栏) 叙述视角 / 时态 / 节奏 字数与格式要求 禁忌清单:不许写什么

2.2 可复用模板

【设定层】
世界观:<规则、时代、地理、力量体系>
主角:<姓名>,<身份>。核心动机是<…>。说话习惯:<具体语言特征>。
配角:<姓名>,与主角关系<…>,本卷作用<…>。
前情:<上一章结尾发生了什么,主角当前处境>
伏笔:<已埋但未收的线>

【任务层】
本章目标:<这一章必须完成的情节推进>
场景序列:
  1. 开场:<钩子,制造问题>
  2. 中段:<冲突升级,至少一次反转>
  3. 收尾:<留悬念,不要解决问题>

【文风层】
叙述视角:第三人称限制视角,紧跟主角
节奏:对话驱动,避免大段环境描写
参考文风(务必模仿其句长与用词习惯):
<粘贴 200 字你的目标文风选段>

【约束层】
字数:2500~3000 字
禁忌:不要总结陈词;不要用"然而、于是"过度衔接;不要出现现代词汇;不要替角色解释情绪,只写行为

2.3 技巧要点

技巧 做法
人物卡写"行为"不写"标签" 不写"性格开朗",写"习惯用反问句怼人、被夸时会移开视线"——模型只能复现行为,无法执行性格标签
少量示例胜过形容词 贴 200 字目标文风选段,比"文笔优美凝练"有效十倍
反向指令要具体 写成"避免总结陈词"而不是"不要写得太差";禁忌清单放提示词末尾,位置越后越容易被遵守
长篇靠续写不靠一次生成 每章单独一个任务层,设定层保持不变;用"前情提要"替代把全文塞进上下文
用"行为指令"控制节奏 "这一章至少一次反转""每 300 字出现一次对话",比"写得精彩一点"可执行
情绪与心理活动外化 要求"只写行为与环境,不写内心独白",比让模型"描写悲伤"更不容易落入俗套

三、图片提示词

3.1 结构:七要素定向堆叠

图像模型不理解从句逻辑,它读的是名词、形容词和空间关系。结构上按"主体 → 状态 → 环境 → 构图 → 光影色调 → 风格 → 参数"排列,越靠前的词权重越高。

图片提示词解剖 图片提示词从左到右按权重递减排列七个要素,上方为示例填充 示例:一只湿漉漉的黑猫,蜷缩在窗台上,窗外雨夜霓虹街道, 特写镜头浅景深,冷蓝色调逆光,赛博朋克插画风格 主体 是什么 权重最高 状态 动作 / 材质 蜷缩 / 湿漉漉 环境 地点 / 背景 空间关系 构图 景别 / 视角 特写 / 俯视 光影色调 光源 / 氛围 逆光 / 冷调 风格 + 参数 画种 / 媒介 比例 / 质量词 负向提示词 从左到右权重递减:最重要的信息放最前面 负向提示词单独放:低质量 / 多余手指 / 水印 / 文字,不要混在正向描述里

3.2 可复用模板

正向:
<主体:谁/什么,外观特征>,
<状态:动作或姿态、材质、情绪外化的表情>,
<环境:地点、时间、天气、背景元素>,
<空间关系:左边…右边…前景…背景…>,
<构图:景别(特写/中景/全景)+ 视角(平视/俯视/仰视)+ 镜头(35mm/长焦)>,
<光影:光源方向 + 光质 + 色调>,
<风格:媒介 + 流派 + 参考>,
<参数:画面比例、质量词>

负向:
低分辨率, 模糊, 变形, 多余手指, 多肢体, 水印, 文字, 签名, 杂乱背景, 过曝

3.3 技巧要点

技巧 说明
名词优先,少用抽象形容 "长焦压缩、浅景深、f/1.8"比"很有电影感"可执行;抽象词只能做微调,不能承担主要描述
多主体必写空间关系 "左边一只猫、右边一只狗"比"两只猫和一只狗"成功率高得多
数量词精确 "两个女孩牵手"有效;"几个女孩在街上"必然失控
风格用三段式定位 "媒介 + 流派 + 视觉特征"(水彩 + 扁平插画 + 高饱和低对比),比单独堆艺术家名字稳定
迭代改词不重写 一次只动一个变量,先定构图再调光影,否则不知道哪个词起了作用
文字交给后期 模型画不好画面内的招牌与字幕,用负向提示词排除,出图后再叠
反向提示词要"正向化" 不要写"不要模糊",直接写"清晰锐利";负向栏只放具体缺陷名词

四、视频提示词

4.1 结构:时间轴上的四段信息

视频的核心差异是时间轴。图片只需要一张画面,视频需要"起点状态 → 变化过程 → 终点状态",再叠上镜头自身的运动。模型最难处理的是动作与物理连续性,所以运动要写得像分镜脚本。

视频提示词时间轴结构 视频提示词分四个横向时间段:起始画面、主体动作、镜头运动、氛围收尾 示例:清晨薄雾中的湖面,一只白鹭静立浅滩;白鹭低头猛地啄水, 水花溅起慢动作;镜头缓慢右移跟随,浅景深;冷调柔光,清晨氛围 一条视频提示词 = 四段信息的组合 首帧(起点) 开场画面是什么 可用一张参考图 锁定主体外观 写得越具体 漂移越小 主体动作 谁做了什么 单一明确动作 转向 / 走动 / 挥手 一次视频别超过 一到两个动作 镜头运动 推 / 拉 / 摇 / 移 / 跟 一次只用一种 写运动速度 缓慢推近 而非动感运镜 氛围与收尾 光线 / 天气 / 情绪 贯穿全程的环境 变化(雨变小) 可写结尾状态 避免戛然而止 时间轴从左到右:首帧状态 → 动作发生 → 镜头配合 → 结束状态

4.2 可复用模板

【首帧】<场景 + 主体外观 + 光线,等同于一条完整的图片提示词>
【动作】<主体> 缓慢地 <单一动作>(分号分隔,不要堆叠多个动作)
【镜头】镜头 <一种运动>,<速度副词>,<焦段/景深>
【氛围】<色调 + 天气 + 情绪基调>,结尾 <状态变化>

示例:
清晨薄雾中的湖面,一只白羽白鹭静立浅滩,柔和冷调自然光;
白鹭低头猛地啄向水面,水花缓慢溅起;
镜头缓慢右移跟随,浅景深;
薄雾渐散,暖光洒落,宁静收尾。

4.3 技巧要点

技巧 说明
图生视频比文生视频稳 先用图片提示词做好首帧,再让视频模型"让这张图动起来",主体一致性远高于纯文字
动作要单一 "她转身并对镜头挥手"可行;"她转身、拿起伞、走出房间、回头微笑"必然崩坏——拆成多段再剪辑
镜头运动与主体动作分开写 用分号或分行隔开"主体动作;镜头缓慢推进",混写会导致两者都失控
越平凡的词越稳定 "缓慢、轻微、自然"出好结果;"剧烈、炫酷、史诗感"诱发变形和鬼影
物理交互是雷区 手持物体、打字、吃饭等精细交互最难,能避开就避开
长视频靠首尾帧接续 分段生成时用上一段尾帧做下一段首帧,保持连贯
时长为先 先按模型支持的时长(常见 4~8 秒)规划分镜,再写提示词,而不是写完再裁

五、三条通用原则

  1. 具体压倒抽象——可执行的物理描述 > 情绪形容词。三个模态都一样:写"行为/参数",不写"感觉"。
  2. 一次只改一个变量——控制变量法迭代,否则无法归因,也复现不出好结果。
  3. 结构化分隔——文字用分层标题,图片用逗号分隔的定向堆叠,视频用分号分段。本质相同:让模型一眼分清哪部分是设定、哪部分是任务、哪部分是约束。

示例是最强的控制手段:文字贴文风选段,图片与视频贴参考图,都胜过任何形容词。

六、常见失败与对策

现象 根因 对策
小说文风像 AI 味 缺少文风锚点 贴文风选段,并禁止"总结陈词"类句式
小说前后设定矛盾 设定层没有持久化 把设定层固定为独立提示词,每章复用
图片主体特征漂移 主体描述太抽象 具体到颜色、材质、服装细节,或用参考图
图片数量、人数出错 数量词模糊 写准确数字,并配合负向提示词排除多余肢体
视频动作变形 一次要求太多动作 单动作拆段,逐段生成再剪辑
视频主体换脸 纯文生视频缺乏锚点 改用图生视频,用首帧锁死外观
画面出现乱码文字 模型文字能力弱 负向提示词排除文字,后期叠加
posted @ 2026-09-16 21:26  秋夜雨巷  阅读(21)  评论(0)    收藏  举报