ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

ChatGPT提示工程实战:从AI绘画到提示词调优的完整指南

ChatGPT提示工程实战:从AI绘画到提示词调优的完整指南 简介这是一本由Frank Zanish撰写、聚焦提示工程与人工智能艺术创作的英文原版电子书面向对人工智能绘画和对话式AI应用感兴趣的读者提供从基础概念到实战技巧的完整学习路径。全书共十三章系统讲解提示的构成、主题与修饰符提示、负提示与零提示、迭代式细化、ReAct提示等核心方法并围绕Midjourney等主流工具给出可落地的提示设计策略内容层次清晰、案例丰富。书中既包含原理剖析也结合Leonardo应用展示AI艺术创作案例深入探讨语言与意象对生成结果的影响帮助读者更精准地控制输出画面与对话效果。资源包内共一个PDF文件大小约为二点三一兆字节为完整电子书便于离线阅读与随时查阅。目前已有六十八人浏览学习无论是对人工智能艺术感兴趣的初学者还是希望进一步提升提示技能的从业者都能从中获得系统且有价值的参考。1. AI艺术与ChatGPT提示工程别让你和大神之间的差距卡在一条提示词上很多人玩AI艺术工具时都有一种感觉别人随手出的图又高级又有氛围感自己费半天劲写出来的提示词出图却总像“塑料质感”。问题通常不在画图模型而在你交给ChatGPT的“翻译请求”。提示工程Prompt Engineering要解决的正是“如何让大模型听懂你的创作意图再把它翻译成画图模型能执行的指令”。AI艺术这条链路上ChatGPT承担的是从“人话”到“创作脚本”的转换层它的输出质量直接决定了最终画面和文案的上限。这篇文章会带你从提示词的结构原理一路走到可复用的创作模板、故障排查和验证方法新手能照着跑通熟手也能在参数和边界上找到参照。2. 提示工程先把底子打好ChatGPT如何把你的意图翻译成画面与文字2.1 从零开始理解提示词角色、任务、约束、输出格式四要素在把ChatGPT用进AI艺术流程之前先得弄清楚一件事提示词不只是一句话而是一份“委托说明书”。常见做法是把提示词拆成四个部分角色你是谁、任务要做什么、约束不能做什么/必须满足什么、输出格式结果长什么样。这四要素缺一个模型就会用自己的默认值补上而默认值往往不符合你的审美。举个例子如果你只说“帮我写一段AI绘画提示词”ChatGPT会给出一段中规中矩的英文描述包含主体、光线、风格但很难体现你的真实需求。但如果你说“你是一位商业插画师帮我生成一段适合‘深夜便利店’场景的绘图提示词要求有赛博朋克光感、写实风格、不要出现人物脸部特写、输出为英文逗号分隔的关键词列表”结果就完全不同了。这里的原理是ChatGPT这类模型在生成时会持续预测“最可能的下一段内容”你给出的上下文越具体它越容易收敛到你想要的方向。角色设定直接改变语体和专业度任务描述框定动作约束缩小搜索空间输出格式则保证你能直接拿去用。四要素不是写作文而是参数调优——每加一个限定词就是在削掉一批你不想要的候选输出。2.2 让ChatGPT当翻译器让模型输出可用创作脚本的三个提问模板在AI艺术场景里ChatGPT最有用的角色不是“创作者”而是“翻译器”——把你的模糊感觉翻译成画图模型能执行的精确指令。下面这套模板我一直在用覆盖了大多数需求。请扮演一位资深AI艺术提示词工程师。我需要创作一张【画面主题】的作品。 请按以下要求输出 1. 主体描述画面中最重要的物体/人物具体到材质、姿态、视角 2. 环境与氛围时间、天气、光线方向、色彩基调 3. 风格标签艺术流派、媒介、画质关键词 4. 镜头与构图景别、焦距、拍摄角度 5. 负面提示词列出5个我不要出现在画面里的元素 格式要求每一部分给出3个可替换的关键词变体全部使用英文逗号分隔。我有一张AI生成的失败作品画面问题是【例如手部扭曲、光影不自然】。 请帮我把这段描述翻译成缺陷提示词用于下一次生成。 同时给出修改建议我应该调整原提示词中的哪些部分是主体描述、光线还是风格标签请帮我做风格迁移。参考风格是【梵高的星月夜】我要画【现代都市雨夜】。 请列出两种风格的共同点并把共同点转换成一组风格融合关键词 输出为可以直接粘贴到绘图工具里的提示词长度控制在50个单词以内。这三个模板分别对应“从零生成”“定向修图”“风格迁移”三类高频需求。它们的共同点在于都要求ChatGPT输出结构化内容而不是一段囫囵话。结构化的好处是可替换、可删减、可复用。你拿到输出后可以像调参数一样单独替换某一个关键词组合而不需要整段重写。另外注意模板里的“格式要求”不能省直接决定你拿到的是“一段描述”还是“一串可用关键词”。2.3 提示词的长度与细节密度什么时候该给200字什么时候20字就够很多人有个误区提示词越长越精细。在ChatGPT这里长提示词确实能降低歧义但绘图模型不一定喜欢超长输入。你在ChatGPT里写的是一回事它翻译出来后喂给绘图工具的是一回事。我一般会让ChatGPT输出两版一版是200字左右的详细描述用于我自己理解和调整另一版是20~50个标签词的极简版直接粘进绘图工具。判断依据很简单看你的画图模型是否支持自然语言描述。像Midjourney的老版本参数风格更适合短标签而DALL·E、Stable Diffusion的较新版本对自然语言长句的容错度更高。如果你不确定就让ChatGPT同时输出长句版和标签版先跑一张对比看哪个更接近你要的画面。这不是玄学是不同模型的训练数据差异——有的模型吃“描述性语言”有的模型吃“标签集合”。用两段式输出可以同时覆盖两类模型省去反复试错的时间。3. 用ChatGPT生成AI艺术创作脚本从文本到画面的完整落地3.1 让ChatGPT写出可直接喂给绘图模型的提示词这一节是真正的可抄作业环节。我常用的做法是给ChatGPT一个“角色任务输出格式”的完整指令让它输出一段英文绘图提示词。这里的关键不是让ChatGPT自由发挥而是帮你补全那些你以为说了但没说的细节。你是AI绘画提示词专家。请为“【主题】”设计一段英文绘图提示词。 要求 - 主体具体到材质、动作、表情若有 - 环境包括时间、天气、光线、背景元素 - 风格包括画派/流派、媒介、质感 - 构图包括视角、景别、镜头类型 - 负面提示词negative prompt列5项 - 输出两版一版为完整英文描述一版为英文标签逗号分隔标签版不超过40词逻辑说明这个模板把“人话”转成了两种绘图模型的语言。完整英文描述适合吃自然语言的模型标签版适合吃关键词的模型。你可能会问为什么非要英文因为大多数绘图模型的训练语料以英文为主英文提示词触发视觉特征的准确度通常更高。但这不意味着你的中文需求会被浪费——你要做的是把中文主题在ChatGPT里翻译成视觉语言而不是直接粘贴中文。参数怎么调主题越具体越好比如“深夜便利店”可以扩写成“雨夜中亮着白色灯光的24小时便利店门口有积水反射蓝色霓虹灯”。变量部分主要是“负面提示词”的数量默认5条就够如果你发现出图总带水印或总出现多余手指就把对应问题加进负面提示词。输出的标签版长度控制在40词以内超过这个长度很多绘图工具会自动截断反而丢信息。3.2 负面提示词与风格迁移用ChatGPT做风格参数卡负面提示词negative prompt是AI艺术里性价比最高的参数之一。之前在绘图工具里负面提示词一般写成“lowres, bad anatomy, bad hands, text, watermark”这类固定组合。但固定组合有个问题每个主题的“缺陷”不一样。画人像时最怕手部畸形画建筑时最怕结构扭曲画风景时最怕色彩溢出。ChatGPT能做的是帮你生成一套针对特定主题的“缺陷黑名单”。我一般会这样提问我正在用【绘图工具名称】生成【主题】图片请帮我把以下常见问题翻译成负面提示词 常见问题画面模糊、构图倾斜、颜色失真、主体过小、背景杂乱、多余文字、水印、阴影错误。 请按严重程度排序输出为英文逗号分隔格式每条不超过3个单词。逻辑说明这一步本质上是在做“关键词屏蔽”。绘图模型在去噪过程中会参考负面提示词里的概念从而避开这些特征。ChatGPT帮你做的工作是“概念到关键词”的映射——它把“画面模糊”转换成“blurry, out of focus, low detail”这类模型能理解的语言。不同绘图模型的负面提示词敏感度不一样Stable Diffusion对负面词响应比Midjourney更直接所以如果你在Midjourney里发现负面词效果不明显就该考虑把负面语义转换成正面描述比如把“不要模糊”换成“sharp focus, high detail”。参数建议负面提示词不要堆太多10~15个词组是常见上限。超过这个量模型会开始出现“过度规避”——比如你把“树”加进负面词画面里连树叶纹理都会被抹掉。如果发现出图变“空”了第一个要检查的就是负面词有没有误伤主体。3.3 一个完整的生成工作流从需求到出图的两轮对话把上面的内容串起来一个可复现的完整工作流是这样跑的第一轮对话把原始需求交给ChatGPT我想创作一张【广告海报风格】的AI艺术图。 主题【画面内容】 用途【电商主图/个人作品/社交媒体配图】 请输出 1. 画面详细描述中文200字内 2. 英文绘图提示词标签版40词内 3. 负面提示词英文10项内 4. 画图工具参数建议如果你知道【工具名】的常用参数第二轮对话对生成结果做定向修正按你给的提示词我生成了一张图出现以下问题【问题1】【问题2】。 请帮我把原提示词拆解成若干“片段”并告诉我哪些片段导致了这些问题。 然后给出修改后的完整提示词只修改必要部分其他保持不变。这两轮对话的价值在于“可控性”。第一轮解决的问题是从无到有第二轮解决的是从有到优。你会发现把ChatGPT输出的提示词片段化之后每次翻车只需要替换一两个片段而不是从零再来。这也解释了为什么提示工程不只是一门“写词”的手艺——它是一套“生成-验证-定位-修改”的闭环。你越早建立这个闭环出图的稳定性越高。很多人在这一步犯的错是每次都在翻译工具里微调却不让ChatGPT参与归因结果同样的坑反复踩还以为是模型不行。4. 提示工程在文本创作里的实战标题、故事板与分镜脚本4.1 给ChatGPT立人设用系统提示词固定输出风格AI艺术不只是画图。做短视频分镜、写概念设定、生成文案脚本都是ChatGPT提示工程的用武之地。很多人的文本生成翻车是因为从头到尾没有给人设——ChatGPT在没有角色约束时默认用最“稳妥”的中性语气输出这种语气在创作场景里往往是灾难像AI写的不像人写的。我这边的常见做法是每次创作类任务前先给一段“角色卡”这段卡可以固定下来复用你现在是一位【独立游戏美术指导】。你的特点 - 说话直接不写套话 - 所有描述都要包含具体的光线、材质、色彩倾向 - 拒绝使用“梦幻”“唯美”这类空泛词 - 每给出一个方案必须附带一个备选方向 - 如果需求不明确先提出3个关键问题而不是直接开写这段“角色卡”就是系统提示词的雏形。它会持续影响之后的每一轮输出直到本轮对话结束。注意角色卡里的“拒绝使用空泛词”和“先提问”这两条——它们对应的是模型常见的两种翻车模式堆形容词、没问清楚就猜。把这两个坑写进角色卡能省掉大量后处理。4.2 多轮对话调优让模型按你的审美迭代一次对话往往不够你需要的是“审美对齐”。我会在给ChatGPT反馈时带上“具体问题期望方向”而不是只说“不好看”或“再改改”。模型无法理解“不好看”这种主观评价但它能理解“把主色调从暖黄改成冷蓝”这种具体指令。你写的分镜脚本用不了。问题 1. 第一个镜头的光线描述写的是“黄昏暖光”但我需要的是“雨后冷青色街道” 2. 第二个镜头的镜头语言太普通我需要“从地面的积水反射中引入人物” 3. 对白部分太书面我需要口语化、带一点不耐烦的语气 请只修改这三处其他镜头保持原样。这条指令的关键是“只修改这三处”。没有这句话模型经常会把你没提的部分也重写一遍导致改完一个问题又冒出来三个新问题。加了这个约束后输出的变更范围可控你只需要检查修改点是否满足要求。多轮调优的本质是“小步快跑”一次只改一个维度——光线、构图、语气、节奏改完立刻验证验证完再提下一轮。这种节奏比一次性给出一堆反馈更容易让模型稳定收敛。4.3 模板化提示词把自己常用的创作套路存成复用单元用得顺手之后你会发现真正有价值的不是某一段提示词而是“可复用的提示词框架”。我会把自己常用的框架存成文本片段每次用到时直接替换关键词。【文风转换】请把下面这段话改写成【风格】风格。 要求保留原意但替换所有形容词和副词输出后附上改写说明 你替换了哪些词、为什么这样替换。 原文【粘贴内容】 【故事延伸】以上是一段【世界观】设定。请基于此生成3个支线事件 每个事件必须有触发条件、冲突点、奖励或代价。 事件之间不能互相矛盾并给出事件与核心设定的因果链。 【方案对比】针对【问题】给出3个解决方案。 每个方案按以下格式 - 名称与一句话概述 - 实施步骤不超过3步 - 最大风险 - 适用场景判断标准把这些模板化之后你的提示词就不再是散落的灵感而是可以被组合的模块。做AI艺术内容时我经常把“文风转换”和“故事延伸”拼在一起先用故事延伸生成事件再用文风转换把它改写成剧本语气。这套玩法不需要记住复杂的提示词语法核心就一条让每个模板只负责一件事然后像流水线一样把它们串起来。调参空间在于模板里的“数量”——事件数量、步骤数量、备选方案数量都可以按需求改但我建议不要贪多每轮模板的输出控制在3~5个结果太多结果模型会为了凑数降低质量。5. 常见问题与避坑排查提示词失效和客户端故障都在这5.1 提示词写了跟没写一样为什么模型就是不听话现象你给ChatGPT写了一大段详细的提示词但它输出的内容仍然泛泛而谈或者答非所问。 原因最常见的是“提示词内部冲突”——你的角色指令、任务指令和约束指令互相打架。比如一边让它“用专业术语”一边又要求“通俗易懂”模型会陷入两难最终输出两头都不靠的中间态。另一个高发原因是“想要的没写不想要的写了很多”模型默认你没有提到的东西都按常见设定处理你没指定光线它就会用最常见的方向光这未必是你想要的。 解决把提示词按“角色、任务、约束、输出格式”四要素拆开逐项检查组内一致性。我一般会先删掉所有否定句把“不要用暗色调”改成“用明亮色调”再看任务描述里有没有明确动作。剩下还不行就换一个角色设定再试——有时候是模型对这个角色的理解和你不一样换“资深摄影师”和“商业插画师”可能拿到完全不同角度的输出。5.2 模型输出偏了十万八千里负面提示词的边界怎么控现象你在负面提示词里写了“不要人物”画面里还是出现了人或者写了“不要模糊”画面反而更模糊。 原因负面提示词不是“删除命令”它是在概率分布上压低某些概念的出现概率。如果你负面词里同时出现“人物”和“不要”模型可能把“人物”这个词本身理解成需要强调的主题。另一个原因是负面词与被生成目标冲突你画的是城市风景负面词里写“不要建筑”模型为了回避建筑会把整个场景改成荒郊野岭——这不是它听懂了而是它避开了所有建筑类概念后城市感就没了。 解决负面提示词只写“模型常见缺陷类”的词比如低画质、畸形、水印、文字。不要写“主题相关”的概念。如果你一定要排除某个主体把主语换到正面描述里想画“没有人的街景”正面词写“empty street, no people, abandoned”。同时负面词控制在10项以内多出来的“不要”会让模型失去方向。5.3 ChatGPT客户端启动与配置故障config.toml、模型不支持、无画面现象桌面版ChatGPT突然无法加载config.toml提示“无法加载config.toml因此此对话串无法继续”或者客户端报了“the gpt-5.6-sol model is not supported when using codex with a chatgpt account”这类模型不支持错误还有启动后只有进程没有画面、Windows版一直显示重连。 原因config.toml是ChatGPT桌面版的本地配置文件通常由客户端自动维护。加载失败多数是因为升级或安装过程中写入权限不足文件损坏或者旧版本残留的配置格式与新版不兼容。模型不支持的错误一般是本地会话历史里缓存了某个已下线的模型标识客户端在恢复对话时按旧标识发起请求导致失败。没有画面则往往和显卡驱动、图形加速或系统进程残留有关。 解决先关掉所有ChatGPT进程打开任务管理器结束仍在后台的ChatGPT进程。然后找到配置目录把config.toml重命名备份为config.toml.bak再启动客户端让它重新生成一份默认配置——这一步相当于手动“重置配置文件”是最常用的恢复手段。如果仍提示模型不支持删除当前对话会话或清除缓存会话数据重新发起新对话。对于没有画面的情况先检查显卡驱动是否有更新再以管理员身份运行客户端。最后的手段是彻底卸载并清空残留目录后重装装回当前稳定版本即可。注意备份你的对话历史文件重装前确认备份位置。5.4 输出被“降智”或过于保守在不出界的前提下换表达路径现象你按自己的风格写提示词ChatGPT却输出一堆模板化、四平八稳的内容显得“降智”或者你让它在创作里加一点冲突情节它直接拒绝或把暴力冲突替换成轻描淡写。 原因模型输出侧的安全过滤机制会拦截包含暴力、血腥、违法违规、隐含意识形态倾向等敏感元素的请求。提示词里只要出现容易被关联的敏感词整段输出会被重写为更安全的版本表现为“答非所问”或“废话连篇”。这不是模型变笨了是安全层接管了输出。 解决把敏感触发词替换成中性描述。想表达“战斗后的废墟”不要写“血腥战斗”写“战后场景的残破结构、零散物件、冷色调光线”想表达“紧张冲突”用“对峙气氛、压低的对白、静默的特写”来代替直接的冲突词。核心思路是你描述的是画面元素和情绪氛围而不是事件定性。这样既能保住创作自由度又不会触发安全拦截。如果确实需要讨论敏感话题说明超出工具能力边界建议直接放弃这条提示词换个可落地的方向。6. 验证你的提示词质量从单次输出到可复用的评估清单提示词改到第七八版还不出效果时别急着换工具先做一次系统验证。我现在每写一套创作提示词都会按下面这张清单逐项打分每一项1~5分检查项验证方法合格标准角色清晰度删除角色设定后对比输出删除后输出明显变差说明角色生效任务聚焦度看输出中有没有跑题段落核心动作占输出主体没有多余旁逸约束有效性把负面提示词逐个删除再生成删除后问题出现说明该约束有效输出可复用性不修改直接粘进目标工具能直接运行不用二次改写迭代收敛性连续问三次同一提示词输出核心方向一致细节变化不影响使用实际操作时我一般先测“角色清晰度”——这是翻车重灾区。把角色设定删掉再跑一次同样任务如果两个输出差别不大说明角色设定没有真正生效需要换表述。再测“约束有效性”逐条验证负面提示词里的每一项是否都有实际作用没用的删掉免得干扰模型。最后说一个我自己的教训以前做AI艺术总想着一步到位写完提示词就冲去出图结果十张里九张要返工。后来改成“先让ChatGPT出方案再按评估清单逐项过滤过滤完再真正生成”效率反而翻倍。提示工程的本质不是把模型调教得多聪明而是把你自己要什么这件事想清楚让模型有据可依。这套评估清单你可以在ChatGPT里存成一个常驻提示词每次让它按清单自检一遍输出比自己逐字检查快得多。希望帮到你也欢迎带着你的踩坑案例来一起补这张清单。本文还有配套的精品资源点击获取
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进