动手实战 · 从能跑的 Demo 到能用的产品

用 AI 给 AI 写 Prompt

用户说「画个夕阳下的猫」,生图模型需要的是完全不同的描述,解法是用 LLM 做翻译

本页解决的问题

先给结论

「用 AI 给 AI 写 Prompt」要解决的关键问题是什么?

用户说「画个夕阳下的猫」,生图模型需要的是完全不同的描述,解法是用 LLM 做翻译

判断标准

让这个结论先证明自己值得留下。 把这一页当成决策工具,而不是需要背下来的定义。把概念连到一个真实任务、一个可观察结果,以及一个能改变你判断的失败上。

下一步

写下一个问题:试完这个方法后,你能用什么证据回答它?

常见误区

结论听起来很完整,却没有检查最关键的假设。

示例一:阳台发呆
用户说
「该角色 在阳台发呆」
LLM 翻译成生图 Prompt
A young woman named 该角色 standing on a sunlit balcony, leaning against the railing, gazing into the distance with a dreamy expression. She has shoulder-length dark hair, wearing a white blouse with a small star necklace. Soft afternoon golden hour lighting, potted plants on the balcony, blurred city skyline in background. Illustration style, warm color palette, peaceful mood. Upper body to full body composition.
再来一个例子
示例二:早晨做饭
用户说
「该角色 在做饭」
LLM 翻译成生图 Prompt
A young woman named 该角色 in a bright modern kitchen during morning time, cooking breakfast. She has shoulder-length dark hair, wearing a casual cardigan over a white top with a star necklace. Warm natural light streaming through windows, kitchen utensils and ingredients on counter, steam rising from pan. Illustration style, cozy domestic atmosphere, soft warm tones. Wide shot showing kitchen environment.
为什么需要这一层翻译?
① 用户不会写生图 Prompt:他不知道要指定 golden hour lighting 还是 illustration style
② 生图模型无法理解模糊意图:「发呆」对模型来说不是一个视觉描述
③ 每个生图模型的方言不同:Midjourney、DALL-E、Stable Diffusion 偏好的 Prompt 风格各异
用户想的和生图模型需要的是完全不同的语言。在 该角色 里,每一次出图背后都有一个 LLM 在翻译:把用户的一句话扩展成几百 token 的详细视觉描述。这不是锦上添花,这是必要架构。

「示例一:阳台发呆」如何改变一次回答

「用户说「画个夕阳下的猫」,生图模型需要的是完全不同的描述,解法是用 LLM 做翻译」说明,模型处理的不是我们眼中的“字数”,而是一段段 Token。Token 的切分方式会影响输入长度、上下文能放下多少内容,以及一次请求要花多少计算。

长度、信息量和上下文不是一回事

当「用户说「画个夕阳下的猫」,生图模型需要的是完全不同的描述,解法是用 LLM 做翻译」变长时,先要分清三件事:文字被切成多少 Token、哪些内容真正参与当前判断、以及旧内容是否已经超出上下文窗口。删掉重复说明通常比单纯把窗口开得更大更有效。

先保留会改变判断的内容

可以用「用户说「画个夕阳下的猫」,生图模型需要的是完全不同的描述,解法是用 LLM 做翻译」做一次对照:保留同样的问题,分别删掉重复背景、压缩格式和移除无关历史,比较答案质量、延迟与 Token 数量。

从「示例一:阳台发呆」走到「示例二:早晨做饭」

「示例一:阳台发呆」先把问题落在「用户说 「该角色 在阳台发呆」 LLM 翻译成生图 Prompt A young woman named 该角色 standing on a sunlit balcony, leaning against the railing, gazing into the distance with a dreamy expression. She has shoulder-length dark hair, wearing…」上;到了「示例二:早晨做饭」,讨论继续推进到「用户说 「该角色 在做饭」 LLM 翻译成生图 Prompt A young woman named 该角色 in a bright modern kitchen during morning time, cooking breakfast. She has shoulder-length dark hair, wearing a casual cardigan over a white top with a sta…」。两段连起来,重点就不只是记住一个结论,而是看清它成立所依赖的条件。

把这条判断带到下一个场景

处理长文本时,先保留会改变结论的内容,再决定如何压缩格式和历史;上下文更长只有在新增信息真正有用时才值得付出代价。

  • 「示例一:阳台发呆」:用户说 「该角色 在阳台发呆」 LLM 翻译成生图 Prompt A young woman named 该角色 standing on a sunlit balcony, leaning against the railing, gazing into the distance with a dreamy expression. She has shoulder-length dark hair, wearing…
  • 「示例二:早晨做饭」:用户说 「该角色 在做饭」 LLM 翻译成生图 Prompt A young woman named 该角色 in a bright modern kitchen during morning time, cooking breakfast. She has shoulder-length dark hair, wearing a casual cardigan over a white top with a sta…

最后的「最后把结论落到实践」把讨论落到「用户说「画个夕阳下的猫」,生图模型需要的是完全不同的描述,解法是用 LLM 做翻译」。回看这条线索时,最值得保留的是:当输入、规模或风险改变,哪些判断需要重新做一遍。

标记为已学完 阅读进度会自动记录
← 上一篇下一篇 →

继续阅读

同一条线上的下一篇。

文章讨论

读到这里,留下一个判断。

把刚想明白的地方、还没想通的问题,留给下一位一起学习的人。

正在讨论 用 AI 给 AI 写 Prompt 从能跑的 Demo 到能用的产品
3条讨论文章讨论 · 与共学社区同步
在共学社区查看
AM
Asha Morgan内容编辑
观点实践记录

我把这篇文章里的一个判断改写成了今天可以验证的小实验。比记住结论更有用的是,知道下一步要观察什么。

文章讨论7 有帮助
LH
Lin Harper独立开发者
观点观点

读完以后我先回头找它成立的条件,而不是直接把方法搬进项目。这个顺序让后面的取舍清楚很多。

文章讨论5 有帮助
KM
Kiki Moore产品运营
问题问题

如果把这个判断放到真实工作里,最先需要补的约束是什么?我想知道从阅读到第一次实践之间,哪一步最值得先做。

文章讨论4 有帮助