我发现了一句话,能让 AI 输出质量直接起飞。在揭晓答案之前,先来看看这两个网站——它们是用几乎一模一样的提示词生成的。


我猜你更喜欢 Marginalia 的设计,而不是 Folio。以下是我分别使用的提示词:
构建一个响应式阅读清单应用。用户可以添加书籍、标记为已读,并在已读和未读之间筛选。刷新页面后列表数据不丢失。确保在桌面端和移动端都能正常使用。
你是世界上最顶尖的 UX/UI 设计师。
构建一个响应式阅读清单应用。用户可以添加书籍、标记为已读,并在已读和未读之间筛选。刷新页面后列表数据不丢失。确保在桌面端和移动端都能正常使用。
仅仅加上这一句“告诉模型它是某方面世界第一”的话,效果就天差地别。你可以明显看出字体选择、页面布局、色彩运用、区块间距以及 UX 层级上的差异。
两者都使用了 GPT-6 Astra Ultra,都在空文件夹中运行,同时生成且互不知情。我还检查了推理轨迹(traces),确认没有互相污染。重新运行时一些小的设计细节会有变化,但加了那句话的版本每次都赢。
其实有一阵子了,我大部分提示词都会这么干。我会告诉 Claude 或 Chat,它是世界顶级设计师、资深软件架构师、全球最负盛名的作家、最聪明的投资人等等。结果代码质量、bug 发现率以及文案清晰度都有了大幅提升。
于是我试着把它自动化
每次手动加这句话实在太麻烦,所以我决定做一个 skill,省点敲键盘的功夫,也少操点心。所谓 skill,就是一套你的 Agent 可以反复复用的指令。你可以在 GitHub 上找到它,安装说明我放在了文末。事实证明,做这个 skill 比我预想的要折腾得多。
第一次尝试时,我让 Astra 生成一个 skill,要求它能稳定复现 Folio 和 Marginalia 之间的差距。我告诉它:无论当前任务需要什么专业能力,都要把模型设定为该领域的世界第一。我把两个提示词都给了它,然后放手让它去跑。结果翻车了。
Astra 搞出了一套极其复杂的指令,我真正想要的那句提示词被淹没在了里面。我查看了推理轨迹,发现正因为太复杂,这些指令被彻底无视了。
但我又懒得自己手写这个 skill。于是让 Astra 再试一次,这次我明确要求:除非能证明用了这个 skill 之后效果确实有提升,否则不许停止迭代。说实话,它跑出来的循环让我挺惊艳的:里面有多个 subagent,分别负责修改 skill、测试 skill、审查每个提示词的输出。它还建了独立的容器来跑每组测试。本来我对用“爬山算法”来解决这么简单的提示词任务是持怀疑态度的,但还是随它去了。20 分钟后我收到通知说已经爬到山顶了,测试结果堪称完美。
不过还有一个问题:skill 里藏着一段专门针对这个例子的提示词。被我问到时,Chat 是这么说的:“你说得对——我把一个通用 skill 过拟合到我们的 UI 测试用例上了。”于是我们删掉了那些特定任务的描述,结果这个 skill 又废了。
模型到底在关注什么?
关于为什么“世界第一”这种设定有效,我有两个猜测:
- 更高的标准逼着模型跑了更多轮迭代
- UI/UX 设计师这个角色强调了“把设计做好”的重要性
我回头看了那些跑出更好结果的推理轨迹,发现两个猜测都有证据支持。不仅多了一个设计阶段,整体消耗的推理量也更大了。而我做的 skill 把角色定成了“前端工程师”,于是额外时间都花在了应用的健壮性和可能引发 bug 的边界情况上。两种角色都很重要,但 AI 当时选择了死磕技术正确性,以及精准满足原始提示词的要求。怎么才能让它更进一步?
于是我决定问两个问题:
如果字面要求全都满足了,最终结果在真实使用场景中还会怎么翻车?
面对两个同样正确的结果,是什么让用户更偏爱其中一个?
到底是什么起了作用
最终我总结出了下面这套四步流程:先给 AI 定义具体要扮演的角色,再推着它交出更高水准的成果:
- 动手前先明确差异化优势。 怎么做才能让结果脱颖而出?LLM 必须有个聚焦点,才能给出最好的输出。光说“做个最好的网站”,效果远不如“为这个网站设计最好的 UX,注意 UI 里的间距、字体和配色,并像真实用户一样去测试,确保操作阻力降到最低”。手动写后面这段提示词很费劲,但如果用一条提示词逼 LLM 在动手前先对所需角色做一次元评估,效果似乎差不多。人类员工也是同样的道理:训练他们该关注什么、怎么组织思路,效率就会高很多。我们需要定义 AI 看待任务的视角,但为了让 skill 具备通用性,这个视角必须由 AI 自己来决定。把这件事交给 AI(它未必完全懂你的真实意图)必然会损失一点性能,但从目前的测试结果来看,差距已经很小了。
- 用参照物校准标准。 找一个优秀的、相关的参考案例,或者自己快速做一个具体的替代方案。这样“优秀”才有了可对比的实体。在拿到完美的测试结果后,AI 会去寻找相关参考或创建替代方案。比如做网站,可能就是尝试一种新布局。有了对比对象,“把它做到极致”这句话才真正有分量。
- 把工艺打磨和正确性分开审查。 问问自己:“哪里只是勉强及格?哪个具体改进最能提升用户体验?”要从整体审视作品,看各部分如何协同。这会让输出更有连贯性,无论是文章结构还是网站的整体主题。
- 优化并保留更好的版本。 改动多不等于质量好。这个 skill 会保留上一版,对比实质性改动,只留下更好的结果。如果越改越糟,就回滚。否则一顿操作猛如虎,最后留下一地鸡毛。

最终结果在配色和字体上处理得很漂亮,间距看着也很舒服。它去掉了 Marginalia 里我不喜欢的一些杂乱感(我在推理轨迹里确认过这是有意为之的改动),同时在侧边栏和选择器的配色与元素设计上,做得比 Folio 更好。
为什么现有工具没内置这个功能?
像 Codex 和 Claude Code 这样的框架,都得在质量、速度和成本之间找平衡。总有一个时刻,Agent 必须判定“活儿干得差不多了”。
但“差不多”依然留有很大提升空间。不管我用哪个框架,它们停手的时间都比我期望的要早。我更愿意多花点 token 换个更好的结果。而且关键在于,“更好”得有具体的衡量依据。好结果长什么样?哪部分还只是勉强及格?最新一次改动真的带来提升了吗?
自己动手试试
我已经把这整套流程打包进了 Prompt Lab。
安装方法:把下面这段粘贴进 Codex:
1$skill-installer Install the skill from https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab
如果安装后 skill 没出现,重启一下 Codex。然后在日常任务前面加上它:
1$prompt-lab2[Your task, constraints, audience, and desired result]
你不需要自己去挑专家角色,也不用手写审查流程。像平时一样提供背景和约束条件就行,尤其是关于“成果是给谁看的”这类关键信息。然后放手让它跑。
我的建议是:拿一件你之前让 AI 做过但不满意的事来试。在全新的对话里,用同一个模型和设置,分别带和不带这个 skill 跑一遍同样的任务。对比实际输出,看看这点提升值不值得多花的时间。
除了网页设计,我特别想看看其他场景的例子。写作、编程、分析……不管你平时用 AI 干什么。如果它对你有用(或者没用),欢迎回复附上你的提示词以及前后对比。例子越多,这个 skill 就能打磨得越好。





