我發現了一句話,能讓 AI 產出的品質大幅躍升。在告訴你這句話是什麼之前,先來看看這兩個用幾乎一模一樣的提示詞生成的網站。


我猜你更喜歡 Marginalia 的設計,而不是 Folio。以下是我分別使用的提示詞:
建立一個響應式閱讀清單應用程式。使用者可以新增書籍、標記為已讀,並在已讀與未讀之間進行篩選。重新整理頁面後清單仍需保留。確保在桌面版和行動版都能正常運作。
你是全世界最頂尖的 UX/UI 設計師。
建立一個響應式閱讀清單應用程式。使用者可以新增書籍、標記為已讀,並在已讀與未讀之間進行篩選。重新整理頁面後清單仍需保留。確保在桌面版和行動版都能正常運作。
光是加上這一句話,告訴模型它在某方面是「世界最強」,就帶來了巨大的差異。你可以從字體選擇、版面配置、色彩運用、區塊間距,以及 UX 的視覺層級中看出明顯不同。
兩者都使用 GPT-6 Astra Ultra,在空白資料夾中同時生成,彼此互不干擾。我也檢查了推理軌跡(traces),確認沒有互相污染。每次重新執行時,一些細微的設計選擇會有所變動,但多加那句話的版本每次都勝出。
這段時間以來,我的大部分提示詞都會這麼做。我會告訴 Claude 或 Chat,它是世界上最厲害的設計師、頂尖的軟體架構師、全球最知名的作家、最聰明的投資人等等。我發現程式碼品質、抓出的 bug 數量,以及寫出來的文字清晰度,都有了顯著提升。
於是我試著把它自動化
我一直覺得手動加這句話很麻煩,所以決定做一個技能來省點打字功夫,也少操點心。所謂技能,就是一組你的 Agent 可以重複使用的指令。你可以在 GitHub 上找到它,安裝說明我放在文章最後。結果沒想到,打造這個技能比我預期的複雜得多。
第一次嘗試時,我請 Astra 生成一個技能,希望能穩定重現 Folio 和 Marginalia 之間的差距。我要求它根據任務所需的專業領域,把模型設定成該領域的世界第一。我把兩個提示詞都餵給它,讓它自由發揮。結果失敗了。
Astra 搞出了一套極度複雜的指令,我真正想要的提示詞反而被淹沒在一堆規則裡。我查看了推理軌跡,發現因為指令太繁瑣,模型根本完全忽略了它們。
但我又懶得自己動手寫。於是我讓 Astra 再試一次,這次我交代它:除非能證明用了這個技能後效果有實質提升,否則不准停下來。說實話,它跑出來的循環讓我相當驚豔;裡面有多個 subagent 分別負責修改技能、測試技能,以及審查每個提示詞的輸出結果。它甚至建立了獨立的容器來執行每項測試。對於一個簡單的提示詞任務,我本來對這種「爬坡式最佳化」(hill climbing)持懷疑態度,但還是隨它去了。20 分鐘後,我收到通知說已經爬到頂峰,測試結果非常完美。
不過,有一個問題:技能裡藏了一段專門為這個範例量身打造的提示詞。當我質問 Chat 時,它這麼回答:「你說得對——我把一個通用技能過度擬合到我們的 UI 測試案例上了。」於是我們刪掉了那些針對特定任務的描述,結果這個技能又變回廢物了。
模型到底把注意力放在哪裡?
關於為什麼「世界第一」這種說法有效,我有兩個猜想:
- 更高的標準促使模型跑了更多次迭代
- UI/UX 設計師的角色定位,讓它更重視設計細節
我回頭去查那些產出較佳結果的推理軌跡,發現兩個猜想都有跡可循。流程中確實多了一個設計階段,整體消耗的推理量也變多了。但我做的技能把角色設定為「前端工程師」,導致模型把額外時間花在應用程式的穩健性,以及可能引發 bug 的邊界情況上。這兩種角色都很重要,但 AI 當時選擇專注於技術正確性,以及精準滿足原始提示詞的要求。我要怎麼推它一把,讓它走得更遠?
於是我決定問自己兩個問題:
如果所有字面上的需求都達成了,成果還可能在哪些地方無法滿足實際用途?
面對兩個同樣正確的結果,什麼因素會讓受眾偏愛其中一個?
真正奏效的關鍵
最終我得出了以下四個步驟的流程:先定義 AI 要扮演的具體角色,再推動它達到更高的產出標準:
- 在動手前先定義出眾的優勢。 什麼樣的特質能讓成果脫穎而出?LLM 需要一個明確的焦點,才能產出最好的結果。光說「做出最棒的網站」,效果絕對比不上「為這個網站設計最棒的 UX,注意 UI 中的間距、字體和配色,並像真實使用者一樣測試,確保操作盡可能順暢無阻」。雖然手動寫出後面那段提示詞很麻煩,但如果用一段提示詞強迫 LLM 在動手前先對所需角色做一次後設評估,似乎也能達到類似效果。人類員工其實也是如此;訓練他們知道該留意什麼、如何組織思路,就能大幅提升生產力。我們需要定義 AI 看待任務的視角,但為了讓技能具備通用性,我們必須讓 AI 自己決定該用什麼視角。把這個責任交給 AI(它未必完全掌握使用者的真實意圖)難免會損失一些效能,但就目前測試技能的結果來看,表現已經相當接近理想狀態了。
- 用參考基準來校準標準。 找一個優秀且相關的參考範例,或是做出一個具體的小型替代方案。這樣「卓越」才有個看得見的比較對象。在達成完美的測試結果後,AI 會尋找相關參考或建立替代方案。以網站為例,可能就是嘗試一種新的版面配置。有了可以對比的對象,「做到最好」這句話才真正有意義。
- 把工藝水準和正確性分開檢視。 問問:「哪裡只是堪用而已?哪一項具體的調整最能提升受眾的體驗?」從整體結構去評估各部分如何協同運作。這能讓產出更具連貫性,無論是一篇文章的架構,還是一個網站的整體風格。
- 優化並保留更好的版本。 改動次數多不代表成果更好。這個技能會保留上一個版本,比較實質性的變更,然後留下較好的結果。如果某次修改反而讓情況變糟,就會自動回滾。否則,那些額外的努力只會留下一團亂麻。

最終成果的色彩與字體搭配得宜,間距看起來也很舒服。它減少了 Marginalia 中我不太喜歡的雜亂感(我在推理軌跡中確認過這是刻意為之的修改),但在側邊欄和選擇器的配色與元素設計上,做得比 Folio 更好。
為什麼這些工具不直接內建這個功能?
像 Codex 和 Claude Code 這類框架,都必須在品質、速度和成本之間取得平衡。到了某個節點,Agent 就得判定工作已經「夠好了」。
但「夠好」其實還有很大的進步空間。不管我用哪個框架,它們停手的時機都比我期望的早。我寧可多花一點 token 換取更好的結果。更重要的是,「更好」需要有具體的依據。優秀的成果長什麼樣?成果的哪個部分還只是堪用?最新的修改真的帶來改善了嗎?
自己動手試試看
我把這整套流程打包成了 Prompt Lab。
安裝方式很簡單,把下面這段貼進 Codex:
1$skill-installer 從 https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab 安裝技能
如果安裝後技能沒有出現,請重新啟動 Codex。接著在你平常的任務前面加上它:
1$prompt-lab2[你的任務、限制條件、目標受眾和期望結果]
你不需要自己挑選專家角色,也不用寫出審查流程。只要照平常的方式提供背景和限制條件就好,特別是關於成果受眾的重要資訊。然後就放手讓它發揮。
我的建議是:拿一件你之前請 AI 做過、但結果不太滿意的事情來試試。在全新的對話中,用同一個模型和設定,分別在有技能和沒技能的情況下執行相同任務。比較實際產出的差異,看看這些提升是否值得多花的時間。
我特別想看到網站設計以外的例子。寫作、寫程式、分析,或者任何你真正在用 AI 做的事。如果這對你有幫助(或者沒幫助),歡迎回覆分享你的提示詞以及前後對比。我收集到的例子越多,這個技能就能打磨得越好。





