YouMind
登入

一句話讓你的 AI 輸出品質大躍進

@coltonconley
英語2026年9月23日
272K
16
0
3
61

TL;DR

本文展示如何在 AI 提示詞中加入「世界最佳」的角色定義,以大幅提升輸出品質。並詳細介紹如何建立名為 Prompt Lab 的自動化技能,將此邏輯應用於各種任務中。

我發現了一句話,能讓 AI 產出的品質大幅躍升。在告訴你這句話是什麼之前,先來看看這兩個用幾乎一模一樣的提示詞生成的網站。

Colton Conley 🛡️ on X — cover
Colton Conley 🛡️ - inline image

我猜你更喜歡 Marginalia 的設計,而不是 Folio。以下是我分別使用的提示詞:

Folio

建立一個響應式閱讀清單應用程式。使用者可以新增書籍、標記為已讀,並在已讀與未讀之間進行篩選。重新整理頁面後清單仍需保留。確保在桌面版和行動版都能正常運作。

Marginalia

你是全世界最頂尖的 UX/UI 設計師。

建立一個響應式閱讀清單應用程式。使用者可以新增書籍、標記為已讀,並在已讀與未讀之間進行篩選。重新整理頁面後清單仍需保留。確保在桌面版和行動版都能正常運作。

光是加上這一句話,告訴模型它在某方面是「世界最強」,就帶來了巨大的差異。你可以從字體選擇、版面配置、色彩運用、區塊間距,以及 UX 的視覺層級中看出明顯不同。

兩者都使用 GPT-6 Astra Ultra,在空白資料夾中同時生成,彼此互不干擾。我也檢查了推理軌跡(traces),確認沒有互相污染。每次重新執行時,一些細微的設計選擇會有所變動,但多加那句話的版本每次都勝出。

這段時間以來,我的大部分提示詞都會這麼做。我會告訴 Claude 或 Chat,它是世界上最厲害的設計師、頂尖的軟體架構師、全球最知名的作家、最聰明的投資人等等。我發現程式碼品質、抓出的 bug 數量,以及寫出來的文字清晰度,都有了顯著提升。

於是我試著把它自動化

我一直覺得手動加這句話很麻煩,所以決定做一個技能來省點打字功夫,也少操點心。所謂技能,就是一組你的 Agent 可以重複使用的指令。你可以在 GitHub 上找到它,安裝說明我放在文章最後。結果沒想到,打造這個技能比我預期的複雜得多。

第一次嘗試時,我請 Astra 生成一個技能,希望能穩定重現 Folio 和 Marginalia 之間的差距。我要求它根據任務所需的專業領域,把模型設定成該領域的世界第一。我把兩個提示詞都餵給它,讓它自由發揮。結果失敗了。

Astra 搞出了一套極度複雜的指令,我真正想要的提示詞反而被淹沒在一堆規則裡。我查看了推理軌跡,發現因為指令太繁瑣,模型根本完全忽略了它們。

但我又懶得自己動手寫。於是我讓 Astra 再試一次,這次我交代它:除非能證明用了這個技能後效果有實質提升,否則不准停下來。說實話,它跑出來的循環讓我相當驚豔;裡面有多個 subagent 分別負責修改技能、測試技能,以及審查每個提示詞的輸出結果。它甚至建立了獨立的容器來執行每項測試。對於一個簡單的提示詞任務,我本來對這種「爬坡式最佳化」(hill climbing)持懷疑態度,但還是隨它去了。20 分鐘後,我收到通知說已經爬到頂峰,測試結果非常完美。

不過,有一個問題:技能裡藏了一段專門為這個範例量身打造的提示詞。當我質問 Chat 時,它這麼回答:「你說得對——我把一個通用技能過度擬合到我們的 UI 測試案例上了。」於是我們刪掉了那些針對特定任務的描述,結果這個技能又變回廢物了。

模型到底把注意力放在哪裡?

關於為什麼「世界第一」這種說法有效,我有兩個猜想:

  1. 更高的標準促使模型跑了更多次迭代
  2. UI/UX 設計師的角色定位,讓它更重視設計細節

我回頭去查那些產出較佳結果的推理軌跡,發現兩個猜想都有跡可循。流程中確實多了一個設計階段,整體消耗的推理量也變多了。但我做的技能把角色設定為「前端工程師」,導致模型把額外時間花在應用程式的穩健性,以及可能引發 bug 的邊界情況上。這兩種角色都很重要,但 AI 當時選擇專注於技術正確性,以及精準滿足原始提示詞的要求。我要怎麼推它一把,讓它走得更遠?

於是我決定問自己兩個問題:

如果所有字面上的需求都達成了,成果還可能在哪些地方無法滿足實際用途?

面對兩個同樣正確的結果,什麼因素會讓受眾偏愛其中一個?

真正奏效的關鍵

最終我得出了以下四個步驟的流程:先定義 AI 要扮演的具體角色,再推動它達到更高的產出標準:

  1. 在動手前先定義出眾的優勢。 什麼樣的特質能讓成果脫穎而出?LLM 需要一個明確的焦點,才能產出最好的結果。光說「做出最棒的網站」,效果絕對比不上「為這個網站設計最棒的 UX,注意 UI 中的間距、字體和配色,並像真實使用者一樣測試,確保操作盡可能順暢無阻」。雖然手動寫出後面那段提示詞很麻煩,但如果用一段提示詞強迫 LLM 在動手前先對所需角色做一次後設評估,似乎也能達到類似效果。人類員工其實也是如此;訓練他們知道該留意什麼、如何組織思路,就能大幅提升生產力。我們需要定義 AI 看待任務的視角,但為了讓技能具備通用性,我們必須讓 AI 自己決定該用什麼視角。把這個責任交給 AI(它未必完全掌握使用者的真實意圖)難免會損失一些效能,但就目前測試技能的結果來看,表現已經相當接近理想狀態了。
  2. 用參考基準來校準標準。 找一個優秀且相關的參考範例,或是做出一個具體的小型替代方案。這樣「卓越」才有個看得見的比較對象。在達成完美的測試結果後,AI 會尋找相關參考或建立替代方案。以網站為例,可能就是嘗試一種新的版面配置。有了可以對比的對象,「做到最好」這句話才真正有意義。
  3. 把工藝水準和正確性分開檢視。 問問:「哪裡只是堪用而已?哪一項具體的調整最能提升受眾的體驗?」從整體結構去評估各部分如何協同運作。這能讓產出更具連貫性,無論是一篇文章的架構,還是一個網站的整體風格。
  4. 優化並保留更好的版本。 改動次數多不代表成果更好。這個技能會保留上一個版本,比較實質性的變更,然後留下較好的結果。如果某次修改反而讓情況變糟,就會自動回滾。否則,那些額外的努力只會留下一團亂麻。
Colton Conley 🛡️ - inline image

最終成果的色彩與字體搭配得宜,間距看起來也很舒服。它減少了 Marginalia 中我不太喜歡的雜亂感(我在推理軌跡中確認過這是刻意為之的修改),但在側邊欄和選擇器的配色與元素設計上,做得比 Folio 更好。

為什麼這些工具不直接內建這個功能?

像 Codex 和 Claude Code 這類框架,都必須在品質、速度和成本之間取得平衡。到了某個節點,Agent 就得判定工作已經「夠好了」。

但「夠好」其實還有很大的進步空間。不管我用哪個框架,它們停手的時機都比我期望的早。我寧可多花一點 token 換取更好的結果。更重要的是,「更好」需要有具體的依據。優秀的成果長什麼樣?成果的哪個部分還只是堪用?最新的修改真的帶來改善了嗎?

自己動手試試看

我把這整套流程打包成了 Prompt Lab。

在 GitHub 下載 Prompt Lab

安裝方式很簡單,把下面這段貼進 Codex:

text
1$skill-installer 從 https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab 安裝技能

如果安裝後技能沒有出現,請重新啟動 Codex。接著在你平常的任務前面加上它:

text
1$prompt-lab
2[你的任務、限制條件、目標受眾和期望結果]

你不需要自己挑選專家角色,也不用寫出審查流程。只要照平常的方式提供背景和限制條件就好,特別是關於成果受眾的重要資訊。然後就放手讓它發揮。

我的建議是:拿一件你之前請 AI 做過、但結果不太滿意的事情來試試。在全新的對話中,用同一個模型和設定,分別在有技能和沒技能的情況下執行相同任務。比較實際產出的差異,看看這些提升是否值得多花的時間。

我特別想看到網站設計以外的例子。寫作、寫程式、分析,或者任何你真正在用 AI 做的事。如果這對你有幫助(或者沒幫助),歡迎回覆分享你的提示詞以及前後對比。我收集到的例子越多,這個技能就能打磨得越好。

二次創作

使用 YouMind 創作爆款文章

收集素材、拆解爆點、生成視覺資產、撰寫內容,並在一個 AI 工作空間裡完成分發。

了解 YouMind
寫給創作者

把你的 Markdown 變成乾淨的 𝕏 文章

圖片上傳、表格、程式碼區塊,往 𝕏 上手動重排太痛苦。YouMind 把整篇 Markdown 一鍵轉成乾淨、可直接發佈的 𝕏 文章草稿。

試試 Markdown 轉 𝕏

更多可拆解樣本

近期爆款文章

探索更多爆款文章