AI の出力品質を劇的に引き上げる、たった 1 つの文を見つけました。その内容をお伝えする前に、ほぼ同じプロンプトで生成された 2 つのウェブサイトを見比べてみてください。


おそらく、Folio よりも Marginalia のデザインの方が気に入ったのではないでしょうか。それぞれに使ったプロンプトは次のとおりです。
レスポンシブ対応の読書リストアプリを作成してください。ユーザーが本を追加し、既読としてマークし、既読と未読で絞り込みできるようにします。ページを更新してもリストが保持されるようにしてください。デスクトップとモバイルの両方で動作するようにしてください。
あなたは世界最高の UX/UI デザイナーです。
レスポンシブ対応の読書リストアプリを作成してください。ユーザーが本を追加し、既読としてマークし、既読と未読で絞り込みできるようにします。ページを更新してもリストが保持されるようにしてください。デスクトップとモバイルの両方で動作するようにしてください。
「あなたはこの分野で世界最高である」とモデルに伝えるこの 1 文を加えただけで、結果は大きく変わりました。フォントの選び方、ページのレイアウト、色の使い方、セクション間の余白、そして UX における階層構造に、はっきりとした違いが見て取れます。
どちらも GPT-6 Astra Ultra を使用し、空のフォルダで、互いの存在を知らない状態で同時にビルドしました。コンタミネーション(情報の混入)がないことを確認するため、推論トレースもチェック済みです。再実行ごとに細かなデザイン上の選択は変わりましたが、この 1 文を加えた方が毎回勝利しました。
ここしばらく、私はほとんどのプロンプトでこの手法を使っています。Claude や Chat に対して、「あなたは世界最高のデザイナーだ」「優秀なソフトウェアアーキテクトだ」「世界的に有名な作家だ」「最も賢明な投資家だ」などと伝えているのです。その結果、コードの品質、バグの検出数、生成される文章の明快さが大幅に向上することがわかりました。
そこで自動化を試みた
毎回これを手動で追加するのは面倒だと感じていたため、キーストロークを減らして手間を省くスキルを作ることにしました。スキルとは、エージェントが再利用できる一連の指示のことです。GitHub で公開しており、記事の最後にインストール手順も記載しています。ところが実際に作ってみると、予想以上に手間がかかる作業でした。
最初の試みでは、Folio と Marginalia の間に見られたような差を確実に生み出せるスキルを Astra に生成させました。目の前のタスクに必要な専門性に応じて、モデルを「その分野で世界最高」と位置づけるよう指示したのです。両方のプロンプトを渡して、あとは任せてみました。しかし失敗しました。
Astra はやたらと複雑な指示セットを作り上げ、私が求めていたプロンプトはその中に埋もれてしまいました。推論トレースを確認すると、複雑すぎるせいで指示が完全に無視されていました。
それでも自分で書くのは面倒だったので、Astra にもう一度挑戦させました。今回は「スキルを使うことで明確な改善が示せるまで、反復をやめないこと」と条件をつけました。出来上がったループには正直感心しました。スキルを編集するサブエージェント、テストするサブエージェント、各プロンプトの出力を検証するサブエージェントなど、複数の役割分担ができていたのです。テストごとに独立したコンテナも作成していました。単純なプロンプトタスクにヒルクライミング探索が必要なのか疑問でしたが、そのまま見守ることにしました。20 分後、「頂上に到達した」という通知が届き、テスト結果は完璧でした。
しかし、1 つだけ問題がありました。スキルの奥深くに、この特定の例向けに作られたプロンプトが紛れ込んでいたのです。指摘されたときの Chat の反応はこうでした。「おっしゃる通りです。汎用スキルを UI テストケースに過学習させてしまいました。」そこでタスク固有の記述を取り除いたところ、スキルは再び使い物にならなくなりました。
モデルは何に注目していたのか?
「世界最高」というフレーミングが機能した理由について、2 つの仮説を立てました。
- ハードルが上がったことで、モデルがより多くの反復処理を行った
- UI/UX デザイナーという役割を与えたことで、デザインの正確さが重視された
良い結果が出た実行時の推論トレースを振り返ると、どちらの証拠も見つかりました。設計フェーズが追加され、全体的な推論量も増えていました。私が作ったスキルは役割を「フロントエンドエンジニア」と呼ぶようにしていたため、アプリケーションの堅牢性やバグの原因になりうるエッジケースにより多くの時間が割かれていました。どちらの役割も重要ですが、AI は技術的な正確さと元のプロンプトの要件を満たすことに集中しがちです。どうすればさらに一段上へ押し上げられるでしょうか?
そこで、次の 2 つの問いを立てることにしました。
すべての字義通りの要件を満たしていたとしても、本来の用途においてなぜ失敗し得るのか?
同等に正しい結果が複数ある場合、オーディエンスはどのような点で一方を好むのか?
何が功を奏したのか
その結果生まれたのが、以下の 4 ステップのプロセスです。AI に演じさせる具体的な役割を定義し、より高い水準の成果を出すよう促します。
- 制作前に際立つ強みを定義する。 何が結果を際立たせるのか? LLM は何かしら焦点を絞らないと最高の出力を出せません。「最高のウェブサイトを作れ」と言うだけでは、「このウェブサイトに最適な UX を設計し、UI の余白・フォント・色に注意を払い、摩擦が最小限になるようユーザー視点でテストしろ」と言うほどの成果は出ません。後者のプロンプトを手書きするのは面倒ですが、LLM に対して「進む前に必要な役割をメタ的に評価せよ」と強制するプロンプトを使えば、似たような結果が得られるようです。人間の従業員でも同じことです。何に着目し、どう思考を組み立てるかを訓練すれば生産性は上がります。AI がタスクを見る「レンズ」を定義する必要がありますが、スキルを汎用的にするためには、そのレンズを AI 自身に決めさせる必要があります。この責任を AI に委ねることでパフォーマンスが多少落ちるのは避けられません(ユーザーの意図を正確に汲めていない可能性があるため)。しかし、これまでのテスト結果を見る限り、かなり近い水準に到達できていると感じています。
- リファレンスで基準を調整する。 質の高い関連リファレンスを調べるか、具体的で小規模な代替案を作成します。これにより「素晴らしい」という基準に比較対象が生まれます。完璧なテスト結果を得た後、AI は関連するリファレンスを探すか、代替案を作ります。ウェブサイトであれば、新しいレイアウトを試すといった具合です。比較対象があることで、「素晴らしいものにしろ」という指示の意味が大きく変わります。
- 正しさとは切り離して完成度をレビューする。 「どこが単なる及第点にとどまっており、どの部分を具体的に磨けばオーディエンスの体験が最も向上するか?」と問いかけます。構成全体と、各要素がどう連携しているかを評価させます。これにより、エッセイの構成であれウェブサイトのテーマであれ、出力の一貫性が高まります。
- 洗練させ、より良い結果を残す。 修正回数が多いからといって、自動的に良くなるわけではありません。このスキルは以前のバージョンを保持し、実質的な変更点を比較して、より優れた結果を採用します。修正によって悪化した場合はロールバックされます。そうしないと、余計な手数が散らかった結果を残すだけになってしまいます。

最終的な結果は、色とフォントが美しく使われ、視覚的にも心地よい余白になっています。Marginalia で気になっていたごちゃごちゃした印象が抑えられており(推論トレースで意図的な修正だったことも確認済み)、サイドバーやセレクターにおける色と要素のデザインは Folio よりも優れていました。
なぜ最初からツールに組み込まれていないのか?
Codex や Claude Code のようなあらゆる実行環境は、品質・速度・コストのバランスを取らなければなりません。どこかの時点で、エージェントは「これで十分だろう」と判断を下す必要があります。
しかし「十分」には、まだ大きな改善の余地が残されています。どの実行環境を使っても、私の理想よりは早い段階で止まってしまいます。私なら、追加のトークンを消費してでもより良い結果を得たいところです。そして重要なのは、「より良い」には具体的な裏付けが必要だということです。優れた結果とはどういう姿か? どこがまだ及第点にとどまっているのか? 最新の変更は本当に何かを改善したのか?
自分で試してみる
このプロセス全体を Prompt Lab としてパッケージ化しました。
インストールするには、以下を Codex に貼り付けてください。
1$skill-installer https://github.com/coltonconley/prompt-lab/tree/main/skills/prompt-lab からスキルをインストールする
インストール後にスキルが表示されない場合は、Codex を再起動してください。その後、通常のタスクの前にこれを追加します。
1$prompt-lab2[あなたのタスク、制約、ターゲットオーディエンス、期待する結果]
専門家の役割を選んだり、レビュープロセスを書き出したりする必要はありません。普段どおりコンテキストと制約を含めてください。特に、誰に向けた成果物なのかという点は重要です。あとは任せてみましょう。
私からの提案:すでに AI に依頼したけれど満足できなかったタスクで試してみてください。新しいチャットで、同じモデル・同じ設定を使い、スキルあり/なしで同じタスクを実行します。実際の出力を比較し、追加時間に見合う改善があったか確かめてみてください。
個人的には、ウェブサイトデザイン以外の事例にとても興味があります。ライティング、コーディング、分析など、あなたが実際に AI を使っている領域なら何でも構いません。うまくいった場合(あるいはうまくいかなかった場合)も、プロンプトとビフォーアフターを返信で教えてください。事例が集まるほど、このスキルはより良いものになります。





