Q1. モデルとコードの責任分離
最近実装したAI機能を一つ選び、モデルに任せた部分と、通常のコードで保証した部分を説明してください。
プロンプトの改善以外に、品質や信頼性を高めるため、何を実装しましたか。
Q2. 更新され続ける知識をどう扱うか
頻繁に更新される社内文書を対象に、出典付きで回答するシステムを設計するとして、次の要素をどのように扱いますか。
- 文書の分割
- 検索
- 検索結果の並べ替え
- アクセス制御
- 文書の更新と削除の反映
Q3. 変更による品質低下の検知方法
プロンプト、モデル、検索方式、ツール定義を変更したとき、既存機能が壊れていないことをどのように確認しますか。
何をテストケースとして残し、どの指標でリリース可否を判断しますか。
Q4. AIによる評価をどこまで信用するか
AIを評価者として使う場合、どのような偏りや誤判定が起きますか。
AIによる自動評価と人間による評価を、どのように組み合わせますか。
Q5. 副作用のある操作をどうやって安全に実行するか
AIが、送金、メール送信、チケット作成など、外部の状態を変更するツールを呼び出すとします。
入力検証、権限確認、ユーザー承認、再試行、重複実行の防止を含め、実行フローを設計してください。
Q6. 暴走するAIの停止のさせ方
AIが同じ検索やツール呼び出しを繰り返し、処理が終了しなくなりました。
どのようにループを検知し、どの条件で停止させますか。
時間、実行回数、トークン、費用、ツール利用回数などの予算を、どう設定しますか。
Q7. モデル障害時のサービスを継続性
高性能モデルが、遅延、レート制限、障害によって利用できなくなりました。
どういった条件で別モデルへ切り替えますか。
代替モデルでは品質や機能が低下する場合、ユーザー体験をどのように変更しますか。
Q8. 一回の失敗をどうやって追跡するか
ユーザーから「回答が遅く、内容も間違っていた」と報告されました。
その一回の処理について、どのように追跡しますか。
Q9. 増えたコストの分析
AI利用料が前月から増えました。
どのモデルで増えたかではなく、どの機能、顧客、ワークフロー、処理段階で増えたかを、どのように特定しますか。
そのコストが事業価値に見合っているか、何を基準に判断しますか。
Q10. 本番での失敗から何を得たか
これまで運用したAI機能で、最も危険だった失敗を一つ説明してください。
- 何が起きたか
- どのように発見したか
- 影響をどう止めたか
- 原因をどう特定したか
- 再発防止として何を変更したか





