Q1. 모델과 코드 간의 책임 분리
최근에 구현한 AI 기능 하나를 선택하여, 해당 기능의 어떤 부분이 모델에 의해 처리되고 어떤 부분이 표준 코드에 의해 보장되었는지 설명해 주세요.
프롬프트 개선 외에, 품질과 신뢰성을 향상시키기 위해 어떤 것을 구현했나요?
Q2. 지속적으로 업데이트되는 지식 처리
자주 업데이트되는 내부 문서를 기반으로 인용과 함께 질문에 답변하는 시스템을 설계한다면, 다음 요소들을 어떻게 처리하시겠습니까?
- 문서 청킹
- 검색
- 검색 결과 재순위화
- 접근 제어
- 문서 업데이트 및 삭제 반영
Q3. 변경으로 인한 품질 저하 감지 방법
프롬프트, 모델, 검색 방법 또는 도구 정의를 변경할 때, 기존 기능이 손상되지 않았는지 어떻게 확인하시나요?
테스트 케이스로 무엇을 유지하며, 릴리스 여부를 결정하기 위해 어떤 지표를 사용하시나요?
Q4. AI 기반 평가를 어느 정도 신뢰하시나요?
AI를 평가자로 사용할 때, 어떤 종류의 편향이나 오판이 발생하나요?
자동화된 AI 평가와 인간 평가를 어떻게 결합하시나요?
Q5. 부작용이 있는 작업을 안전하게 실행하는 방법
AI가 송금, 이메일 발송, 티켓 생성 등 외부 상태를 변경하는 도구를 호출한다고 가정해 보세요.
입력 검증, 권한 확인, 사용자 승인, 재시도 및 중복 실행 방지를 포함한 실행 흐름을 설계해 주세요.
Q6. 통제 불능 AI 중단 방법
AI가 반복적인 검색이나 도구 호출 루프에 빠져 처리를 완료하지 못하고 있습니다.
루프를 어떻게 감지하며, 어떤 조건에서 중단하시나요?
시간, 실행 횟수, 토큰, 비용 및 도구 사용량에 대한 예산을 어떻게 설정하시나요?
Q7. 모델 장애 시 서비스 연속성
지연 시간, 속도 제한 또는 장애로 인해 고성능 모델을 사용할 수 없게 되었습니다.
어떤 조건에서 다른 모델로 전환하시나요?
대체 모델의 품질이나 기능이 낮을 경우, 사용자 경험을 어떻게 수정하시나요?
Q8. 단일 장애 추적 방법
사용자가 "응답이 느리고 내용이 부정확했다"고 보고했습니다.
해당 특정 처리 인스턴스를 어떻게 추적하시나요?
Q9. 비용 증가 분석
AI 사용료가 전월 대비 증가했습니다.
단순히 어떤 모델인지가 아니라, 어떤 특정 기능, 고객, 워크플로 또는 처리 단계에서 증가가 발생했는지 어떻게 식별하시나요?
해당 비용이 비즈니스 가치에 부합하는지 판단하는 기준은 무엇인가요?
Q10. 프로덕션 장애에서 배운 점
운영한 AI 기능에서 경험한 가장 위험한 장애에 대해 설명해 주세요.
- 어떤 일이 발생했나요?
- 어떻게 발견되었나요?
- 영향을 어떻게 중단시켰나요?
- 원인을 어떻게 식별했나요?
- 재발 방지를 위해 무엇을 변경했나요?





