Q1. 模型与代码之间的职责分离
选择一个你最近实现的 AI 功能,解释哪些部分由模型处理,哪些部分由标准代码保证。
除了改进提示词之外,你还实施了哪些措施来提升质量和可靠性?
Q2. 处理持续更新的知识
如果你正在设计一个基于频繁更新的内部文档来回答问题的系统,并且需要提供引用,你会如何处理以下要素?
- 文档分块
- 检索
- 搜索结果重排序
- 访问控制
- 文档更新与删除的反映
Q3. 检测变更导致质量下降的方法
当你更改提示词、模型、搜索方法或工具定义时,如何确保现有功能没有被破坏?
你会保留哪些测试用例,以及使用哪些指标来决定是否发布?
Q4. 你在多大程度上信任基于 AI 的评估?
当使用 AI 作为评估者时,会出现哪些类型的偏见或误判?
你如何将自动化 AI 评估与人工评估结合起来?
Q5. 如何安全执行带有副作用的操作
假设 AI 调用了会改变外部状态的工具,例如转账、发送邮件或创建工单。
设计一个包含输入验证、权限检查、用户批准、重试和防止重复执行的执行流程。
Q6. 如何停止失控的 AI
AI 陷入了重复搜索或工具调用的循环,无法完成处理。
你如何检测循环,以及在什么条件下停止它?
你如何为时间、执行次数、Token、成本和工具使用设置预算?
Q7. 模型故障期间的服务连续性
由于延迟、速率限制或服务中断,高性能模型变得不可用。
在什么条件下你会切换到不同的模型?
如果替代模型导致质量或功能下降,你如何调整用户体验?
Q8. 如何追踪单次故障
用户报告“响应缓慢且内容错误”。
你如何追踪该特定的处理实例?
Q9. 成本增加分析
AI 使用费用比上个月增加了。
你如何确定是哪个具体功能、客户、工作流或处理阶段导致了成本增加,而不仅仅是哪个模型?
你使用什么标准来判断该成本是否值得其商业价值?
Q10. 从生产故障中学到了什么?
描述你在运营的 AI 功能中经历过的最危险的故障。
- 发生了什么?
- 是如何发现的?
- 你是如何停止影响的?
- 你是如何确定原因的?
- 你做了哪些改变来防止再次发生?





