AI 工程师面试:场景题到底在考什么

中小公司的 AI 工程师面试,大头不是八股而是场景题——用一个真实 Agent 项目的面试题库经验,拆解场景题的考法、答法框架和准备方式。

准备 AI 工程师面试时容易走错方向:背概念、背参数、背架构图。但看一圈中小公司的 JD 和真实面试就会发现,大头是场景题——「你的系统回答不可靠怎么办」「转人工通知失败了怎么办」「并发上来了怎么扛」。

场景题没法靠背,因为它考的不是知识点,是你有没有真的碰过生产。

场景题的标准结构#

一道合格的场景题有三层:

  1. 表面问法:描述一个故障或抉择(「AI 编造内容怎么办」)
  2. 实际考察点:分层防御意识(提示词 → 代码校验 → 回归测试 → 兜底路径)
  3. 高分答案的骨架:一个从实战里长出来的判断框架,而不是措施罗列

举个真实例子。「你们怎么防止 AI 编造?」弱答案是把「提示词里写了不要编造」当答案;强答案分层:出处强制(生成必须引用检索切片)→ 代码守门(引用的切片 ID 必须真实存在,LLM 自由文本里的引用一律代码级校验)→ 回归门禁(编造类行为有专门测试用例盯着)→ 置信兜底(低置信走人工而不是硬答)。四层里提示词只是第一层,而且是最弱的一层。

好答案的三个特征#

有事故打底。 「通知是加速器不是事实源」这句话,只有真的经历过通知挂了、工单丢了、用户被卡死在等待态的人才会说得那么快。每个框架后面最好挂一个你自己的事故。

有边界感。 「知道它自动化了什么,也知道它的边界」——比如被问到自动化诊断工具,好答案既讲它解决了什么(失败聚类、修复建议、回归转化),也讲它依赖什么(trace 数据量、人工审批环节为什么砍不掉)。没有边界感的答案暴露的是只看过 demo。

有数字和时点。 「50 并发 P95 4.7 秒(截至上线首日)」比「性能不错」可信一百倍。数字不标时点等于没说,系统是活的,指标是会变的。

怎么准备:把项目变成题库#

如果你有真实项目(课程作业算、给客户做的算、自部署玩具只要上过生产都算),最高效的准备方式是自己给自己出题:

  1. 把项目里每一个故障、每一次选型反转、每一个差点出事的瞬间列出来
  2. 每条按「面试问法 + 考察点 + 答案框架 + 项目实证」写成卡片
  3. 答案框架控制在三层以内,实证永远带着数字和时点

这个动作的价值在于强迫分层:写不出答案框架,说明当时的修复是碰巧的;写不出实证,说明这个坑不是你踩的。

概念题怎么办#

不是不准备,是按权重准备。场景题和使用中遇到的问题是大头(重点准备),概念原理题依然会问——目标是「能讲清」,不用深挖。判断标准很简单:这道题的答案,面试官自己是不是也只记得一半?是的话,点到为止;不是的话(比如 RAG 的基本原理),讲透。


一句话总结:场景题考的是生产经验的结构化程度。项目不分级,经验分级——同一件事,被坑过、修过、复盘过、写成过卡片的人,和只「做过」的人,答案差着一个事故的距离。

(题库方法来自一个真实 Agent 项目的面试准备线,写于 2026-09-26。)