Agent面试题八股文怎么答:ReAct、MCP、记忆到评估的12道高频题与追问
整理了 Agent 岗位面试里反复出现的12道八股题,从 ReAct 循环、Function Calling、MCP 到记忆、上下文压缩和 Agent 评估,每题给答题骨架和面试官最常接的追问,帮你把背下来的定义讲成做过的项目。

Agent面试题八股文怎么答:ReAct、MCP、记忆到评估的12道高频题与追问
一句话回答:Agent面试的八股题绕不开四块,推理循环、工具调用(Function Calling 和 MCP)、记忆与上下文、评估与兜底。每道题的定义一分钟能背完,面试官真正在打分的是你接下来那句追问答得怎么样。下面12道题都按「答题骨架 + 常见追问」写。
今年九月下旬,一位做后端的朋友转 Agent 岗,连着面了三家,回来跟我复盘:八股他都背了,ReAct、Function Calling、MCP 的定义一字不差,三家都在第二个追问上卡住了。一家问「工具返回了一万行日志,你怎么办」,一家问「你说你做了记忆,那它记错了怎么发现」,还有一家直接让他讲讲自己的 Agent 最近一次是怎么挂的。
这就是 Agent 八股和 Java 八股不一样的地方。Java 八股考的是你记没记住,Agent 八股考的是你有没有把一个循环跑坏过。所以下面每道题我都按同一个结构写:先给骨架,再给面试官会追的那一句。
如果你想看的是岗位本身考什么、和提示词工程师有什么区别,可以先看这篇岗位解析;想知道几家大厂的问法偏好,看大厂真题画像。这一篇只管一件事:题怎么答。
先看一张图:追问都发生在循环的哪个节点

几乎所有 Agent 追问都能落到这三处:规划那一步、调工具那一步、结果回填那一步。答题时别按「定义、原理、优缺点」的背书顺序讲,按「这一步坏了会怎样,我怎么兜底」讲,面试官一听就知道你不是只读过论文。
第一组:推理循环与规划
Q1:ReAct 是什么,和 Chain-of-Thought 有什么区别?
骨架:CoT 只让模型把推理写出来,全程不接触外部世界;ReAct(Yao 等人 2022 年的论文,arXiv 2210.03629)把「思考」和「行动」交替起来,每次行动的结果再喂回去,模型据此修正下一步想法。一句话:CoT 是在脑子里推,ReAct 是边推边查。
常见追问:「最大步数到了任务还没完成怎么办?」答法是别只说「设个上限」,要说上限到了返回什么——是把已有进展和卡点汇总给用户,还是降级成一次不带工具的直接回答。我自己的习惯是上限触发时必须带着「做到哪、卡在哪」退出,而不是静默截断。
Q2:规划(Planning)该一次性规划完,还是边做边规划?
骨架:一次性规划(plan-then-execute)适合步骤稳定、工具返回可预期的任务,好处是便宜、可审计;边做边规划适合环境会变的任务,好处是能纠偏,代价是 token 和延迟。实际工程里常见的是折中:先出一版粗计划,每执行完一个阶段让模型判断「计划还成立吗」,不成立才重规划。
常见追问:「计划本身写错了怎么发现?」可以讲两条:给每个步骤写明「完成的判定条件」,执行完对照检查;以及对同一个子目标连续失败 N 次就强制回到规划层,不允许在原地反复重试。
Q3:Workflow 和 Agent 到底怎么区分?
这题 Anthropic 那篇《Building effective agents》(原文)给了一个被广泛引用的划分,面试里直接拿来用没问题:
| Workflow | Agent | |
|---|---|---|
| 控制流 | 开发者写死的代码路径,模型只在节点里干活 | 模型自己决定下一步做什么、调哪个工具 |
| 可预测性 | 高,容易测 | 低,同一输入路径可能不同 |
| 成本与延迟 | 稳定、偏低 | 浮动、偏高 |
| 适合 | 步骤固定的任务(分类、抽取、固定流水线) | 步骤事先说不清的开放任务 |
常见追问:「你的项目为什么用了 Agent 而不是 Workflow?」这是送分题也是送命题。能用 Workflow 解决的任务硬上 Agent,面试官会觉得你不懂取舍。老老实实讲:哪一步是真的事先说不清,所以才放权给模型。
第二组:工具调用,Function Calling 与 MCP
Q4:Function Calling 的完整流程是什么?
骨架:开发者把工具的名称、描述、参数 JSON Schema 传给模型;模型不执行任何东西,只输出「我想调哪个工具、参数是什么」;由你的代码执行,再把结果作为一条消息回填;模型据此继续。关键的一句:执行权永远在你的代码里,模型只是提出调用请求。
常见追问:「模型给的参数不合法怎么办?」答:先过一遍 schema 校验,不通过就把具体的校验错误原样回给模型让它改,而不是自己悄悄修;同一个工具连续出错几次后换路径。
Q5:工具调用失败,超时、重试、幂等怎么处理?
骨架:把工具分成只读和有副作用两类。只读工具超时可以直接重试;有副作用的工具(发邮件、下单、写库)重试前必须有幂等键,否则一次超时重试就可能发两封邮件。失败信息要回填给模型,并且写明是「可重试」还是「换个办法」。
常见追问:「模型反复调同一个工具死循环怎么办?」答:对相同工具加相同参数的调用做去重计数,超过阈值直接拦截并告诉模型「这个调用已经试过,结果是X」。
Q6:MCP 是什么,解决了什么问题?
骨架:MCP(Model Context Protocol)是 Anthropic 2024 年底提出的开放协议(官方文档),把「工具怎么描述、怎么调用」标准化,底层是 JSON-RPC。没有它之前,每个模型框架对接每个外部系统都要写一套适配;有了它,工具方写一个 MCP Server,所有支持 MCP 的客户端都能接。它暴露的能力主要有三类:tools(可调用的动作)、resources(可读取的数据)、prompts(预置的提示模板)。
常见追问:「MCP 和 Function Calling 是替代关系吗?」不是。Function Calling 是模型层面「怎么表达想调用工具」,MCP 是系统层面「工具怎么被发现和接入」,MCP 客户端最后往往还是转成 Function Calling 喂给模型。另一个越来越常被追的是安全:第三方 MCP Server 返回的内容可能带提示注入,你对工具返回值要不要当不可信输入处理?标准答案是要。
如果你在准备的是技术岗,建议这时候就开始做口头练习:同一道题,自己讲一遍,再让面试官角色追两轮。面灵AI 的模拟面试功能可以按岗位出这类追问,我自己的用法是只看它追问的方向,不抄它的措辞,因为八股答案太整齐反而会被面试官一句话问穿。
第三组:记忆与上下文
Q7:Agent 的记忆怎么分类,各自怎么实现?
骨架:短期记忆就是当前上下文窗口里的对话和工具结果;长期记忆放在窗口外,常见做法是向量库存语义片段、数据库存结构化事实(比如用户偏好),需要时检索回来塞进上下文。再加一个常被提起的分法:情景记忆(发生过什么)、语义记忆(知道什么)、程序性记忆(怎么做事,例如沉淀下来的流程或提示词)。
常见追问:「记错了怎么发现?」这是我朋友被问住的那题。可答的方向:写入时记录来源和时间,读出时带出处;对高影响的记忆(比如「用户已确认过某某」)要有过期和复核机制;用户能看到并纠正记忆。只会说「用向量库」答不到点上。
Q8:上下文超长了怎么办?
骨架:三种手段按代价从低到高排:截断(丢最旧的)、摘要(把旧轮次压成一段总结)、检索(把全量历史存外面,按需取回)。还有一个容易漏的点:把大体积工具结果落盘,上下文里只留摘要和引用,需要细节再读文件。
常见追问:「摘要把关键信息丢了怎么办?」可以引用 Liu 等人的《Lost in the Middle》(arXiv 2307.03172):模型对长上下文中间位置的信息利用更差,所以关键约束放在开头或结尾,并且摘要时对「用户明确说过的约束、已做出的决定」这类内容设成不可压缩。
Q9:工具返回一万行日志,怎么处理?
这题看起来是细节,实际问的是工程直觉。骨架:别整段塞回模型。在工具层先做裁剪(只保留错误级别、首尾若干行、按关键词过滤),或者提供「分页读取」「搜索」这类二级工具,让模型自己决定看哪段。能讲出「工具的输出格式也是要设计的」,基本就过了。
第四组:评估与上线
Q10:怎么评估一个 Agent 好不好?
骨架:不要只说「看最终答案对不对」。分三层讲:最终任务成功率;过程指标(平均步数、工具调用成功率、是否有无效循环);成本指标(token、延迟、每任务花费)。构造评估集时要包含正常样例、边界样例和已知失败样例,每次改提示词或换模型都回归跑一遍。
常见追问:「用 LLM 当评委靠谱吗?」答:能规模化,但有位置偏好、长度偏好,所以要抽样人工标注校准评委,并且尽量用有明确判定标准的 rubric,而不是让它打「好不好」的总分。
Q11:幻觉和错误怎么兜底?
骨架:分层兜底。输入侧:工具返回值做校验。过程侧:高风险动作(付款、删除、对外发送)加人工确认。输出侧:要求答案引用工具返回里的具体内容,对不上就拒绝输出。再提一下 Reflexion(Shinn 等人 2023,arXiv 2303.11366)这类让模型自我反思、把失败经验写进记忆的方法,但要诚实说:反思能降低重复犯错,不能保证不犯错,所以高风险动作的人工确认不能省。
Q12:讲一次你的 Agent 最近怎么挂的
这题没有标准答案,也是我认为最值钱的一题。准备法:从自己项目里挑一次真实故障,按「现象、定位过程、根因、修了什么、之后加了什么监控」讲,每一环给个具体数字或日志片段。没有线上项目的,用自己写的小 Agent 也行,关键是真的把它跑坏过一次。
怎么把这12题变成自己的
我建议别把它们当「答案」背,当成追问清单用:
- 挑一个你自己做过或跑通过的 Agent 小项目,哪怕只是个能查天气订日程的玩具。
- 对着上面每道题的追问,问自己「我的项目里这一步坏了会怎样」,答不出来的,就是你要去补的地方。
- 找个人或工具扮面试官,连续追问到第三层,看看自己在哪一层开始编。
- 想看更多岗位维度的题目,站内的面试题库整理了公开面经里的 Agent 题,可以对照你的薄弱点挑着看。
说句实话,八股这个东西能保证你不在第一关就被刷下来,拿不拿 offer 取决于后面那几个追问。
常见问题
Agent 面试八股文需要背吗?
定义和流程要熟到能脱口而出,但背整段答案没用。Agent 面试大量追问是围绕你自己的项目展开的,背的东西接不住「你当时怎么处理的」这类问题。
没有 Agent 项目经历,能面 Agent 岗吗?
可以投,但要有东西讲。花一两周自己搭一个带 2–3 个工具的小 Agent,真跑起来,故意让它出几次错并记录下来。面试时讲这些失败比讲框架名字有说服力。
ReAct、Plan-and-Execute、Reflexion 面试要都掌握吗?
ReAct 必须讲透;Plan-and-Execute 能说清和 ReAct 的取舍;Reflexion 了解思路和局限即可。把三个的适用场景讲出区别,比逐个背细节更有用。
Agent 面试会考手写代码吗?
常见的是让你手写一个最小的工具调用循环:发请求、解析工具调用、执行、回填、判断终止。几十行代码,重点看你有没有处理步数上限、参数校验和异常。
作者 · 林舟。职业发展顾问,做过互联网公司招聘官,也做过 6 年多岗位候选人。写文章分享求职一线的真实观察,不卖课也不做培训。
相关文章

大厂AI Agent工程师面试差异:字节阿里腾讯美团真题画像
面灵AI题库155道AI Agent真题按公司归类后发现,字节、阿里、腾讯、美团考察侧重点不一样:字节刨工程细节和安全兜底,阿里死磕MCP协议和评估体系,腾讯盯访问控制,美团纠结Plan-Execute取舍。

蚂蚁集团面试AI辅助:电话面没有共享屏幕怎么用
蚂蚁集团2026校招全程4面,前3轮电话技术面,最后HR面才现场进行;不像其他大厂提前预约时间,面试官常晚上8点直接来电确认。本文拆解蚂蚁真实面试流程、一面二面高频考点,及电话面场景下AI辅助能帮上什么、又有哪些边界。

投行面试AI辅助攻略:技术题与DCF模型怎么准备
投行秋招三轮面试要闯技术题、DCF模型讲解和Fit面三关,《投行面试400问》人手一份,但没人教你怎么结合AI工具复习。本文说清AI辅助在简历追问预演、技术逻辑梳理里能帮上什么,讲清楚现场硬答的部分AI帮不了,附两周准备清单。