AI Agent 面试题与八股文汇总:155 道大厂真题按主题拆解(2026 面经)
面灵AI 整理的 AI Agent 专项面试题合集,155 道题覆盖架构模式、Harness 工程、工具调用与 MCP、记忆与上下文工程、多智能体协作、评估安全,标注近期实际出题的公司。
Agent 岗的面试和一年前完全不是一回事了。前年问的还是「什么是 Agent」「ReAct 怎么实现」,今年一开口就是 Harness 怎么设计、上百个 Skill 怎么管理、越权调用怎么监控——这些概念半年前很多都还不存在。只按旧题背,进面就会发现问法早就换了一套。
这份合集是面灵AI 从大模型与应用开发岗的公开面经里,把 AI Agent 相关的提问单独抽出来重新归类整理成的专项题单,一共 155 道题,分九个主题。想连带看大模型算法岗的训练、对齐、推理优化题,可以配合大模型面试题合集一起用。
怎么用这份题单:
- 题目后面括号里是近期实际问过这道题的公司,不代表完整名单,也不代表没标注的公司不问
- Agent 岗最大的特点是「概念题只是敲门砖」——几乎每道架构 / 工具调用 / 记忆题后面都跟一句「你们项目里具体怎么做的」,只背定义会在追问里露馅
- Harness、Skill、上下文工程这几块是 2026 年新长出来的重灾区,题目还没完全沉淀成固定问法,重点是理解设计动机而不是背答案
主题导航:基础概念与架构模式 · Agent Harness 与运行时工程 · 工具调用MCP-与-skills · 记忆管理与上下文工程 · 多智能体协作与编排 · 评估幻觉与安全兜底 · 系统设计题 · 手撕代码 · 软性问题与职业发展
基础概念与架构模式
- 用大白话说清楚什么是 Agent,它和传统对话系统、Siri 类助手的边界在哪?(字节跳动)
- AI Agent 是什么?为什么要用 Agent 而不是直接调大模型?(字节跳动 / 快手 / 腾讯)
- Agent 和 Workflow 有什么关系,分别适合什么场景?判断依据是什么?(字节跳动 / 百度 / 腾讯广告 / 得物)
- 常见的 Agent 架构模式有哪些?(阿里巴巴)
- ReAct 是什么?工作流程和优缺点分别是什么?(携程 / 腾讯 / 快手)
- ReAct 和 Plan-Execute-Replan 的区别是什么?分别适用于哪些场景?(美团 / 小红书)
- Plan-Execute-Replan 为什么需要一个监管 Agent?
- Agent 项目通常如何设计整体架构、框架和部署流程?(小红书)
- Agent和大模型在业务中有什么区别?(百度)
- Agent 项目与传统后端项目的架构差异体现在哪?
- 搭一个大模型应用,如何在「单次提示词 / Workflow / Agent」三种方案之间选型?
- 什么时候应该固化成垂直领域 Agent,什么时候要保系统泛化性?
- 最小可用 Agent 的核心模块是不是一个 ReAct Loop?除了工具调用还必须实现什么?
- 企业落地 Agent 系统最大的瓶颈是什么?用 Agent 有哪些弊端?
- Agent与Siri等传统智能助手的核心差异是什么?(字节跳动)
- 复杂场景既需要 Plan-Execute 的全局规划、又需要 ReAct 的实时反馈,架构上怎么兼顾?
- 请用通俗的话说明什么是 Agent,让非技术面试官也能听懂。(字节跳动)
- AI Agent 如何选择底层大模型?多 Agent 场景下主 Agent 和子 Agent 该用一样大小的模型吗?(阿里巴巴 / 滴滴)
- AI Agent 有哪些常见的模型或类型划分?(腾讯)
Agent Harness 与运行时工程
这一节是 2026 年才真正热起来的方向,很多概念半年前还不存在,考察的是理解力而不是背诵。
- Prompt Engineering、Context Engineering、Harness Engineering 三者有什么区别?(钉钉)
- Agent Engineering 和 Harness 在软件开发中分别指什么?
- Harness 做的事情 LangChain 等框架其实一直在做,为什么 harness 这个概念现在突然火了?区别是什么?(字节跳动大模型算法三面)
- 聊一聊 Harness、Hermes 这类比较新的 Agent 设计范式,最近看过哪些相关论文?(字节跳动暑期)
- 市面上主流的开源 Agent Harness 框架有哪些?最近关注过哪些?(快手)
- 你了解 Claude Code 的上下文管理方式和实现思路吗?(快手 / 蔚来)
- 为什么不用 Deep Agents 框架而选 LangGraph?Deep Agents 不稳定的原因可能是什么?
- 业界 Agent Runtime 越来越多,平台侧如何统一适配和管理?
- 未来更可能是一个 Super Agent 通吃所有任务,还是 Host Agent 加多个 Sub Agent 的组合?
- LangChain 和 LangGraph 有什么区别?LangGraph 的状态快照机制怎么实现?(字节跳动 / 快手 / 阿里巴巴)
- Java 生态里为什么选 Spring AI 而不是 LangChain4j?(京东 / 字节跳动 / 快手)
- 非 Java 生态还有哪些主流 Agent 框架?(快手 / 京东)
- Agent 的组装链 / 执行链如何设计,执行失败时如何降级?
工具调用:Function Calling、MCP 与 Skills
- Function Calling 的原理是什么?模型如何知道该调用哪个工具?如何理解 Tool Use?(阿里巴巴 / 快手 / 京东)
- 如果大模型返回的 Function Call 参数格式不对,工程上怎么处理?(阿里巴巴)
- MCP 是什么?主要作用是什么?(字节跳动 / 腾讯 / 京东 / 阿里巴巴)
- MCP 是什么,它解决了什么问题?(抖音)
- MCP 协议底层原理是什么,和传统 Tool 注册方式有什么区别?(阿里巴巴)
- MCP 与 Function Calling 有什么区别?(字节跳动 / 快手 / 货拉拉 / 百度)
- MCP 是什么,MCP 的通信方式有哪些?(阿里巴巴)
- MCP Server 具体怎么开发?(阿里巴巴)
- MCP 在实际项目中可以用来做什么?
- MCP 应该如何设计才能兼顾扩展性和安全性?(字节跳动 / 携程)
- 没有 MCP 之前,多 Agent 协同是怎么做的?(靠 Function Calling 分发)
- MCP 是否已经过时?为什么现在讨论热度没那么高了?(阿里千问)
- A2A 和 MCP 是什么关系?多 Agent 之间的通信协议应该怎么设计?(阿里千问 / 字节跳动)
- MCP 和 Skills 有什么区别?(TikTok / 京东 / 字节跳动 / 美团 / 腾讯 / 阿里云 / 小红书)
- Prompt、MCP、Skills、Subagent 分别应该怎么理解?(字节跳动)
- Function Call、MCP、Skill 三者的边界在哪?(B站)
- AI Agent 里的 Skills 具体指什么?(美团)
- Agent Skill 是什么,模型是怎么被引导调用一个 Skill 的?
- 为什么用 Skills 能减少 token 消耗?(网易 / 快手 / 腾讯)
- 从使用经验来看,Skill 和 Rule 有什么区别?(腾讯 / 蚂蚁集团)
- Skill 的渐进式披露具体是怎么实现的?为什么 Agent 能力要采用渐进式披露?(美团)
- 如果让你设计一套 Agent Skill 系统,会怎么设计?一个好的 Skill 结构应该包含哪些字段?(快手)
- 注册了上百个候选 Skill,该怎么处理——检索、分层还是渐进式披露?(快手)
- 大规模工具集下如何降低工具调用幻觉、提升选对工具的准确率?(字节跳动 / 快手)
- 工具调用的编排放在 Skill 里还是 Agent 里?工具是在 Agent 内定义,还是由 MCP 平台统一提供?
- 如何决定哪个 Agent 能访问哪些 MCP 服务?是不是所有 Agent 都该能访问全部 MCP?
- 工具调用报错、长时间无响应、连续失败时,重试、超时与异常隔离策略怎么设计?(快手 / 蔚来)
- 多工具调用系统如何编排?通常包含哪些模块?(百度)
- Spring AI Alibaba 的 Function Calling 具体是如何实现的?(字节跳动 / 快手)
记忆管理与上下文工程
- Agent 的短期记忆和长期记忆如何实现、如何区分?(京东 / 携程 / 美团)
- Agent 记忆管理整体如何设计?记忆模块选什么数据库,选型依据是什么?(京东 / 京东科技 / 滴滴)
- 长期记忆和 RAG 有什么区别?Agent 的记忆为什么要区分长短期,架构上有什么不同?(阿里千问 / 通义)
- 记忆如何召回?如何避免不同问题召回的记忆相互污染?(字节跳动)
- 在 Agent 项目中如何设计上下文管理机制?(京东物流 / 阿里云)
- 检索 Agent 中如何进行上下文管理?(小红书)
- 上下文工程应该如何设计,涵盖哪些环节?最重要的是哪一环?(高德 / 字节跳动)
- 上下文压缩应该放在链路的哪一步?先压缩再向量化,还是反过来?(字节跳动)
- 长对话 / 上下文窗口受限时如何处理?滑动窗口 + 摘要方案具体怎么落地?(字节跳动 / 腾讯)
- 工具调用结果怎么压缩——原地压缩还是交给另一个模型处理?对执行效果和耗时有什么影响?(字节跳动 / 蔚来)
- 为什么上下文越长,模型结果反而越不稳定?为什么指令在上下文里的位置会影响效果?
- 快到上下文窗口阈值时,如何避免一次性大段压缩打断用户体验?(字节跳动)
- 除了压缩,还有哪些规避上下文窗口限制的方案?大结果卸载在工程上怎么实现?(字节跳动 / 蔚来)
- 多轮长任务如何避免「任务目标迷失」?如何理解「无限长记忆」和必须舍弃历史信息之间的矛盾?(字节跳动)
- 怎么区分上下文污染和工具污染?AI 工具上下文跑偏时,是继续控制上下文还是新开一个 session?(字节跳动)
- 长期运行的 Agent 面对数月甚至更久的历史对话,记忆系统怎么持续优化?(小红书 / 蔚来)
- 记忆有没有量化指标?怎么评测记忆对 Agent 效果的贡献?
- 多工具调用和长短期记忆场景下,哪些数据需要写入记忆?判断标准是什么?(百度)
- 如何保证压缩过程中不丢关键内容?压缩导致结果失真如何缓解?(小红书)
多智能体协作与编排
- 多 Agent 协作模式如何理解?多 Agent 相比单智能体的优势是什么?(阿里巴巴 / 美团)
- 常见的 Agent 架构模式有哪些,多 Agent 场景下如何选型?(阿里巴巴)
- 子 Agent 之间如何交互 / 通信?交互协议如何设计?串行还是并行执行,如何取舍?(美团 / 快手)
- 主 Agent 如何动态识别并选择要调用的子 Agent?固定工作流还是动态判断?(美团)
- 多个 Agent 策略结论 / 角色不一致时如何处理?(京东)
- 主 Agent 怎么知道子 Agent 已经执行完成?子任务结果如何回收?(蔚来)
- 多 Agent 用独立 JSON 消息做异步通信要怎么设计?通信失败有哪些兜底机制?(蔚来)
- 用 Markdown 文件在 Agent 之间传递任务时,如何防止任务拆分阶段的错误一路传播下去?(字节跳动)
- 多个 Agent 如何做到完全隔离(上下文、权限、存储)?跨 Agent 场景下统一存储怎么通信和传输?(字节跳动 / 蚂蚁集团)
- 多 Agent 调研类系统该选中心化还是去中心化调度?怎么做到子任务失败可回退、进度可观测?
- 除了路由分发,还有哪些常见的多 Agent 协作方式?Agent Team 和动态任务分发机制了解吗?(字节跳动)
- 多智能体是否真的能提升效率?相比单智能体的独特价值怎么证明、怎么评估?(字节跳动)
- 子 Agent 执行中发现需要额外的新任务,任务应该怎么流转和审批?(腾讯广告)
- Agent 平台的多模块集成架构如何设计?(腾讯)
- Agent的核心技术组成和执行链路是什么?(快手)
评估、幻觉与安全兜底
- Agent 评估体系包括哪些维度?如何衡量 planning 能力 vs hallucination rate?(阿里巴巴)
- 如何构建 Agent 的评测体系?(Shopee / 小红书)
- Agent 项目应该统计哪些指标来衡量效果?(字节跳动)
- 智能体死循环 / 无限调用的原因及解决方案?为什么要设计三层防护机制?(字节跳动 / 快手)
- Agent 如何做权限控制避免越权 / 不合理操作?高危场景如何限制 Agent 直接执行真实资金操作?(腾讯 / 京东)
- Prompt Injection / Indirect Prompt Injection 是什么?如何防范恶意提示词注入?(钉钉 / 小红书)
- 沙箱机制如何实现?(B站系统设计)
- 生产环境 Agent 的四类典型故障——思考链错误传播、工具幻觉、JSON 格式崩坏、无限循环——分别怎么发生的?如何分三层解决?(字节跳动)
- 如何设计机制终止无效循环,而不是只依赖最大轮次?超时和重试限制怎么设?(字节跳动)
- 线上 Agent 一直调工具但不返回结果,怎么 Debug?多步任务失败时如何区分是 Prompt、模型、工具还是逻辑问题?(字节跳动 / 腾讯混元)
- 如何建立 Agent 的可观测性(轨迹留存、指标、回放)?(通义)
- 幻觉率怎么定义和计算?降幻觉的数字是怎么量化出来的?(字节跳动)
- 如果检测 Agent 自身也会幻觉,工程上如何保证检测 Agent 可靠?(美团)
- Agent 前序步骤产生幻觉、导致链式积累时应该如何处理?(美团)
- 如何区分「内容过时」和「模型幻觉」?(字节跳动)
- HITL:触发人工确认时 Agent Loop 处于什么状态?状态怎么暂停、暂存和恢复?(蔚来)
- 哪些内容必须人工审核、不能交给 Agent?运维类 Agent 能重启机器和服务时,高危操作怎么管控?(蚂蚁集团 / 唯品会)
- 如何防止网页、外部文档里的恶意指令注入 Agent?抓回来的内容怎么保证可信?(字节跳动)
- Agent 已经完成初始身份认证,为什么还需要连续认证?(字节跳动)
- Agent 执行到中间某个阶段出异常,如何断点恢复?整体兜底方案是什么?(字节跳动)
- Agent 的兜底策略如何设计?(京东 / 字节跳动)
- Agent 的执行过程要不要向用户透明展示?展示到什么粒度?
系统设计题(高频压轴)
- 设计一个多 Agent 自动 PR 系统,从沙箱、Agent 通信、上下文管理、工具触发、安全性几个角度展开。(B站)
- AI 客服 Agent 项目如何设计?RAG 如何分块和选择向量模型?(阿里巴巴)
- 视频问答 Agent / 股票分析 Agent 全链路如何设计?(阿里巴巴 / 快手 / 京东)
- 设计一个 AI 代码 Review Agent:输入一个 PR,整体方案怎么做?怎么保证它只提意见、不直接改代码?(字节跳动)
- 企业知识库 Agent 主要解决什么业务问题?完整链路、文档导入、权限隔离、效果评测怎么串起来?(Shopee / 字节跳动)
- 企业知识库 Agent 的消息推送功能如何设计?(Shopee)
- 设计一个内容标注 Agent(视频 / 图文):流程如何划分,要用到素材里的哪些信息?(抖音)
- 设计电商客服 Agent:如何理解表达能力参差的用户的模糊需求?核心成功指标怎么定?(通义)
- 设计运维 / 故障排查 Agent:支付接口超时时它怎么跑完整套排查流程?高危操作如何管控?(字节跳动 / 唯品会)
- 设计多 Agent 文献调研系统:三个核心风险是什么,分别怎么应对?
- 请完整介绍一个 Agent 项目从需求到技术落地的全流程。(阿里云)
- 如何对比 GPT、Claude、Grok、Gemini、Manus 和 DeepSeek 的 Deep Research 功能?(抖音)
- 如何评价 Manus 当前推出的功能?(抖音)
- Manus、扣子空间等智能体产品有哪些体验问题,你会怎么改进?(抖音)
- 针对智能体 Plan 和 Report 阶段的不足,如何向研发提出可执行的需求?(抖音)
Agent 手撕代码
大模型岗的手撕分两类:一类是 Agent 特色的模型 / 工程手撕,一类是照常考的通用算法题,前者近一年权重明显上升。
- 脱离任何框架,手写一个 ReAct 模式的最小 Agent:工具注册、循环控制、终止条件、异常处理分别怎么实现?(2026 下半年新出现的高频手撕,应用岗尤其常考)
- 手写一个简易上下文压缩 / 滑动窗口摘要逻辑(给定消息列表和 token 上限,决定保留、摘要还是卸载)
- Agent 如何完成一次完整的工具调用?从解析参数到执行、回传结果的链路要能手写出来。
- 手写一个简单的多 Agent 消息路由器:按角色 / 能力把任务分发给对应子 Agent,并处理超时和失败重试。
- Java 动态代理有哪些实现方式?和 Agent 框架里的动态调度思路有什么可以类比的地方?
- 手写一个死循环检测器:给定 Agent 的调用轨迹,判断是否陷入重复调用同一工具的死循环。
- 反转链表 / 链表相加(双指针)/ 排序链表
- 二叉树层序遍历、接雨水、无重复字符的最长子串
- Top-K(快速选择 vs 堆,复杂度 / 并行化)、字符串解码 k[encoded]
软性问题与职业发展
- 深挖简历里的 Agent 项目——落地逻辑、核心难点、指标怎么量化出来的、后续改进思路——这是所有大厂面试的主线,占比最高
- 你自己搭过 Agent 吗?工作流是怎样的?能不能现场演示一下你负责的 Agent?(越来越常见的「当场验真」)
- 平时用哪些 AI 编程工具(Claude Code / Cursor / Codex / 通义灵码)?怎么用的?(高频闲聊切入)
- 你在 AI 编程工具里装了哪些 Skill、写过哪些复杂 Skill?效果怎么验证的?(快手)
- AI Coding 流程里如何避免大模型随意发挥、改坏历史功能?(阿里巴巴)
- AI 编程中的 Plan 模式和 Agent 模式有什么区别?(小红书)
- 怎么看待从提示词工程到 Skill 这类概念的快速迭代?用框架和直接调大模型的差异在哪?(字节跳动)
- To C 和 To B 的 AI Agent 哪个会先爆发?未来 AI Agent 会是什么形态?(腾讯)
- 你如何甄别 AI 输出的思路和内容是否准确,避免被幻觉带偏?(OPPO)
- 你认为 Agent 的商业化成本是在上升还是下降?(拼多多)
- 平时关注哪些 AI Agent 相关的前沿技术?最近看过哪些相关论文或产品?
备考重点
大模型应用 / Agent 工程岗(快手 / 腾讯 / 京东 / 网易 AI 应用开发)——重点在工具调用(Function Calling、MCP、Skills)、记忆与上下文工程、多智能体协作三块,几乎每题都会追一句「你们项目里具体怎么做的」,框架层面 LangGraph 和 Spring AI 都要能聊。
2026 下半年新增的三个重灾区:Agent Harness 与运行时工程(怎么设计、和 MCP / Skills 的边界在哪)、评估与安全兜底(Agent Loop 状态怎么暂停恢复、越权调用怎么监控、幻觉链式传播怎么截断)、多智能体编排(去中心化调度、子任务失败可回退、跨 Agent 隔离)。这三块几乎每轮都会问到,而且都要求结合项目讲出具体做法。
面试官越来越爱追问「怎么量化」:幻觉率怎么定义、记忆有没有指标、Agent 效果提升的百分比用哪个测试集算出来的。简历上写的每个数字都要能讲清楚是怎么算出来的——只报结论不报口径,基本会被一路追到底。
常见问题
这份题单是怎么整理出来的?
来源是公开面经,把 AI Agent 相关的提问单独抽出来重新归类,不包含面灵用户的面试内容。括号里标注的是近期实际问过这道题的公司,只作参考,不代表完整名单。
AI Agent 面试和大模型算法岗面试差别大吗?
差别很大。大模型算法岗重心在模型结构、训练和强化学习对齐,Agent 岗几乎不问 RLHF 推导,但工具调用、Harness、记忆与上下文工程、多智能体协作会问得非常细,还会要求现场演示或深挖你做过的 Agent 项目。如果两条线都要准备,可以搭配大模型面试题合集一起看。
只背这些题能过面试吗?
不能。这份题单解决的是「准备方向不跑偏」的问题——它告诉你面试官现在在问什么、往哪个方向追。但 Agent 面试有大量时间在挖你的项目细节和现场设计能力,几乎每道概念题后面都跟着一句「你们具体怎么做的、效果怎么量化的」。建议按题单排查知识盲区,同时准备一个能讲清楚设计取舍的真实案例。
没有 Agent 项目经历怎么办?
先把一个最小 ReAct Agent 完整搭一遍——从工具注册、循环控制、终止条件到异常处理,再加一层简单的记忆管理和上下文压缩。这件事可以在本地独立完成,也正好覆盖题单里问得最密的工具调用和记忆两章。搭的过程中记录踩过的坑和调优前后的数据,这些细节比项目本身的规模更能说服面试官。如果有明确的目标公司和岗位,也可以用面灵AI的定制题库功能,结合你的简历生成更贴合目标的专属题库和参考回答。
更多岗位合集
大模型与 AI Agent 面试题汇编:265 道大厂真题按主题归类(2026 版)
面灵AI 整理的大模型算法岗与 AI 应用开发岗面试题合集,265 道题按九大主题归类,覆盖 Transformer 结构、推理优化、RLHF 与 GRPO 对齐、RAG 全链路、AI Agent 架构与工具调用、上下文工程、多模态与具身智能,并标注近期实际出题的公司。
后端开发面试高频题 Top 25:真实面试热度榜(2026 年 8 月版)
基于后端开发岗近 90 天的公开面经整理:这个周期实际被高频问到的 25 道题,标注热度等级和近期实际出题的知名公司,附答题框架解析。
后端开发面试高频题 Top 25:真实面试热度榜(2026 年 7 月版)
基于后端开发岗近 90 天的公开面经整理:被问得最多的 25 道高频题,标注热度等级和近期实际出题的知名公司,附答题框架解析。