大模型 / AI Agent大模型AI AgentRAG面试真题

大模型与 AI Agent 面试题汇编:265 道大厂真题按主题归类(2026 版)

面灵AI 整理的大模型算法岗与 AI 应用开发岗面试题合集,265 道题按九大主题归类,覆盖 Transformer 结构、推理优化、RLHF 与 GRPO 对齐、RAG 全链路、AI Agent 架构与工具调用、上下文工程、多模态与具身智能,并标注近期实际出题的公司。

收录题目
265
统计周期
截至 2026 年 8 月
近期出题公司字节跳动阿里巴巴腾讯美团快手京东百度网易蚂蚁集团小红书
面灵AI
36 分钟阅读

大模型岗的面试题这两年变得特别快。前年还在反复问 Transformer 结构和 LoRA 原理,今年一半的追问都落在上下文工程、Skill 与 Harness、HITL 权限管控这些一年前几乎不存在的概念上——只按去年那份八股准备,进面就会发现问的完全是另一套。

这份汇编把面灵AI 收录的真实面试记录和题库沉淀做了去重归类,再结合公开面经交叉核对,覆盖大模型算法岗和 AI 应用开发岗两条线,一共 265 道题,分成九个主题。

怎么用这份题单:

  • 题目后面括号里是近期实际问过这道题的公司,不代表完整名单,也不代表没标注的公司不问
  • 基础与训练部分(Transformer、预训练、微调对齐)求「说得清、能推导」;RAG、Agent、应用工程部分求「能结合项目讲落地和踩坑」,只有概念没有实践基本会被追穿
  • 几乎每家都会深挖简历项目——reward 怎么设计的、指标怎么量化出来的、难点在哪。这条主线的权重比任何一道八股题都高

主题导航:Transformer 与模型结构 · 预训练与推理优化 · 微调与对齐 · RAG 检索增强生成 · AI Agent · 大模型应用工程 · 多模态与具身智能 · 手撕算法题 · 软性问题与反问

Transformer 与模型结构基础

  • Transformer 整体架构原理?(自注意力 / 多头 / FFN / 残差 / 位置编码 一套讲清)
  • Attention 的本质是什么?能否从数学角度解释?(QKV、缩放点积、softmax)
  • 多头注意力(MHA)用 PyTorch 手撕,要能扩展成 cross-attention。(字节高频手撕)
  • Self-Attention 的复杂度问题,研究者提出了哪些降低复杂度的注意力变体?(MQA / GQA / 稀疏 / 线性注意力)
  • GQA(分组查询注意力)机制是什么,解决什么问题?
  • Pre-Norm 和 Post-Norm 的设计差异?对训练稳定性和性能的影响?(腾讯)
  • LayerNorm 与 RMSNorm 的区别与原理?为什么大模型多用 RMSNorm?
  • FFN 网络结构?SwiGLU 激活函数?Qwen3 FFN 层的结构设计特点?(美团)
  • 位置编码方案有哪些?RoPE(旋转位置编码)原理?Qwen3-VL 的 MRoPE?(爱奇艺 / 美团)
  • 为什么生成式大模型普遍用 Decoder-only 而非 Encoder-Decoder?(腾讯 / 阿里)
  • Decoder-only 模型在分类任务上有没有可能比 Encoder-only 做得更好?(字节抖音搜推)
  • 梯度消失 / 爆炸的解决方案?(网易)
  • KV Cache 是什么?生成新 token 时是否需要和所有历史 token 重新计算?如何评估缓存命中效果?(字节 / 网易)
  • MLA(多头潜在注意力)了解吗?(字节)
  • 一段文本会被切成多少 token?token 是如何划分的?(BPE / 分词原理)
  • 大模型参数量和显存消耗是什么关系?
  • Attention 从 MHA 到 MQA / GQA / MLA 的演进脉络是什么?每一步在省什么?
  • 推理阶段 attention 复杂度是 O(n²),主流有哪些既降计算量又保性能的优化?线性注意力是怎么做的?
  • 稠密模型与 MoE 模型的核心区别?MoE 和 MMoE 是一回事吗?(拼多多)
  • Qwen3 是如何实现推理 / 非推理模式切换的?还有哪些结构改进?(抖音)
  • 从技术角度看,大模型的「遗忘」现象是什么?(拼多多)
  • CNN 和 Transformer 有什么区别?BERT 和 Transformer 分别是什么?(小红书 / 美团)
  • 大模型的「大」体现在哪几个方面?参数量是在什么时候确定的?(美团 / 小红书)
  • 为什么不干脆把上下文窗口做得更大?把上下文扩到 1000K 会遇到哪些核心资源瓶颈?(小红书 / 腾讯)

预训练、分布式训练与推理优化

  • 大模型通用预训练流程?垂域(如电商)二次预训练的必要性及原因?(爱奇艺)
  • Transformer 的词表是如何构建的?
  • MoE(混合专家)原理?如何做负载均衡?MoE 是 batch / token / 还是什么维度的激活?用 Python 手撕一个 MoE。(美团)
  • 千卡训练常见的 NCCL timeout 一般怎么定位和解决?(阿里)
  • kernel 级优化:用 CUTLASS / CUTE DSL 或手写 CUDA 做算子融合(fusion),怎么做?做了 fusion 反而性能下降的原因?(阿里)
  • FlashAttention(FA2)再往下一层,Hopper 架构的 warp specialization 是什么、底层怎么实现?(阿里)
  • 推理加速技术:量化、动态批处理(continuous batching)、FlashAttention。(网易)
  • vLLM 核心原理?PagedAttention 原理?动态批处理和显存管理的创新?(腾讯 / 快手 / 字节)
  • 模型剪枝 / 量化:GPTQ、AWQ、PTQ、QAT 的区别与选型?INT8 / FP16 / BF16 / FP32 精度差异与训练选型?训练推理精度一致性问题?(爱奇艺)
  • 长文本模型结构优化与长文本训练的优化 Trick?如何优化长文本生成的显存占用?(爱奇艺 / 网易)
  • 大模型 API 服务的响应延迟如何优化?(网易)
  • PD 分离(Prefill / Decode 分离)是什么?为什么能提升整体吞吐?
  • 请求发起后 prefix cache 命中、但 KV 已下沉到 SSD,取回链路是怎样的?同步到 GPU 要不要经过主存?(字节)
  • KV Cache 在 prefix 复用场景为什么特别重要?做这块时你平时看哪些指标?(字节)
  • 以 8×7B 为例,KV Cache 与模型权重的显存占比大概如何?除权重外还有哪些显存占用?
  • 仅开启 TP 时如何估算 7B 模型权重的显存需求?7B 做分布式部署采用什么策略?
  • 推测解码(speculative decoding)的原理是什么?它不适用于哪些模型?
  • 结构化剪枝的落地链路:校准数据集处理、权重保存、推理框架加载,中间容易踩什么坑?剪枝后精度如何验证?
  • Megatron / DeepSpeed / vLLM / SGLang 各自定位是什么?你实际用过哪些?
  • 大模型为什么逐 token 流式输出?底层用的是什么协议?(美团)
  • 要做多地域多节点的分布式推理服务,从零设计或复用云组件,整体思路是什么?
  • 线上推理如何做流量监控与 Token 用量监控?组件故障或网络异常后流量怎么恢复?

微调与对齐:SFT / LoRA / RLHF / PPO / DPO / GRPO

  • 常用的微调框架有哪些?各自优缺点?(LLaMA-Factory / trl / verl / DeepSpeed…)(腾讯 / 美团)
  • 微调方法对比:Full Fine-tuning vs LoRA / QLoRA / Adapter / P-Tuning?(网易)
  • LoRA 原理?与全量微调的区别?参数初始化策略?有什么好处?(美团 / 字节 / 快手)
  • SFT 核心流程与数据集构建策略?SFT 之后常见的 Post-Training 还有哪些,目的有何区别?(阿里)
  • SFT 与 RL 强化学习训练的核心差异?什么时候用 SFT、什么时候用蒸馏、什么时候用 GRPO?(美团 / 阿里)
  • RLHF 完整训练流程?奖励模型(RM)的训练数据如何构建?(字节 / 网易)
  • RLHF、PPO、DPO 的技术差异、优缺点及适用场景?(腾讯)
  • DPO 相对 PPO 的核心改进与优势?DPO 训练的注意事项?(美团 / 阿里)
  • PPO-DPO-GRPO 路线演进的历程与启发?GRPO 之后还有哪些 RL 算法(如 DAPO)?(富途 / 字节)
  • GRPO 的 loss 怎么讲?为什么选 GRPO 不用 SFT?(阿里)
  • Advantages 怎么算的?为什么需要 Advantages,直接用 reward 算不行吗?(阿里)
  • 重要性采样为什么需要?新旧策略差别很大时重要性采样还有用吗?(阿里)
  • PPO / GRPO 是 on-policy 还是 off-policy?PPO 的 critic 模型怎么训练?(阿里 / 字节)
  • GRPO 的 KL 散度和 PPO 的 KL 散度一模一样吗?KL 散度的推导?放在 loss 里和放在 reward 里的区别、作用与适用场景?(字节)
  • 信用分配:GRPO 中序列级奖励如何分配到每个 token?(阿里)
  • Reward hacking / 奖励坍缩的原因及解决方法?(字节)
  • RL 训练看哪些指标?loss 异常升降如何分析?(字节)
  • RLVR 训练能否认为是一种 SFT?(字节)
  • Agentic RL:设计思路?SFT 到什么阶段可以做 RL?长对话 / 多轮如何做 reward(何时用模型、何时用规则)?如何评估?(字节)
  • 分层式自蒸馏模型是什么?
  • 预训练、SFT、强化学习分别解决什么问题?边界在哪?(抖音)
  • 优化模型效果时,什么时候该调 Prompt、什么时候该直接微调?面对客户需求怎么判断用 RAG 还是微调?(阿里)
  • 只有 2000 条数据的微调为什么也能提升准确率?微调数据集从哪来、怎么标注、规模多大合适?(小红书)
  • 强化学习训练时是调整全部权重还是只调部分权重?
  • 如何评估微调前后的提升?判断训练是否达到预期主要看哪些指标?(字节)
  • 微调完成后如何做工程落地——部署、精度对齐、回归验证怎么串起来?(小红书)

RAG 检索增强生成

  • 什么是 RAG?基本流程?(几乎必问,字节 / 京东 / 滴滴 / 美团 / 腾讯…)
  • RAG 相比微调有什么好处?什么场景用 RAG、什么场景用微调?
  • RAG 如何缓解大模型幻觉?原理是什么?
  • 文档切分(chunk)策略:粒度如何选择?切片切断关键上下文怎么办?分块大小如何界定?
  • 向量化:为什么需要向量化?直接文本匹配为什么不够?什么是向量?
  • Embedding 模型如何选择?向量维度如何选择?(快手 / 腾讯 / 京东)
  • 向量库选型:Milvus / ES / HNSW / IVF_FLAT 的区别与适用场景?索引原理?(字节 / 美团 / 快手)
  • 能否用 Elasticsearch 做向量库?如何做向量 + 关键词混合检索(BM25 + 向量)?(京东 / 钉钉)
  • 混合检索的召回率 / 精确率如何评估,权重如何设置?RRF 的 K 值调大还是调小?(京东 / 美团)
  • 为什么需要 Rerank?什么情况下可以不接?双向量召回 vs 单向量召回?(京东 / 快手)
  • Query 改写 / 问题拆分的意义与实现?针对模糊提问如何精准检索、如何识别问题模糊度?(携程 / 美团)
  • 如何评估 RAG 效果?准确率 / TopK 命中率如何量化?评测集从哪来、需要多少数据?(字节 / 阿里 / 京东)
  • RAG 回答错误时如何定位是检索问题还是生成问题?(钉钉)
  • 术语归一化为什么需要?(携程)
  • RAG 知识入库流程?增量更新耗时在哪些环节?知识库如何持续保鲜?(字节 / 快手 / 美团)
  • Graph RAG 和 Agentic RAG 是什么?(快手)
  • RAG 的数据安全 / 隐私泄露问题如何解决?(字节 / 蚂蚁)
  • RAG 服务降级策略如何设计,哪些场景触发降级?(京东)
  • 为什么要做多路(向量 + 关键词 + 层级)召回?每一路的优缺点和 bad case 分别是什么?最初的设计初衷是解决什么实际问题?(字节)
  • 多路召回结果冲突时怎么确定 Top?RRF 具体怎么融合三路结果?(字节)
  • 召回了 30 条但上下文只放得下 6 条,你怎么取舍?(字节)
  • 带权限的知识库,是 ACL 先过滤再召回,还是先召回再过滤?越权召回怎么做监控、怎么验证数据没被越权访问?(字节)
  • 为什么 Top-K 不能设得过大?切完 chunk 之后 Top-K 应该怎么选?
  • RAG 无召回 / 召回不准时,除了换 Embedding 还有哪些解法?召不回时应该怎么回复用户?(小鹏)
  • 如何定位一次具体的检索失败案例?只有两天时间要把命中率从 60% 提到 90%,你先动哪里?
  • 为什么向量相似不一定等于语义相似?垂直领域的专业术语会不会让 Embedding 效果下降,怎么办?(小红书 / 字节)
  • 文档频繁更新时,如何保证向量索引与原文一致?增量更新的耗时主要花在哪些环节?(小红书)
  • 长文档跨章节、召回片段指向其他文档时如何切分与召回?跨窗口多轮对话怎么保证还能召回前文内容?(字节 / 小红书)
  • 知识图谱和向量检索如何配合?是先查图库再查向量库,还是反过来?图谱是初期就上还是等向量库扛不住再上?
  • 什么是 Agentic Search?Graph RAG 和多跳检索分别解决什么问题?(小红书 / 亚信)
  • 什么时候触发联网检索、什么时候直接回答?常识类问题也强制检索吗?(字节)
  • 如何判断模型是「不知道需要检索」才幻觉,还是「知道需要检索但没执行」?(字节)
  • 入库、混合检索、重排这几步里,哪一步的投入产出比最高?
  • 完整讲一遍文档导入流水线:从 API 上传到最终可被检索,中间有哪些处理环节?
  • 如何构建数据集来验证 RAG 系统效果?评测集需要多少条、从哪来?(字节)

AI Agent:架构、工具调用、记忆与多智能体

这一章是 2026 年占比最重的部分,也是最容易问出真实水平的部分——概念题几乎都会被追一句「你们项目里具体怎么做的」。

概念与架构

  • AI Agent 是什么?Agent 究竟解决了什么问题,为什么用 Agent 而不是直接用大模型?(蚂蚁 / 字节 / 快手 / 腾讯)
  • 常见 Agent 架构模式有哪些?ReAct / Plan-Execute-Replan / Multi-Agent 分别适用什么场景?(阿里 / 美团 / 字节)
  • ReAct 是什么?工作流程、优缺点?循环如何防止无限调用 / 提前退出?如何用状态机实现?(腾讯 / 京东 / 美团)
  • Plan-Execute-Replan 为什么需要监管 Agent?(字节)
  • Agent 和 Workflow 的关系,分别适合什么场景?(字节)
  • Agent 项目与传统后端项目的架构差异?(快手)
  • Agent 的组装链 / 执行链如何设计,执行时如何降级?(腾讯)
  • 用大白话说清楚什么是 Agent。它和传统对话系统、Siri 类助手、传统 RPA 的边界分别在哪?(字节 / 通义)
  • 搭一个大模型应用,如何在「单次提示词 / Workflow / Agent」三种方案之间选型?判断依据是什么?(字节)
  • 什么时候应该固化成垂直领域 Agent,什么时候要保系统泛化性?遇到从没设计过的 Agent 类型怎么保证泛化能力?(字节)
  • 最小可用 Agent 的核心模块是不是一个 ReAct Loop?除了工具调用还必须实现什么?
  • 企业落地 Agent 系统最大的瓶颈是什么?用 Agent 有哪些弊端、怎么降低风险?(小红书 / 字节)
  • 复杂场景既需要 Plan-Execute 的全局规划、又需要 ReAct 的实时反馈,架构怎么设计?(小红书)

Agent Harness(2026 新热点)

  • 对 Agentic RL 的了解?harness 做的事情 LangChain 等也一直在做,为什么 harness 现在这么火,区别是什么?(字节大模型算法三面)
  • 聊 harness、Hermes 这种比较新的 Agent 设计,讲讲最新看的论文。(字节暑期)
  • OpenClaw / Manus 是什么?为什么火?区别是什么?(美团)
  • Agent Harness 主要解决什么问题?上下文工程和 Harness 工程有什么区别?(小红书)
  • 市面上主流的开源 Agent Harness 框架有哪些?你最近了解过哪些?(快手)
  • 你了解 Claude Code 的上下文管理方式和实现思路吗?(快手 / 蔚来)
  • 为什么不用 Deep Agents 而选 LangGraph?你认为 Deep Agents 不稳定的原因是什么?
  • 业界这么多 Agent Runtime,平台侧如何统一适配和管理?(字节)
  • 未来更可能是一个 Super Agent 通吃所有任务,还是 Host Agent 加多个 Sub Agent?(字节)

工具调用:Function Calling、MCP 与 Skills

  • Function Calling 的原理与执行流程?模型如何知道调用哪个工具?如何理解 Tool Use?(阿里 / 快手 / 京东)
  • 大模型返回的 Function Call 参数格式不对怎么办?(阿里)
  • MCP 是什么?主要作用?底层原理?与 Function Calling / 传统 Tool 注册的区别?(字节 / 腾讯 / 京东 / 阿里)
  • MCP 和 Skills 有什么区别?Prompt、MCP、Skills、Subagent 分别如何理解?(字节 / 京东 / 美团)
  • Agent Skills 是什么、如何加载、如何实现?为什么用 Skills 能减少 token 消耗?(网易 / 快手 / 腾讯)
  • Function Call、MCP、Skill 三者区别?(B站)
  • 大规模工具集下如何降低工具调用幻觉、提升准确性?工具调用失败如何处理?(字节 / 快手)
  • 没有 MCP 之前多 Agent 协同是怎么做的?(用 Function Calling 分发)
  • MCP 是否已经过时?为什么现在没那么流行了?(阿里千问)
  • A2A 和 MCP 是什么关系?多 Agent 之间的通信协议应该怎么设计?(阿里千问 / 字节)
  • 如果让你设计一套 Agent Skill 系统,你会怎么设计?一个好的 Skill 结构应该包含哪些字段?(快手)
  • 注册了上百个候选 Skill 该怎么处理——检索、分层还是渐进式披露?(快手)
  • Skill 相比纯模型回答为什么能提升准确性?你怎么验证一个 Skill 真的带来了效率提升?(快手)
  • 工具调用的编排放在 Skill 里还是 Agent 里?工具在 Agent 内定义,还是由 MCP 平台统一提供?
  • 如何决定哪个 Agent 能访问哪些 MCP 服务?所有 Agent 都能访问全部 MCP 吗?
  • 模型输出格式漂移导致工具调用失败,如何用提示词约束加结构化校验解决?边界条件和错误场景怎么定义?(快手)
  • 工具调用报错、长时间无响应、连续失败时的重试、超时与异常隔离策略怎么设计?(快手 / 蔚来)
  • 大量工具并存时,如何提升模型选对工具的准确率?除了工具描述还有什么手段?

记忆与上下文工程

  • Agent 的短期记忆和长期记忆如何实现、如何区分?记忆管理如何设计?(京东 / 携程 / 美团 / 快手)
  • 记忆模块选什么数据库,选型依据?(京东科技)
  • 记忆如何召回?如何评估召回效果?如何避免不同问题召回记忆相互污染?(字节)
  • 上下文管理机制如何设计?上下文压缩有哪些策略、如何避免过滤有用信息 / 保留噪声?(京东物流 / 阿里)
  • 长对话 / 上下文窗口受限如何处理超长上下文?滑动窗口 + 摘要方案?(字节 / 腾讯)
  • 上下文管理的本质是什么?一套完整的上下文管理策略包含哪些环节,最重要的是哪一环?(字节)
  • 上下文压缩应该放在链路的哪一步?是先压缩再向量化,还是反过来?(字节)
  • 工具调用结果怎么压缩——原地压缩还是交给另一个模型处理?压缩之后对执行效果和耗时有什么影响?(字节)
  • 为什么上下文越长,模型结果反而越不稳定?为什么指令在上下文里的位置会影响效果?System Prompt 为什么要放最前面?
  • 快到上下文窗口阈值时,如何避免一次性大段压缩打断用户体验?(字节)
  • 除了压缩,还有哪些规避上下文窗口限制的方案(落盘摘要、外部记忆、大结果卸载)?大结果卸载在工程上怎么实现?(字节 / 蔚来)
  • 多轮长任务如何避免「任务目标迷失」?怎么理解「无限长记忆」和必须舍弃历史信息之间的矛盾?(字节)
  • 怎么区分上下文污染和工具污染?AI 工具上下文跑偏时,是继续控制上下文还是新开一个 session?(字节)
  • 长期记忆和 RAG 有什么区别?Agent 的记忆为什么要区分长短期,架构上有什么不同?(阿里千问 / 通义)
  • 记忆有没有量化指标?怎么评测记忆对 Agent 效果的贡献?怎么避免不同问题召回的记忆互相污染?(字节)
  • 长期运行的 Agent 面对数月甚至更久的历史对话,记忆系统怎么优化?记忆如何在多个 Agent 之间流转?(小红书 / 蔚来)
  • 设计长期记忆时,如何权衡向量检索成本和召回精度?(通义)
  • 如何保证压缩过程中不丢关键内容?怎么判断上下文里哪些是关键内容?压缩导致结果失真如何缓解?(小红书)

多智能体协作

  • 多 Agent 协作模式如何理解?多 Agent 相比单智能体的优势?(阿里 / 美团)
  • 子 Agent 之间如何交互 / 通信?交互协议如何设计?串行还是并行执行、如何取舍?(美团 / 快手)
  • 主 Agent 如何动态识别并选择要调用的子 Agent?固定工作流还是动态判断?(美团)
  • 多个 Agent 策略结论 / 角色不一致时如何处理?(京东)
  • Agent 多轮工具调用 vs 单轮,有什么挑战?(阿里)
  • 主 Agent 怎么知道子 Agent 已经执行完成?子任务结果如何回收?(蔚来)
  • 多 Agent 用独立 JSON 消息做异步通信要怎么设计?通信失败有哪些兜底机制?(蔚来)
  • 用 Markdown 文件在 Agent 之间传递任务时,如何防止任务拆分阶段的错误一路传播下去?(字节)
  • 多个 Agent 如何做到完全隔离(上下文、权限、存储)?跨 Agent 场景下统一存储怎么通信和传输?(字节 / 蚂蚁)
  • 多 Agent 调研类系统该选中心化还是去中心化调度?怎么做到子任务失败可回退、进度可观测、不重复抓取?
  • 除了路由分发,还有哪些常见的多 Agent 协作方式?是否了解 Agent Team 和动态任务分发机制?(字节)
  • 多智能体是否真的能提升效率?相比单智能体的独特价值怎么证明、怎么评估?(字节)
  • 子 Agent 执行中发现需要额外的新任务,任务应该怎么流转和审批?(腾讯广告)

评估、安全与兜底

  • Agent 评估体系包括哪些维度?如何衡量 planning 能力 vs hallucination rate?(阿里)
  • Agent 项目应统计哪些指标衡量效果?(字节)
  • 智能体死循环 / 无限调用的原因及解决?为什么要设计三层防护机制?Token 监控与防循环?(字节 / 快手)
  • Agent 如何做权限控制避免越权 / 不合理操作?金融场景如何限制 Agent 直接执行真实资金操作?(腾讯 / 京东)
  • 为什么 Agent 能力要采用「渐进式披露」?(美团)
  • Prompt Injection / Indirect Prompt Injection 是什么?如何防范恶意提示词?(钉钉)
  • 沙箱机制如何实现?(B站系统设计)
  • 生产环境 Agent 的四类典型故障——思考链错误传播、工具幻觉、JSON 格式崩坏、无限循环调用——分别是怎么发生的?如何从模型提示、Agent 调度框架、工程校验三层分别解决?(字节)
  • 如何设计机制终止无效循环,而不是只依赖最大轮次?超时和重试限制怎么设?(字节)
  • 线上 Agent 一直调工具但不返回结果,怎么 Debug?多步任务失败时如何区分是 Prompt、模型、工具还是逻辑问题?(字节 / 腾讯混元)
  • 如何建立 Agent 的可观测性(轨迹留存、指标、回放)?除响应速度外,哪些指标能体现真实的问题解决能力?(通义)
  • 幻觉率怎么定义和计算?幻觉如何分类?靠人工标注还是自动评测?降幻觉的数字是怎么量化出来的?(字节)
  • 如何区分「内容过时」和「模型幻觉」?(字节)
  • HITL:触发人工确认时 Agent Loop 处于什么状态?状态怎么暂停、暂存和恢复?用户确认或拒绝后怎么继续执行?(蔚来)
  • 哪些内容必须人工审核、不能交给 Agent?运维类 Agent 能重启机器和服务时,高危操作怎么管控?(蚂蚁 / 唯品会)
  • 如何防止网页、外部文档里的恶意指令注入 Agent?抓回来的内容怎么保证可信?(字节)
  • Agent 已经完成初始身份认证,为什么还需要连续认证?MCP Tool 加上身份校验后,入参、处理和返回值有什么变化?(字节)
  • 如何防止用户恶意引导模型传入其他用户的 ID?模型传错 ID 时怎么处理?
  • Agent 执行到中间某个阶段出异常,如何断点恢复?整体兜底方案是什么?(字节)
  • Agent 的执行过程要不要向用户透明展示?展示到什么粒度?

系统设计题(高频压轴)

  • 设计一个多 Agent 自动 PR 系统 / 单 Agent 类 GPT web 应用(从沙箱、Agent 通信、上下文管理、工具触发、安全性几个角度展开)。(B站)
  • AI 客服 Agent / 视频问答 Agent / 股票分析 Agent 全链路如何设计?(阿里 / 快手 / 京东)
  • 设计一个 AI 代码 Review Agent:输入一个 PR,整体方案怎么做?最重要的三个点是什么?怎么保证它只提意见、不直接改代码?(字节)
  • 设计企业知识库 / 本地化 Wiki Agent:完整链路、文档导入、权限隔离、效果评测怎么串起来?(字节 / Shopee)
  • 设计一个内容标注 Agent(视频 / 图文):流程如何划分,要用到素材里的哪些信息?(抖音)
  • 设计电商客服 Agent:如何理解表达能力参差的用户的模糊需求?商品召不回时怎么回复?核心成功指标怎么定?(通义)
  • 设计运维 / 故障排查 Agent:支付接口超时时它怎么跑完整套排查流程?高危操作如何管控?(字节 / 唯品会)
  • 设计多 Agent 文献调研系统:三个核心风险是什么,分别怎么应对?
  • 设计一个覆盖训练、微调、评测、部署、服务的一体化 AI 开发平台,你会怎么分层?(腾讯混元)

大模型应用工程:框架、Prompt、Token 与服务化

  • LangChain 和 LangGraph 有什么区别?LangGraph 的状态快照机制怎么实现?(字节 / 快手)
  • 为什么选 Spring AI 而不是 LangChain4j?Java 端如何适配 LangChain / LangGraph?(京东 / 字节 / 快手)
  • 主流 Agent 框架有哪些?非 Java 生态的 Agent 框架?(快手 / 京东)
  • CoT 是什么?为什么能提高复杂任务处理能力?Few-shot 与 CoT 如何应用?(快手)
  • Prompt 设计的实践原则?Prompt 调优从哪些方面入手?版本管理如何设计?(快手 / 京东)
  • System Prompt 和 Assistant Prompt 的区别?Prompt 压缩以降低 token?(腾讯)
  • 大模型结构化输出 / 稳定返回正确 JSON 如何实现?JSON 解析失败如何降级?(百度 / 小红书)
  • 大模型的「温度」是什么?什么场景会调温度参数?(B站)
  • Token 如何计费?如何统计与可视化?如何节省 token?(飞猪 / 百度)
  • 为什么不直接调大模型 API,而要设计统一的大模型服务架构?大模型接入方案如何选型?(京东科技 / 腾讯)
  • 大模型选型要考虑哪些因素?什么时候考虑微调?(京东 / 字节)
  • 幻觉的类型有哪些?工程上如何缓解 / 落地控制?(快手 / 京东)
  • 如何检测大模型回答质量 / 输出准确率?如果检测 Agent 自身也会幻觉,如何保证其可靠?(滴滴 / 美团 / 腾讯)
  • CLIP zero-shot 能力如何实现?多模态图文对齐方案?图像 Token 冗余过多如何解决?Embedding 模型与 Reranker 的差异、训练 Loss 区别?(腾讯 / 爱奇艺)
  • 如何设计「按任务动态选模型」的路由机制?复杂任务和简单任务该不该用不同档位的模型?主 Agent 和子 Agent 分别用多大参数量?
  • 为什么不直接换参数更大、能力更强的模型?什么业务适合大模型、什么适合小模型?小模型能否独立干活?(美团)
  • Token 成本治理怎么做——监控、归因、配额还是缓存?你清楚自己每天 / 每月大概消耗多少 Token 吗?(腾讯 / 字节)
  • 你认为 Agent 的商业化成本是在上升还是下降?(拼多多)
  • Prompt Cache 和多模型缓存适配是怎么实现的?
  • 提示词的结构怎么组织,需要注意什么?用中文还是英文写?多类精细化提示词是前置分类,还是在子模块里决定用哪一类?(蔚来)
  • Prompt 和模型配置如何做版本管理与灰度?什么情况该调 Prompt、什么情况该改 Agent 工作流?(字节 / Shopee)
  • 让 AI 自己生成 Prompt、再由 Prompt 生成一个新 Agent,这条链路怎么设计?(字节)
  • 大模型输出的校验该由模型做还是代码做?校验模板化怎么落地?(字节)
  • 是否实验过不同 Temperature 对模型效果的影响?什么场景需要调?
  • 大模型回答要同时满足相关性、准确性和权威性,只能舍一个的话舍哪个?为什么?
  • 如何建立一套大模型效果评估体系?如何对业务在用的模型做系统评测、并做横向对比选型?(蔚来 / 美团 / 百度)

多模态、具身智能与垂类大模型

这一块是 2026 年新长出来的方向,题目还没沉淀成八股,问法普遍偏开放,更看重你有没有真的动手做过。

  • 多模态模型怎么做图文对齐?「小狗在草地上玩耍」这句话和对应图片是怎么匹配上的?
  • 改进过的视觉编码器和没改进的,你怎么设计对比实验来验证效果?
  • 图像 token 冗余过多如何解决?模型应该如何表示音频、视频、数字人这类多模态元素?(腾讯 / 语核科技)
  • 图片是如何向量化的?图搜、图文混合检索的链路怎么设计?
  • 如果要把纯文本 RAG 扩展到支持图片和视频,你会怎么处理和设计?(字节)
  • 视频内容识别与拆解 Agent:模型、工具和执行架构怎么选?核心流程如何划分?(语核科技)
  • 原始 VLA 模型不做数据收集和微调时表现如何?微调需要多少数据?(字节)
  • 具身场景里,低频的模型推理和高频的实时控制怎么同步?推理放本地还是云端?在线跑视觉、语言和控制模块会不会卡顿?(字节)
  • 层次化 VLA 范式和直接训练一个通用视觉运动模型,你倾向哪种?为什么?
  • 视觉模型的推理时延、端到端延迟和 Token 生成速度怎么测?指标是固定的吗?
  • 是否关注过用多模态模型加代码直接编排机器人任务的做法?(字节)
  • 时序大模型目前业界主流有哪些、各自什么特点?这个领域的预训练现状如何?(字节)
  • 面向图文、视频、语音、评论等多模态内容,如何设计标签体系和采集策略?(小红书)

高频手撕算法题

大模型岗的手撕分两类:一类是本岗位特色的模型 / Agent 手撕,一类是照常考的通用算法题。前者近一年权重明显上升。

  • 多头注意力 MHA(可扩展 cross-attention)、用 Python 实现 MoE —— 大模型岗特色手撕
  • 脱离任何框架,手写一个 ReAct 模式的最小 Agent:工具注册、循环控制、终止条件、异常处理分别怎么实现 —— 2026 下半年新出现的高频手撕,应用岗尤其常考
  • 手写一个简易上下文压缩 / 滑动窗口摘要逻辑(给定消息列表和 token 上限,决定保留、摘要还是卸载)
  • 反转链表 / 链表相加(双指针)/ 排序链表
  • 二叉树层序遍历、接雨水、无重复字符的最长子串
  • 最大正方形(01 矩阵)、路径总和 III、x 的平方根(整数)
  • Top-K(快速选择 vs 堆,复杂度 / 并行化 / 无序数组能否二分)、字符串解码 k[encoded]
  • 正则匹配连续 N 位数字

软性问题与反问

  • 深挖简历里每个项目(落地逻辑、核心难点、指标怎么量化出来的、后续改进思路)——这是所有大厂面试的主线,占比最高
  • 平时关注哪些 AI 前沿技术?最近看的大模型论文?(字节 / 蚂蚁反复问)
  • 你怎么看 AI 对软件工程 / 学习的影响?(B站)
  • 平时用哪些 AI 编程工具(Claude Code / Cursor / Codex / 通义灵码)?怎么用的?(高频闲聊切入)
  • 你在 AI 编程工具里装了哪些 Skill、写过哪些复杂 Skill?效果怎么验证的?(快手)
  • AI Coding 流程里如何避免大模型随意发挥、改坏历史功能?(阿里)
  • AI 编程中的 Plan 模式和 Agent 模式有什么区别?(小红书)
  • 怎么看待从提示词工程到 Skill 这类概念的快速迭代?用框架和直接调大模型的差异在哪?(字节)
  • To C 和 To B 的 AI Agent 哪个会先爆发?未来 AI Agent 会是什么形态?(腾讯)
  • 你如何甄别 AI 输出的思路和内容是否准确,避免被幻觉带偏?(OPPO)
  • 你自己搭过 Agent 吗?工作流是怎样的?能不能现场演示一下你负责的 Agent?(越来越常见的「当场验真」)

备考重点

算法岗(字节 / 阿里 / 美团大模型算法)——强化学习对齐是绝对重灾区:PPO、DPO、GRPO 的公式,Advantage、KL、on/off-policy、reward hacking 必须能推能讲;Transformer 结构细节(RMSNorm、RoPE、GQA、SwiGLU、MoE)加手撕 MHA。

应用 / 后端岗(快手 / 腾讯 / 京东 / 网易 AI 应用开发)——RAG 全链路加 Agent 工程(工具调用、MCP、记忆、多智能体),框架层面 LangGraph 和 Spring AI 都要能聊,重点是结合项目讲落地。

两类岗都会问的通吃项:RAG、Agent 架构、Function Calling 与 MCP、幻觉治理、vLLM 推理。

2026 下半年新增的四个重灾区:上下文工程(压缩放在哪一步、工具结果怎么压、上下文污染怎么判)、Skill 与 Harness 体系(怎么设计、上百个 Skill 怎么管、和 MCP 的边界)、HITL 与权限管控(Loop 状态怎么暂停恢复、ACL 先过滤还是后过滤、越权怎么监控)、成本与可观测性(Token 治理、轨迹留存、失败归因)。这四块在应用和工程岗几乎每轮都会问,而且都要求结合项目讲出具体做法和数字。

面试官越来越爱追问「怎么量化」:幻觉率怎么定义、召回率怎么测、记忆有没有指标、提升的百分比用哪个测试集算出来的。简历上写的每个数字都要能讲清楚是怎么算出来的——只报结论不报口径,基本会被一路追到底。

常见问题

这份题单是怎么整理出来的?

来源是面灵AI 收录的真实面试记录和平台题库沉淀,再结合公开面经交叉核对,把同一道题的不同问法合并去重,按主题归类。括号里标注的是近期实际问过这道题的公司,只作参考,不代表完整名单。

大模型算法岗和 AI 应用开发岗,题目差别大吗?

差别主要在前三章和后三章。算法岗把重心压在模型结构、训练和强化学习对齐上,手撕也偏模型实现;应用开发岗几乎不问 RLHF 推导,但 RAG 全链路、Agent 架构、工具调用和上下文工程会问得非常细,还会要求你讲清线上事故是怎么定位的。中间的 RAG 和 Agent 两章是两类岗位的公共部分,谁都躲不掉。

只背这些题能过面试吗?

不能。这份题单解决的是「准备方向不跑偏」的问题——它告诉你面试官现在在问什么、往哪个方向追。但 2026 年的大模型面试有一半时间在挖你的项目细节,几乎每道概念题后面都跟着一句「你们具体怎么做的、效果怎么量化的」。建议按题单排查自己的知识盲区,同时给每个主题准备一个自己做过的真实案例。

没有大模型项目经历怎么办?

先把 RAG 和最小 Agent 这两条链路自己完整搭一遍——从文档切分、向量入库、混合检索、重排,到一个能注册工具、控制循环、处理异常的 ReAct Loop。这两件事都能在本地做完,也正好覆盖题单里问得最密的部分。搭的过程中记录踩过的坑和调优前后的数据,这些细节比项目本身的规模更能说服面试官。

有没有针对具体公司的版本?

这份是按岗位大类整理的通用版。如果你有明确的目标公司和岗位,可以用面灵AI的定制题库功能,结合你的简历生成更贴合目标的专属题库和参考回答。

想要一份属于你的题库?

按你的目标公司和岗位,定制专属高频题

这份合集是官方按岗位整理的通用版。告诉面灵AI 你要面的公司和岗位,结合你的简历,生成一份只属于你的近期高频题和参考回答。