大模型(LLM)的基础原理是什么?

2026年 阅读约 9 分钟 面试指南 · AI面试

AI开发面试题:大模型基础原理,Token与上下文窗口、Transformer自注意力直觉、预训练-微调-RLHF三阶段、幻觉成因与治理、私有化选型,分三层讲解。

一句话总结

LLM 的本质是一个"超大规模的下一个词预测器":输入被切成 Token 序列,Transformer 的自注意力机制让每个 Token 都能"看到"上下文再预测下一个 Token,逐词生成。理解面试三件套:Token 与上下文窗口(有限记忆,按量计费)、预训练→微调→RLHF 三阶段(能力来自预训练,对齐来自后训练)、幻觉(生成模型的固有属性,只能治理不能根除)。

初级理解

什么是大模型:参数量巨大的深度神经网络(十亿到万亿级),在海量文本上训练后获得通用的语言理解与生成能力。常见模型:GPT-4/Claude/Gemini(闭源),DeepSeek、Qwen(通义)、Llama(开源)。

Token 是什么:模型处理文本的最小单位——一个词、半个词或一段拼音字母,中文通常 1 字 ≈ 1~2 个 Token。所有输入输出都按 Token 计数:上下文窗口(模型一次能"记住"的 Token 上限)和 API 计费都以它为单位。

输入: "今天天气真不错" 切分: [今天] [天气] [真] [不错] ← 4 个 Token(示意) 输出: 模型对每个位置计算"下一个 Token 的概率分布" → 逐个采样生成 → "适合出去走走。"

两个常用参数:temperature 控制随机性(0≈确定性输出,1≈更有创造性),top_p 控制采样范围(只从累计概率前 p 的候选词中挑)。

中级深入

Transformer 与自注意力(面试要求讲直觉):自注意力让序列中每个词都与其他所有词计算相关性权重,加权汇总信息——"它把苹果吃了"中"它"能关注到"苹果"。多头注意力则从不同角度(语法/指代/语义)并行做这件事。相比 RNN,它并行计算(训练快)且长距离依赖不衰减。

训练三阶段:

  • 预训练(Pre-training):海量文本上做"下一个词预测",学到语言与世界知识,成本最高(千卡级 GPU)
  • 监督微调(SFT):用高质量"指令-回答"对教会模型听懂指令、按格式回答
  • 人类反馈强化学习(RLHF/DPO):用人类偏好数据对齐,让输出更有用、更安全

为什么会产生幻觉:模型学的是"统计上像真的",不是"事实上为真"——训练数据错误、知识过时、生成过程本质是概率采样。关键认知:幻觉无法根除,只能用检索(RAG)、引用溯源、结果校验来压低概率。这句话能说出来,面试官就知道你不是背题。

记忆口诀:能力是预训练给的,听话是微调教的,安全是 RLHF 磨的,胡说八道是概率天生的。

高级拓展

推理优化(加分项):生成是逐 Token 的自回归过程,每步都要重算注意力——KV Cache 把历史 Key/Value 缓存起来避免重复计算,是推理加速的第一功臣;量化(INT8/INT4)用低精度权重换显存与速度;批处理(Continuous Batching)提升吞吐。vLLM 的 PagedAttention 把显存当"分页内存"管理,是当前私有化部署的标配。

上下文窗口的限制:即使 128K/1M 窗口,也存在"中间内容被忽视"(lost in the middle)和成本线性上涨的问题——所以长文档场景要靠 RAG 精准投喂,而不是无脑塞上下文。

私有化选型考量(后端面试常问):数据合规(金融/政务必须私有化)、成本(GPU 采购 vs API 调用)、能力差距(开源模型在通用能力上仍落后旗舰闭源)、运维复杂度。典型答案:通用能力用 API,敏感数据用私有化小模型 + RAG。

注意:不要把"参数量"当唯一指标——数据质量、训练方法、对齐水平同样决定效果;1.5B 精调模型在垂直任务上打赢千亿通用模型是常态。

实战场景

场景一:老板问"我们该用哪家大模型"

# 决策框架(面试也这么答) 1. 任务类型:通用对话/代码/文档抽取 → 分别测基准 2. 数据敏感性:脱敏可出域?→ 可用 API;否则私有化 3. 成本估算:日均 Token 量 × 单价 vs GPU 折旧 4. 验证方式:拿 200 条真实业务样本做盲测对比

场景二:模型输出不稳定,同一问题时对时错

// 1. temperature 调低(0~0.3),输出更确定 // 2. 结构化输出:JSON Schema 约束 / Few-shot 给范例 // 3. 关键字段加校验层:解析失败自动重试并携带错误反馈 // 4. 高风险场景:规则兜底 + 人工抽检

场景三:上下文超长了怎么办

// 优先级:截断历史对话(保留 system + 最近 N 轮) // → 长文档改 RAG 检索注入 → 摘要压缩历史 // 而不是换更大窗口模型(成本翻倍,问题仍在)

面试模拟

Q:Token 为什么重要?怎么估算成本?

A:Token 是计费和上下文窗口的统一单位,中文大约 1 字 ≈ 1~2 Token。成本 = 输入 Token × 输入单价 + 输出 Token × 输出单价(输出单价通常是输入的 2~4 倍),加上多轮对话会把历史重复计入输入。估算用"日均请求量 × 平均输入输出长度"建模,长对话场景要重点算历史累积的那部分。

Q:大模型的"幻觉"能彻底解决吗?你们怎么治理?

A:不能根除——生成模型本质是概率采样,"说错"是机制自带的。治理是组合拳:① 知识类问题走 RAG,让模型基于检索到的资料回答并标注引用;② 输出结构化 + 字段校验;③ 高风险场景加事实核查(用另一路模型/规则比对);④ 提示词明确"不知道就说不知道"。上线后用抽检集持续监控幻觉率。

Q:为什么大模型都用 Transformer 而不是 RNN?

A:两点决定性优势:① 自注意力是全局两两交互,任意距离的依赖路径长度都是 1(RNN 是 O(n) 且会遗忘);② 训练时可完全并行(RNN 必须按时间步串行),这才使得"海量数据 + 大模型"的规模化训练成立。代价是自注意力 O(n²) 的计算量——所以才有各种注意力优化和 KV Cache 这些工程课题。