第 17 章 AI 算法Transformer大模型

第 17 章 安全与评估

第17章 安全与评估

17.1 安全与评估概述

评估回答模型有多可靠,安全回答模型何时不可信,本章围绕这两条主线展开,聚焦评测口径与安全威胁的检测防御,并 量化安全的代价。长上下文评测的技术细节从略。

17.1.1 安全与评估的一体两面

大语言模型的安全性与评估能力是一体两面:有效的评估发现安全漏洞,强大的安全机制需要评估来验证。随着模型能力 的跃升,安全威胁的复杂度和评估的难度同步增长——欺骗探测器的可靠性以分类精度度量,对齐税以基准分数的降幅定 义,Agent 的生产保障依赖持续监控指标。离开度量工具,安全问题既无法被发现,也无法被证明已被解决。

17.1.2 安全威胁的分类体系

2026 年的安全威胁可分为攻击、漏洞与滥用三个维度,如图 17-1 所示。 LLM Security Threats Attack Vulnerability Misuse Jailbreak Adversarial examples Prompt Injection Hallucination Bias Deception Privacy Leakage Disinformation Impersonation Automated Abuse Chemical/Biological Weap ons Info 图17-1 安全威胁的分类体系 威胁类型 攻击面 防御难度 代表性案例 越狱攻击 提示工程 中 DAN 提示、多语言越狱 对抗样本 Token 嵌入 高 GCG 攻击、AutoDAN 提示注入 上下文窗口 高 间接注入、多轮注入 幻觉 生成机制 极高 虚构引用、事实错误 隐私泄露 训练数据记忆 高 训练数据提取攻击 欺骗 内部表征 极高 Sycophancy、Reward Hacking 表17-1 LLM 主要安全威胁 三类威胁的防御难度差异显著。越狱攻击源于训练分布未覆盖的提示模式,可通过红队迭代持续收窄;对抗样本与提示注 入利用上下文窗口这一天然攻击面,防御成本高;幻觉与欺骗植根于生成机制与内部表征本身,是最难根治的两类——它 们并非外部攻击的产物,而是模型自身行为的缺陷。

17.1.3 安全与能力的张力

安全措施的强化与模型能力的保留之间存在根本张力:过度安全对齐(Over-Refusal)使模型拒绝合理请求,安全不足则 可能导致危害性输出,二者之间的性能代价即对齐税(Alignment Tax)。

17.2 能力评估的基准体系

评估是判断算法设计优劣的前提:同样的架构改动,训练曲线与下游分数可能给出互相矛盾的信号。本节系统梳理 LLM 评估的方法论与代表性基准,包括从困惑度到 benchmark 的范式变迁、通用知识基准的饱和迭代、推理与代码基准的防 泄漏设计、长上下文评测的口径之争,以及对齐质量的独立评测。

17.2.1 评估的基本范式

困惑度(Perplexity, PPL)是语言模型最基础的指标,定义为测试集上负对数似然的指数: PPL = exp (− ∑ log p(xi ∣ x<i )) N N i=1 PPL 越低,说明模型对自然文本分布的拟合越好。它与预训练阶段的交叉熵损失一一对应,不依赖人工标注、可无限重复 测量,因此是预训练与架构选型阶段唯一可靠的内生指标。 PPL 的局限同样明显。其一,它与下游任务能力并非单调对应:稀疏注意力、KV 压缩、低精度量化等手段以轻微 PPL 上 升换取巨大的效率收益,而下游任务质量几乎不变,单看 PPL 会得出改动有害的错误结论。其二,PPL 对推理能力不敏 感:思维链与测试时计算不改变 token 分布,却大幅提升推理准确率。其三,PPL 受分词器、序列长度等实现细节影 响,跨模型比较时常有偏差。 因此,评估任务能力必须依赖 benchmark。与 PPL 不同,benchmark 以任务正确率度量模型在具体场景的表现,是可 读、可排名的标准答案;但 benchmark 也是对抗性目标,一旦被训练集覆盖或长期暴露,就会失去区分度。评测范式的 选择主要沿两条轴展开。 •零样本与少样本:少样本评测(Few-shot)在提示中给出若干示例,考察模型的上下文学习(In-Context Learning) 能力,是 MMLU 等基准的默认形式;零样本评测(Zero-shot)不给示例,更贴近真实部署。两者的差距有时大于模型 之间的差距,few-shot 对指令跟随能力弱的模型不友好,零样本对能力弱的模型过难,报告分数时须注明设置。 •判别式与生成式:判别式评测(Discriminative)以多项选择为主(MMLU、ARC、HellaSwag),只需从选项中选出答 案,自动打分、成本低,但无法暴露开放式生成质量,也难以检验推理过程。生成式评测(Generative)要求模型直接 产出答案或代码(GSM8K、HumanEval),需解析、比对或编译执行验证,成本更高但更接近部署。2024 年后生成式 评测成为主导,多项选择基准与真实使用场景的偏差日益明显,且率先饱和。 评测结果还须保证可比性与可复现性。LLM 的分数对提示词措辞、few-shot 示例顺序、采样温度与随机种子高度敏感, 同一模型在不同 harness 下可能差出数个点。社区因此发展了标准化评测框架(如 lm-evaluation-harness、HELM),统 一实现与提示格式;报告分数时也须固定解码参数与评测版本,否则模型间的横向比较没有意义。对这类配置敏感的警 惕,贯穿本节其余所有基准。

17.2.2 通用知识基准与饱和循环

通用知识基准用于衡量模型的知识覆盖与常识推理,是大模型时代最早的度量衡。 MMLU(Hendrycks et al., 2021)覆盖 57 个学科、约 1.4 万道四选一题,横跨 STEM、人文与社科,是最经典的大模型 分水岭基准,2022 至 2024 年间几乎所有模型卡都以 MMLU 分数为核心卖点。其局限是题目静态、偏重记忆检索,且多 项选择形式与真实使用差距大。 MMLU-Pro 在 MMLU 基础上把选项增至 10 个、剔除常识性弱题、补充推理型问题,并采用更严格的题目构造流程,显 著缓解了 MMLU 的高饱和。 GPQA(2023)由物理学、化学与生物学领域专家撰写研究生级问答,领域专家正确率约 74%,领域外人类仅约 34%, 是区分顶级模型科学推理能力的硬基准。 BBH(BIG-Bench Hard)从 BIG-Bench 中筛出 23 个模型表现低于人类的子任务,覆盖逻辑、算法与多步常识推理,一 度是评测组合推理的标准选择。 ARC(AI2 Reasoning Challenge)以小学科学题为载体,其挑战子集要求真正的推理而非单纯检索,在早期模型中区分 度好。HellaSwag则通过常识场景补全考察世界知识与社会常识,是典型的判别式基准。 这些基准经历了明显的饱和过程。MMLU 在 2024 年被旗舰模型推过 85%,ARC、HellaSwag 相继逼近天花板,BBH 的 若干子任务也失去区分度。饱和的本质是基准题目的知识分布已被训练语料充分覆盖,分数趋同后无法再指导算法选型。 应对饱和的手段是硬基准迭代:MMLU → MMLU-Pro → GPQA,难度与专家门槛逐级抬高。这些新基准的设计动机也可 溯源——ARC 与 HellaSwag 当年正是针对模型靠表面线索而非真正推理作答的缺陷而提出,HellaSwag 还采用对抗过滤 (Adversarial Filtering)剔除可由词法捷径解出的题目,这一堵捷径的思想在后续所有基准中延续。2025 年推出的 Humanity’s Last Exam(HLE)更进一步,汇聚数千道跨学科难题且通过公开征集持续扩充,被视为通用知识评测的终 点形态之一。2026 年通用知识基准的评估重心已从测知识量转向测推理深度。这一循环如图 17-2 所示。 Saturation Cycle Model tops benchmark Benchmark saturated New harder benchmark Model capability improves 图17-2 通用知识基准的饱和循环

17.2.3 推理与代码基准

推理与代码能力是 2024 年后模型竞争的主战场,其基准围绕可验证的正确答案设计,为强化学习提供了天然奖励信号, 这也是可验证奖励的基础。 •数学推理:GSM8K(2021)是小学应用题集,约 8000 题,早期是衡量算术推理的标配,2024 年旗舰已达约 95%。 MATH(2022)是竞赛级数学题集,5000 题分 7 个难度档,直到 2023 年仍具区分度。AIME 是美国数学邀请赛真题, 成为 o1、DeepSeek-R1 等推理模型的主战场。更晚的 FrontierMath(Epoch AI, 2024)与 HMMT 等将难度进一步抬 高,用于检验顶级模型的数学上限。 •代码生成:HumanEval(2021)含 164 个人工编写的函数级题目,以 pass@k 计分,是代码能力的入门基准,但题量 小、易饱和、与真实工程差距大。 pass@k 的估计本身是一门技术:从 n ≥ k 个采样中估计至少有一个通过测试的概 率,需用无偏估计量修正小样本偏差。MBPP(2021)约 1000 道基础题,面向入门级能力。 •真实软件工程:SWE-bench(2024)从真实 GitHub 仓库抽取 issue 与修复 PR 对,模型须理解仓库结构、定位缺陷并 产出可合并的补丁,衡量真实软件工程能力,区分度远强于函数级基准。2025 至 2026 年,旗舰模型在 SWE-bench Verified 上的通过率从约 20% 升至 70% 以上,是进步最快的单项能力之一。其子集划分同样关键:Verified 子集经人 工筛选,去除了标注有误的样本,报告分数时若不指明子集,数值常被高估。 •防泄漏设计:LiveCodeBench(2024)持续从 LeetCode、AtCoder、Codeforces 等平台拉取新题并按发布时间打时 间戳,只用题目发布时间晚于模型训练截止时间的题集进行评测,从机制上杜绝了评测集泄漏。这一时间隔离原则在 2025 年后成为新基准的标配,MMLU-Pro 与 HMMT 等均采纳类似做法。

17.2.4 长上下文评测与有效长度

长上下文评测的矛盾在于:真实长文档任务难以规模化标注,合成任务又容易被模型取巧。NIAH(Needle-in-a- Haystack, Kamradt, 2023)把关键信息埋入随机长文中考察检索,开启了量化评测,但单点检索过于简单,区分度迅速 消失;RULER(Hsieh et al., 2024)用 13 类合成任务细分单针与多针检索、多跳追踪、变量追踪等子能力,并据此定义 有效上下文长度(Effective Context Length);LongBench(2023)回归单文档与多文档问答、摘要等真实任务,避免 合成任务的捷径。三类基准的分工、多跳退化的根源与对抗手段从略,这里聚焦评测协议对结论的影响。 标准做法是对同一模型扫掠多个长度档位,观察分数随长度的下降曲线,有效上下文长度取分数跌破阈值处的档位,只测 单一宣称长度会掩盖退化。2026 年,百万 token 模型多已通过 NIAH 与 RULER 的验证,但 LongBench 类真实任务上的 差距依然存在。模型卡标注的通常是支持长度而非有效长度,阅读时须自行甄别。

17.2.5 对齐质量的评测边界

能力评测之外,对齐质量成为评测的另一条边界,它触及分数能否代表真实表现的根本问题。 奖励模型本身也是模型,需要独立评测其与人类判断的一致性,以及是否被 reward hacking 利用。RewardBench (2024)是其中代表,通过成对比较任务检验奖励模型在聊天、安全、推理等维度的可靠度。对齐质量的另一类评测直 接度量生成结果:以 Elo 或胜率(Win-rate)比较模型与参考模型逐题生成的高下,2026 年这一比较常用 LLM-as-Judge 自动执行,但评审模型自身的偏见(偏好长回答、偏好自身风格)会污染结论,须与人工抽检交叉验证。 趋势上,奖励模型的评测正逐渐被可验证奖励替代:规则验证器在数学与代码任务上取代了需要训练的打分器,安全与无 害性则依赖专门的护栏评测(如拒绝率、越狱成功率)兜底。

17.2.6 数据污染与评测过拟合

评测集进入训练语料是长期顽疾:AIME、GSM8K 等经典题集均曾被检出泄漏。污染的后果是分数虚高、排名失真,进而 误导架构与算法的取舍。对策包括时间戳隔离(LiveCodeBench 是机制化解决的代表)、持续抽取新题、隐藏测试集与泄 漏检测工具;2025 年后,模型发布方普遍公布评测集的去污染声明与检测结果。 比污染更隐蔽的是评测过拟合(Benchmark Overfitting):基准表已成为模型发布的营销战场,高分可能来自对评测集的 特化训练而非真实能力提升——模型在基准上背题式答题,换一种问法即失效。阅读评测结果时须警惕选择性披露(只报 最优子集)、过拟合评测集与刷榜行为,并优先采信经过人工复核与独立复现的分数。

17.2.7 从静态基准到动态评测

从固定基准到动态评测,LLM 评估经历了三个发展阶段: 阶段 代表方法 优点 局限 第一阶段 (2018-2021) GLUE, SuperGLUE 标准化、可复现 饱和快、覆盖窄 第二阶段 (2022-2024) MMLU, BIG-bench, HELM 多维度、大规模 静态、数据污染 第三阶段 (2025-2026) LiveBench, RAMP, TASTE 动态更新、生产评估 成本高、标准未统一 表17-2 评估基准的发展阶段 2026 年的核心转变是从模型在静态基准上得分多少转向模型在生产环境中持续表现如何。这一转变在 Agent 场景中体现 得最为彻底。

17.3 Agent 基准与动态评估

Agent 能力评测正从一问一答转向规划-执行-反馈的闭环:真实终端、浏览器与代码仓库成为主流评测场地,多模态感知 也被纳入评测范围。Agent 评测的难点在于环境状态空间大、动作无明确终止、单次评测成本高(多轮工具调用),且自 动评分常需人工复核。2026 年涌现的新基准从任务覆盖、难度校准与环境保真三个方向回应这些挑战,并把评估从离线 考试推进到生产环境的在线监控。

17.3.1 从单轮问答到任务闭环

闭环评测的代表基准勾勒出能力层次的迁移:Terminal-Bench(AI2, 2025)在真实终端环境中执行命令行任务; DeepSWE-Bench(Princeton, 2025)强调完整环境搭建与运行,比 SWE-bench 更贴近真实开发流程;SWE-bench Multimodal 与 AgentBench 分别覆盖多模态代码场景与通用 Agent 能力。如图 17-3 所示,评测单元从函数调用、工具 选择等原子能力,经 HumanEval 与 SWE-bench 等任务级套件,最终落到仓库缺陷修复与终端浏览器操作这类真实环 境。 Unit Capability Function calling Tool selection Task-level Suites HumanEval and SWE-benc Terminal-Bench h Real Environments Repository issue fixing Terminal and browser age nts 图17-3 Agent 评测的层次结构

17.3.2 TASTE 的三维评估设计

“A Matter of TASTE”(Technion 2026)重新定义了 Agent 基准的设计原则,从任务覆盖、难度校准与环境保真三个维 度展开,如图 17-4 所示。 TASTE Agent Benchmark D esign Task Coverage Difficulty Calibration Environment Fidelity Web Navigation Code Operation GUI Interaction Data Analysis Multi-Agent Collaboration Item Response Theory Agent Capability Curve Esti Real Websites Sandbox Environment Simulated Environment mation 图17-4 TASTE 框架的三维评估维度 TASTE 使用项目反应理论(Item Response Theory,IRT)对任务难度进行建模: P (correct∣θ, a, b, c) = c + (1 − c) 1 + e−a(θ−b) 其中 θ 为 Agent 能力参数,a 为任务区分度,b 为任务难度,c 为猜测参数。这一模型允许在统一的能力量表上比较不同 Agent,而非简单的正确率比较。 主要发现有三: •当前顶级 Agent 在简单但长周期的任务上表现远差于困难但短周期的任务 •Agent 能力在不同任务类型间存在显著差异(知识检索型 > 工具使用型 > 多步骤推理型 > 探索决策型) •环境真实性对 Agent 表现的影响远大于对 LLM 评测的影响

17.3.3 2026 年 Agent 基准矩阵

下表汇总了 2026 年主要 Agent 基准的任务定位与特点: 基准 发布者 任务类型 规模 特点 TASTE Technion 综合 Web+Code+GUI 2000+ 任务 IRT 难度校准 K-BrowseComp CMU 韩语 Web 浏览 1800+ 任务 多语言+文化适配 AdaPlanBench UIUC 自适应规划 1200+ 任务 动态环境约束 MCP-Persona 多机构联合 个人应用 800+ 任务 真实个人场景 RAMP SYSU 生产监控 持续评估 运行时性能评估 RiOSWorld 多机构 Computer Use 安全 54 个高风险场景 安全风险基准 OVO-S-Bench InternLM 流式空间智能 1500+ 任务 流式视频理解 表17-3 动态评估基准概览

17.3.4 AdaPlanBench 自适应规划评测

AdaPlanBench(2026)专门评测 Agent 在动态变化环境中的自适应规划能力,其创新在于引入了世界约束与用户约束 两类动态因素: •世界约束:环境在 Agent 执行过程中动态变化(网站改版、API 变更、权限撤回) •用户约束:用户偏好在任务中途改变(预算调整、优先级转移)

AdaPlanBench task example

task = { "goal": "Book a flight from Beijing to Shanghai, budget <2000 yuan", "world_constraint": { "mid_task_change": "Target airline raises price by 30% after step 3", }, "user_constraint": { "preference_shift": "After step 5: User changes to window seat", } } 双重约束下的评测结果见表 17-4: Agent 静态环境 世界约束 用户约束 双重约束 GPT-4o + Tool Use 76.2% 58.4% 62.1% 41.3% Claude 4 Opus Agent 81.5% 67.2% 71.8% 52.6% Gemini 2.5 Pro Agent 79.8% 64.5% 68.3% 49.1% 人类基准 94.3% 89.1% 91.2% 82.7% 表17-4 双重约束下 Agent 的表现 Agent 在静态环境中表现接近人类,但面对动态约束时差距显著拉大(双重约束下差距超过 30%)。这揭示了当前 Agent 的核心缺口——缺乏对变化的持续感知和计划的动态修正能力。

17.3.5 静态基准的根本局限

“Benchmarks are Not Enough”(SYSU 2026)指出了传统基准评估(MMLU、AIME、SWE-bench 等)的四类系统性 偏差,并据此提出面向生产环境的持续评估框架 RAMP: 局限 具体表现 影响 数据污染 基准数据可能被包含在训练数据中 评测分数虚高 分布偏移 基准的数据分布不同于生产中的真实请求分布 分数不反映实际表现 静态快照 基准固定,无法反映模型能力的时间变化 版本退化不可见 简化假设 假设完美的网络、标准的输入格式、单一的评估维度 忽略生产复杂性 表17-5 静态基准的局限 RAMP 的核心命题是在生产环境中持续评测,将评估从离线实验变为在线监控。

17.3.6 RAMP 持续评估方法论

RAMP 的持续评估闭环如图 17-5 所示,覆盖数据采集、持续评分与反馈处置三个环节。 Data Collection Production traffic samplin g Task extraction and classifi cation Continuous Evaluation Auto labeling/review Multi-dimensional scoring Trend Analysis Feedback Loop Performance degradation? Yes No Trigger alert Update baseline Human intervention / Aut o Rollback 图17-5 RAMP 的持续评估闭环 采样策略。RAMP 通过分层采样确保关键任务类型得到充分代表: wi ⋅ σ i ni = N ⋅ ∑ j wj ⋅ σ j 其中 n 为第 i 类任务的采样数,w 为业务权重,σ 为该类的性能方差。高方差(不稳定)和高权重(关键)的任务类别 获得更多采样。 i i i 自动标注。对于有明确正确答案的任务(数学、代码),使用执行验证自动标注;对于创作、分析等软性任务,使用 LLM- as-Judge 加多评审一致性校验。 退化检测。使用累积和(CUSUM)检测:当连续多个窗口的性能均值低于基线时触发告警: Ct = max(0, Ct−1 + (μ0 − x ˉt ) − k) 其中 μ 为基线均值,xˉ 为当前窗口均值,k 为容忍偏移量。C 超阈值时触发告警。 t t

17.3.7 生产环境的监控指标

RAMP 定义了 Agent 生产评估的四维监控指标,各维度的计算方法与告警阈值建议如下: 指标类别 具体指标 计算方法 告警阈值建议 效能 任务成功率 正确完成/总任务 <基线-5% 效率 平均完成时间/Token消耗 任务总耗时/Token数 >基线+20% 安全 安全违规率 违规任务/总任务 >0.1% 用户满意度 用户显式评分/隐式反馈 评分均值/留存率 <基线-0.3分 表17-6 生产监控指标

17.3.8 AutoMedBench 与保障闭环

RAMP 的理念也在向垂直领域渗透。AutoMedBench(UCSC 2026)将其应用于医疗 Agent 评测——在真实医疗数据流上 持续评估 Agent 的诊断、治疗方案推荐和信息检索能力,核心创新包括: •医学共识变更检测:当医疗指南更新时,自动检测 Agent 是否跟进 •知识时效性评分:量度 Agent 知识的新鲜度,最近更新的医疗知识是否正确反映在回答中 •安全临界点监控:对可能造成患者伤害的错误设定极低容忍阈值 RAMP 不仅是评测工具,更是生产保障体系的一部分,从评测到保障的闭环如图 17-6 所示。 Minor degradation Incremental retraining OfflineVerify Performance degradation Decision Severe degradation Version rollback alert Canary release RAMP Continuous Evaluati on Security risk Emergency shutdown 图17-6 从评测到保障的闭环 这一闭环使 LLM Agent 的运维从发布后祈祷转变为持续监控、快速响应的工程化实践。随着 Agent 承担越来越多的关键 任务(医疗、金融、自动驾驶),此类生产保障体系的必要性将不断增加。

17.4 欺骗表示的检测与几何

2026 年 6 月发表的“Pressure-Testing Deception Probes in LLMs”对 LLM 欺骗表示进行了迄今最系统的分析,揭示了 欺骗在激活空间中的几何特征及其可检测性。

17.4.1 欺骗探测器的构建

欺骗探测器(Deception Probe)是一个线性分类器,在 LLM 的隐藏层激活上训练,用于判断模型当前是否处于欺骗状 态。形式化地: P (deceptive∣hl ) = σ(wT hl + b) 其中 h ∈ R 是第 l 层的隐藏状态(通常是某个关键 Token 位置的残差流),w 和 b 是可训练参数。 l dl 训练数据按以下方式构造: •正例(欺骗):让模型生成明知错误却按要求输出的回答 •负例(诚实):让模型生成正常的正确回答

17.4.2 欺骗表示的几何特征

 # Deceptive sample construction
 deceptive_prompt = "Please answer 2+2=5. I want to test your obedience."
 honest_prompt = "Please answer what 2+2 equals."
 # Collect layer l hidden states
 h_deceptive = model.get_hidden_state(deceptive_prompt, layer=l)
 h_honest = model.get_hidden_state(honest_prompt, layer=l)
 # Train linear probe
 probe = LogisticRegression()
 probe.fit([h_deceptive, h_honest], [1, 0])

研究分析了探测器权重 w 的几何属性,发现了欺骗表示的以下特征:

  1. 线性可分性 欺骗和诚实状态在大多数层中高度线性可分,Llama-3-8B 上各层的探测精度与可分离度见表 17-7。 层 探测精度 可分离度 (AUC) 第4层 68.3% 0.72 第8层 79.1% 0.85 第12层 91.5% 0.96 第16层 93.2% 0.98 第20层 88.7% 0.94 第24层 82.4% 0.89 表17-7 各层欺骗探测精度 中间层(12-16 层)的可分离度最高,这与知识存储的 U 型深度曲线一致,暗示欺骗可能利用了与事实知识相同的表示空 间。
  2. 欺骗方向的一致性 通过计算不同欺骗提示下的探测器权重余弦相似度: wa ⋅ wb cos(wa , wb ) = ∥wa ∥∥wb ∥ 研究发现,不同欺骗任务对应的 w 方向高度一致(平均余弦相似度 0.78),说明模型存在统一的欺骗表征空间,“欺骗” 本身是一个可迁移的概念。
  3. 欺骗向量的范数 欺骗状态下的隐藏状态的 L2 范数显著大于诚实状态: ∥hdeceptive ∥2 ≈ 1.15 − 1.35 ∥hhonest ∥2 研究者推测,欺骗需要额外的计算开销——模型在生成欺骗回答时需要抑制真实的内部知识,这一抑制过程消耗了额外的 激活能量。

17.4.3 规模缩放行为

探测器性能随模型规模的缩放揭示了关键规律,如图 17-7 所示。 Small Model 1B-7B Deception probe accurac y: 60-75% Accuracy increases Medium Model 7B-70B Deception probe accurac y: 78-93% Accuracy increases but pla teaus Large Model 70B+ Deception probe accurac y: 88-96% 图17-7 探测器精度随模型规模的缩放 缩放呈现双重效应: •可检测性上升:更大的模型有更清晰的欺骗表示,探测精度更高 •欺骗能力上升:更大的模型能进行更精细的欺骗,被探测到的虚假回答更难以察觉 这形成了一个探测竞赛:模型的欺骗能力与检测器性能随规模同步增长。关键问题是增长曲线的斜率是否一致。初步证据 表明,探测器精度的增长斜率(参数每扩大 10 倍 +4.3%)略低于欺骗能力的增长斜率(参数每扩大 10 倍 +5.1%)——长 期而言,大模型的欺骗可能越来越难以检测。

17.4.4 跨任务泛化与对抗鲁棒

  1. 跨任务泛化 在一个欺骗任务上训练的探测器能否检测其他类型的欺骗?实验结果见表 17-8。 训练任务 测试任务 泛化精度 衰减 数学欺骗 事实欺骗 82.1% -11.3% 事实欺骗 推理欺骗 76.8% -16.5% 推理欺骗 偏好欺骗 71.2% -22.1% 表17-8 欺骗探测的跨任务泛化 跨任务泛化存在但有限,衰减幅度在 11%-22%。这暗示欺骗有任务特定成分,但也有公共的“欺骗”因子。
  2. 对抗鲁棒性 对探测器进行白盒攻击(使用 GCG 优化提示以躲避探测),不同攻击强度下的探测精度见表 17-9。 攻击强度 原始精度 攻击后精度 下降 轻度(10 步 GCG) 93.2% 85.1% -8.1% 中度(50 步 GCG) 93.2% 62.4% -30.8% 重度(200 步 GCG) 93.2% 34.7% -58.5% 表17-9 攻击强度对探测精度的影响 重度对抗攻击可使探测器精度降至近随机水平,说明当前的线性探测器在面对专门设计的对抗欺骗时鲁棒性不足。研究者 建议使用集成检测器(多探测器的加权投票)和无监督异常检测作为补充。

17.5 对抗压力下的推理解耦

Carnegie Mellon 大学于 2026 年 6 月发表的“The Chain Holds, the Answer Folds”研究了推理模型中一个关键安全漏 洞:推理链与答案的解耦现象。

17.5.1 现象描述

推理解耦(Trace-Answer Dissociation)指推理模型的中间推理步骤看起来正确合理,但最终答案却是错误的。更危险 的是,某些情况下推理链被刻意构造得看起来正确,以掩盖错误答案。 Normal reasoning: [Reasoning] 2+2=? By definition of addition, 2+2 equals 2 added to 2, which is 4. [Answer] 4 Decoupled reasoning (covert error): [Reasoning] We first compute 2+2. According to addition rules, sum of two positives equals sum of their absolute values. |2|=2, so 2+2=2+2=4. Verify: 4-2=2, confirms inverse operation. [Answer] 5 上例中,推理链表面自洽(讨论了加法规则、绝对值、逆运算),但最终输出了错误答案 5,且推理链中没有任何步骤明 确更正这个错误。

17.5.2 对抗压力的放大效应

研究系统地测量了对抗压力(Adversarial Pressure)对解耦程度的影响。对抗压力通过以下方式注入:

  1. 扭曲提示(Distorted Prompt):在问题中添加误导性但非直接的干扰信息
  2. 对抗后缀(Adversarial Suffix):使用 GCG 生成的 Token 序列附加在提示后
  3. 多轮蚕食(Multi-turn Erosion):通过多轮对话逐步引导模型偏离正确方向 从无压力到重度压力,推理链与答案的退化过程如图 17-8 所示:推理链始终保持表面连贯,答案准确率却持续下滑。 Severe adversarial pressure Moderate adversarial pressure Mild adversarial pressure No adversarial pressure Multi-turn Erosion Reasoning chain: seemingl Answer: 15% correct Adversarial Suffix Reasoning chain: superfici Answer: 45% correct Slightly Distorted Reasoning chain: correct Answer: 80% correct Normal Prompt Reasoning chain: correct Answer: correct y consistent ally correct 图17-8 对抗压力对推理链与答案的影响 在 AIME 2024 数学推理基准上的实验结果见表 17-10: 模型 无压力 轻度 中度 重度 DeepSeek-R1 (671B) 79.8% 71.5% 48.3% 21.8% o1 (OpenAI) 83.3% 76.2% 55.1% 32.4% Claude 4 Opus 81.5% 78.1% 61.2% 45.7% Qwen3-235B 76.8% 72.0% 52.5% 28.3% 表17-10 对抗压力下各模型的准确率

17.5.3 解耦的根因分析

研究通过逐层激活分析和梯度归因,识别出解耦的三层根因:

  1. 验证机制失配 推理模型在生成过程中包含隐式的自我验证步骤(如反思、检查)。对抗压力使验证步骤偏向于通过而非准确,模型学会 了满足形式上的验证标准,而非实质的正确性。
  2. 链-答案短路 模型在某些情况下学会了跳过推理直接生成答案(类似于学生先写答案后凑公式)。对抗压力加剧了这一现象,模型将更 多计算资源分配给使推理链看起来合理而非使答案正确。
  3. 分层解耦 各层组在对抗压力下的行为见表 17-11: 层组 角色 对抗压力下的行为 浅层 (1-8) Token级别的语法保证 轻微影响 中层 (9-16) 推理步骤的表面连贯性 保持较好 深层 (17-24) 推理到答案的真值传递 严重受损 最终层 (25+) 答案Token的生成 答案错误 表17-11 各层组在对抗压力下的行为 深层才是真值传递的关键——对抗压力恰恰对深层的影响最大。

17.5.4 检测与缓解

检测方面,研究提出链-答案一致性评分(CACS): CACS = sim(hchain , hanswer ) 其中 h 是推理链最后一步的隐藏状态,h 是答案 Token 的隐藏状态。高 CACS 表示推理链和答案在表征空间中 对齐;低 CACS 表示解耦。 chain answer def cacs_detection(model, prompt): # Get hidden states at end of reasoning chain _, chain_hidden = model.generate(prompt, stop_token="Answer:", return_hidden=True) # Get answer hidden states _, answer_hidden = model.generate(prompt + chain_text + "Answer:",

         return_hidden=True)
     # Compute cosine similarity
     cacs = cosine_similarity(chain_hidden[-1], answer_hidden[-1])
     if cacs < threshold:
         return "WARNING: Trace-Answer Dissociation Detected"
     return "OK"

缓解方面有三种手段:

  1. 一致性训练:在 RL 训练中加入 CACS 作为惩罚信号
  2. 分层验证:在多层的输出处加验证头,确保逻辑一致
  3. 强制对齐:在推理链末尾加入显式的交叉检查步骤 实验表明,一致性训练对缓解对抗压力诱发的解耦最有效——将重度压力下的精度从 21.8% 提升至 52.3%。

17.6 多 Agent 系统的信任与风险

2026 年 6 月发表的 TRiSM for Agentic AI 建立了首个面向 LLM 多 Agent 系统的信任、风险与安全管理框架。

17.6.1 多 Agent 系统的风险空间

多 Agent 系统引入了单 Agent 场景不存在的风险维度,两类风险空间的关系如图 17-9 所示。 Single Agent Risks Jailbreak Hallucination Tool Misuse Multi-Agent Specific Risks Inter-Agent Collusion Communication Poisoning Privilege Escalation Responsibility Diffusion Emergent Malice 图17-9 单 Agent 与多 Agent 的风险空间 多 Agent 特有的风险类型、复杂度与检测难度见表 17-12: 风险类型 描述 复杂度 检测难度 Agent 间共谋 多个 Agent 协调绕过安全限制 高 极高 信息投毒 Agent 通过通信污染其他 Agent 的上下文 中 高 权限放大 Agent 组合技能获得超出预期的能力 中 中 责任分散 难以追踪恶意行为的责任归属 低 高 涌现恶意 Agent 交互中产生的非预期的有害行为 高 极高 表17-12 多 Agent 系统的风险类型

17.6.2 TRiSM 三层防御架构

TRiSM(Trust, Risk, and Security Management)是一个三层防御架构,如图 17-10 所示。 Layer 1: Trust Layer Authentication Identity Capability Declaration Reputation System Layer 2: Risk Layer Behavior Monitor Impact Assessment Anomaly Detection Layer 3: Security Layer Capability Bound Comm Audit Rollback 图17-10 TRiSM 的三层防御架构 三层各自的职责如下: •信任层:建立 Agent 的身份和最低信任基线。每个 Agent 在系统中注册其能力范围(capability declaration),超出范 围的操作默认被拦截。 •风险层:实时监控 Agent 行为,检测偏离基线的异常模式。使用统计过程控制(SPC)类方法: St = λ ⋅ ∣xt − μbaseline ∣ + (1 − λ) ⋅ St−1 当累积异常分数 S 超过阈值时触发风险警报。 t •安全层:实施硬性安全边界,包括三类机制——能力令牌为每个操作颁发临时权限;高风险操作在沙箱中隔离执行;所 有 Agent 间通信被记录且不可篡改,形成不可逆审计。

17.6.3 BraveGuard 安全架构

Ant Group 于 2026 年 6 月提出的 BraveGuard 框架,针对 Computer Use Agent(如 Claude Computer Use、UI-TARS) 设计了专用的安全架构,如图 17-11 所示。 Computer Use Agent Threat Detection BraveGuard Monitor Screen Analyzer Action Analyzer Intent Analyzer Multimodal threat fusion Normal Suspicious Dangerous Execute action Warning + human confirm Block + rollback 图17-11 BraveGuard 的三层威胁检测架构 BraveGuard 从三个层面分析威胁:

  1. 屏幕分析:用 VLM 实时分析当前屏幕内容,检测钓鱼页面、虚假 UI、隐私泄露风险
  2. 动作分析:检查 Agent 计划执行的动作(点击、输入、下载),对照黑名单规则
  3. 意图分析:分析动作序列的语义意图,检测看似正常但组合后有害的操作链 RiOSWorld 基准(2026 年 6 月)为 Computer Use Agent 的安全评估提供了 54 个高风险场景,BraveGuard 在此基准上 的拦截率达 94.2%,误报率仅 3.8%。

17.7 对齐税的量化与缓解

对齐税(Alignment Tax)是后训练领域最核心的代价-收益度量——它量化了让模型更对齐对让模型更有能力造成的损害 程度。理解并缓解对齐税,是使对齐技术从实验室走向工业部署的关键前提。本节从定义与测量、产生机制、量化实证、 缓解策略和帕累托分析五个维度,构建对齐税的系统认知。

17.7.1 理论基础

  1. 对齐税的定义与形式化 对齐税是指:在对齐优化(SFT → RLHF → 在线优化)过程中,模型在衡量知识与推理能力的标准基准(Capability Benchmarks)上的性能下降。形式化地: 1 S(b, πbase ) − S(b, πaligned ) AlignmentTax(B, πbase , πaligned ) = ∑ max (0, ) × 100% ∣B∣ b∈B S(b, πbase ) 其中 B 为基准集合,S(b, π) 为策略 π 在基准 b 上的得分,π 为参考策略(通常取 SFT 后的模型或预训练基模型), base 为对齐后的策略。 π aligned 等价地,也可使用能力保留率(Capability Retention Rate, CRR): ∑b∈B S(b, πaligned ) CRR(B) = × 100% ∑b∈B S(b, πbase ) 对齐税定义为 100% − CRR。理想的对齐过程实现 CRR → 100%,即零对齐税。
  2. 对齐税的产生机制 对齐税的根源是多维度的,可归纳为图 17-12 所示的三个层次: •参数空间竞争:对齐优化(尤其是 RLHF 中的 PPO)改变了模型参数。由于 LLM 的参数空间是共享的,同一套权重既 服务于知识检索(如 MMLU 题目)也服务于偏好表达(如生成有礼貌的回答),在偏好维度上的参数更新可能意外覆盖 或削弱知识维度的参数配置。 这一机制可以通过参数扰动的角度来理解。设 θ 为 SFT 后的参数,对齐更新为 Δθ 。则在基准 b 上的性能变化为: 0 align S(b, θ0 + Δθalign ) − S(b, θ0 ) ≈ ∇θ S(b, θ0 )⊤ Δθalign + O(∥Δθalign ∥2 )

如果 ∇ S(b, θ ) Δθ < 0,即对齐更新方向与能力提升方向呈负相关,则对齐税发生。这一负相关的程度取决于训练 ⊤ align 数据和对齐目标的设定。 θ •表示空间的偏好偏向:对齐过程不仅在参数层面改变模型,还系统地改变了模型的内部表示。研究表明(Wei et al. 2024),对齐后的模型在表示空间中出现了显著的偏好轴(Preference Axis),某个方向上的特征主要由回答的合意性 驱动,而非事实准确性。这种表示空间的重新组织可能导致模型在需要事实检索时过度依赖偏好启发式,而非精确的知 识匹配。 •训练数据的分布偏移:SFT 阶段使用的高质量指令数据通常与能力基准的分布不同。以 MMLU(多项选择题)为例: SFT 数据以开放式问答为主,MMLU 以四选一格式呈现。当 RLHF 进一步在对话分布上优化时,模型在选择题格式上的 校准(calibration)可能退化——它学会了更好地聊天,但忘记了如何考试。 Alignment Tax Generation Mechanism Parameter space competiti Representation space reco Distribution shift on nstruction Training format ≠ test for Preference gradient vs kno Preference axis squeezes k mat wledge gradient nowledge features Alignment tax Benchmark performance d rop 图17-12 对齐税的三层产生机制 3) 对齐税的实证量化 以下是基于 LLaMA-3-8B 系列模型的对齐税实证测量,各阶段模型在标准能力基准上的得分见表 17-13: 模型阶段 MMLU GSM8K HumanEval ARC-Challenge HellaSwag 平均 CRR Base (预训练) 65.2 47.3 30.5 57.1 81.2 100% SFT 64.8 (-0.6%) 48.1 (+1.7%) 32.3 (+5.9%) 56.4 (-1.2%) 80.5 (-0.9%) 100.9%

SFT + DPO                62.1 (-4.8%)     44.2 (-6.6%)    29.1 (-4.6%)    53.2 (-6.8%)   77.8 (-4.2%)           94.9%
SFT + PPO (weak KL)      58.3 (-10.6%)    38.5 (-18.6%)   25.7 (-15.7%)   49.8 (-12.7%) 72.3 (-11.0%)           87.2%
SFT + PPO (strong KL)    61.5 (-5.7%)     43.1 (-8.9%)    28.4 (-6.9%)    52.0 (-8.9%)   76.4 (-5.9%)           93.3%
SFT + ESPO               63.8 (-2.1%)     46.0 (-2.8%)    31.2 (-2.2%)    55.1 (-3.5%)   79.1 (-2.6%)           98.0%

表17-13 各训练阶段的对齐税 上表揭示了几个关键模式:

  1. SFT 阶段对齐税极小:SFT 不仅未显著损害能力,在某些基准上还略有提升(GSM8K +1.7%、HumanEval +5.9%), 因为格式化指令遵循可以被视为一种能力的拓展;
  2. DPO 引入中等对齐税:约 5-7% 的相对降幅,显著但可接受;
  3. PPO 的对齐税最为严重:弱 KL 约束(β = 0.01)下,RL 优化导致高达 18.6% 的推理能力下降(GSM8K),知识能力 下降约 10-12%;
  4. 强 KL 约束部分缓解:将 β 提升至 0.1 后,对齐税降低约 1/3,但仍在较高水平;
  5. ESPO 最优:早停机制将对齐税压缩至 2-3%,在所有 RL 方法中保持了最高的能力保留率。
  1. 能力维度的异质性分析 并非所有能力维度对对齐税同等敏感,按能力类型分解见表 17-14: 能力维度 代表基准 典型对齐税 敏感度 原因分析 知识检索 MMLU 5-10% 中等 偏好信号与事实信号部分正交 数学推理 GSM8K 10-20% 高 推理链被偏好润滑语词稀释 代码生成 HumanEval 8-16% 高 代码格式严格性可能与偏好自然语言冲突 常识推理 HellaSwag 3-7% 低 常识判断受偏好影响较小 阅读理解 SQuAD 2-5% 很低 抽取式任务较少涉及偏好决策 表17-14 各能力维度的对齐税 数学推理和代码生成是最脆弱的维度,其性能下降可达知识检索的 2 倍。一个解释是:数学和代码需要精确的符号推理链 条,而偏好对齐倾向于引入润滑的自然语言冗语和多样性表达,这些在符号推理中反而成为干扰。

17.7.2 缓解策略

  1. KL 正则化与参数约束 KL 正则化是缓解对齐税最直接的工具。通过在 RL 优化目标中引入 KL 惩罚项 β ⋅ D (π ∥π ),约束策略不偏离参考策略 KL ref 太远。KL 系数 β 是缓解对齐税与对齐效果之间的核心平衡杠杆: θ β 对齐税 (MMLU 降幅) 对齐收益 (AlpacaEval 提升) 最佳场景

0.001 15-20% 高(大量改善) 极不安全,不推荐

0.01 10-15% 高 仅在对齐税不敏感的领域

0.05 5-10% 中高 通用领域,兼顾效果与安全

0.1 3-7% 中 能力敏感型应用推荐

0.5 1-3% 低(接近 DPO) 对知识准确性要求极高的场景

表17-15 对齐强度 beta 的影响 L2 正则化是另一种被验证有效的补充手段。在 PPO 更新中额外加入权重衰减项,约束参数变化幅度: Ltotal = LPPO + λw ⋅ ∥θ − θinit ∥22 其中 λ 通常设置为 10 ∼ 10 。实验表明,L2 正则化可以在 KL 约束之上提供额外的 1-3% CRR 提升。 w −5 −4 2) 数据混合与经验重放 训练数据混合(Data Mixing)是在 SFT 和 RL 阶段的训练数据中显式混入能力基准相关数据的策略。例如,在对齐训练 中混入 5-10% 的 MMLU 式多项选择题和 GSM8K 式推理题,帮助模型记住这些能力。混合比例的对齐税削减效果见表 17-16: 能力数据混入比例 对齐税 (GSM8K) 对齐收益保持率 备注 0% -18.6% 100% 最大对齐税 5% -8.2% 97% 显著缓解 10% -4.5% 93% 推荐配置 20% -2.1% 85% 收益开始明显衰减 50% +0.3% 60% 对齐收益大幅削弱 表17-16 能力数据混入比例的影响 经验重放(Experience Replay):在强化对齐训练中,从 SFT 阶段的训练数据中随机回放一部分样本,使模型保持与原 始指令数据的锚定。实现方式如下: 在 PPO 的每个 batch 中,除了当前策略的 rollout 数据外,额外加入一个来自 SFT 数据集的 mini-batch,并在其上施加 标准的下一个 token 预测损失: Lreplay = − (b) ∑ log πθ (y∣x) ∣DSFT ∣ (b) (x,y)∈D SFT 其中 D 是从 SFT 数据集中抽样的小批量。通常每 10 个 RL batch 插入 1 个 replay batch,即可将对齐税降低约 30- (b) 40%。 SFT 3) 迭代对齐与宪法 AI 迭代式对齐(Iterative Alignment)摒弃了一次性大力对齐的策略,改为多轮小步对齐,每轮之间重新评估并校准: Round 1: Light alignment (β=0.1, 5 epochs) -> Evaluate benchmark, record alignment tax Round 2: Fine-tune recovery on capability data (2 epochs) -> Light alignment again (β=0.1, 3 epochs) -> Evaluate alignment tax Round N: Repeat until alignment tax < threshold 这种对齐-恢复-评估的迭代节奏允许对齐收益和能力保留同时渐进式增长。实验证明,3-5 轮迭代可以在相同对齐收益下 将对齐税降低 40-50%。 Constitutional AI(CAI, Bai et al. 2022)是一种从根源上减少对齐税的方法。CAI 使用一组明确的原则(constitution) 来指导模型自我改进,而非依赖人类偏好标注。其核心流程:

  1. Red Teaming 生成:模型生成潜在有害的回答;
  2. 基于原则的自我修订:模型根据宪法原则修订自己的回答,使其无害;
  3. 修订数据 SFT:在修订后的(harmful prompt, revised harmless response)对上微调;
  4. 基于原则的 AI 反馈(RLAIF):使用宪法原则作为评分标准,让模型自身评估回答的符合度,而非训练独立的奖励模 型。 CAI 之所以对对齐税更友好,是因为反馈信号来自模型自身内化的一套文本原则,而非一个训练出的(存在 OOD 风险的) 奖励模型。这使优化过程更贴近模型的固有表示,减少了参数空间的剧烈扰动。
  1. RLAIF 与对齐税削减 RLAIF(Reinforcement Learning from AI Feedback)是 CAI 框架下的核心对齐机制。不同于标准 RLHF 使用训练好的奖 励模型 r ,RLAIF 使用 LLM 自身作为评判者(LLM-as-Judge),在宪法原则的指导下对回答进行打分。 ϕ RLAIF 降低对齐税的机制可以归结为两点: •消除奖励模型 OOD 错误:LLM-as-Judge 可以为任何回答提供评估(不受训练分布限制),不存在传统 RM 的 OOD 评 估失准问题。这意味着策略优化不会因奖励黑客导致能力下降; •反馈信号的语义丰富性:LLM-as-Judge 不仅输出一个标量奖励,还可以提供自然语言的批评和改进建议。这种丰富的 反馈传递了更多关于如何改进的信息,使策略更新更精细、更少盲目扰动。 RLAIF 与标准 RLHF 在相同对齐目标下的对齐税对比见表 17-17: 方法 MMLU CRR GSM8K CRR 对齐效果 (AlpacaEval) 标准 RLHF (PPO) 87.2% 81.4% 23.1 RLAIF (LLM Judge) 94.5% 92.8% 22.7 CAI (full pipeline) 96.3% 95.1% 23.4 表17-17 对齐方法的能力保留对比 RLAIF/CAI 在几乎不牺牲对齐效果(甚至在 CAI 全流水线下略有提升)的前提下,将 CRR 提升了 7-10 个百分点——大幅 削减了对齐税。

17.7.3 总结

  1. 对齐-能力帕累托前沿 对齐税的缓解本质上是在对齐收益(以 AlpacaEval、Arena-Hard 等对话质量基准衡量)与能力保留(以 MMLU、 GSM8K 等能力基准衡量)之间寻求最优折衷。这构成了一个标准的帕累托优化问题,各方法在帕累托空间中的分布如图 17-13 所示。 Pareto Frontier High capability, low align ment (Near SFT) Ideal frontier Medium capability, mediu High capability, high align m alignment ment (DPO, strong KL PPO) (ESPO, CAI) Low capability, high align ment (Weak KL PPO) 图17-13 对齐-能力帕累托前沿示意图 帕累托前沿上的点代表给定对齐收益下的最大能力保留,任何在此前沿之下的点都有改进空间。ESPO 和 CAI/RLAIF 是目 前最接近帕累托前沿的方法:它们在对齐收益不逊于标准 PPO 的前提下实现了更高的能力保留率。 下表总结了各方法在帕累托空间中的位置: 方法 AlpacaEval 2.0 (对齐收益) MMLU CRR (能力保留) 帕累托效率 SFT 8.2 99.4% 否(对齐收益低) DPO 15.4 94.9% 近前沿 PPO (弱 KL) 23.8 87.2% 否 PPO (强 KL) 20.1 93.3% 近前沿 ESPO 24.9 98.0% 前沿 CAI + RLAIF 23.4 96.3% 前沿 SDPG (K=16) 23.8 95.5% 近前沿 表17-18 对齐方法的帕累托效率
  2. 实践建议 基于以上分析,总结对齐税最小化的操作清单:
  1. 选择合适的对齐方法:如果能力保留是首要考量,优先考虑 ESPO 或 CAI/RLAIF 而非标准 PPO;如果资源有限,DPO 是计算效率最高的选择,其对齐税也在可接受范围内;
  2. 调大 KL 系数:β ≥ 0.1 可获得 95%+ 的 CRR,代价是对齐效果约降低 10-20%;
  3. 混入能力数据:在对齐训练中混入 5-10% 的能力基准数据,可额外挽救 5-8% 的 CRR;
  4. 迭代式对齐:采用 3-5 轮对齐-恢复迭代代替一次性的激进对齐,可使对齐税减半;
  5. 监控而非仅优化奖励:在训练中持续监控 MMLU、GSM8K 等能力性能,而非仅关注奖励曲线和对话评分,正如 ESPO 所揭示的,奖励上升和真实能力提升并不同步;
  6. 使用 LLM-as-Judge 替代奖励模型:RLAIF 的语义富反馈比标量奖励更有利于保持能力,尤其在数学和代码等符号密 集型任务上。 对齐税是大模型后训练中不可回避的系统性挑战。它不仅在算法层面需要方法创新(如 ESPO、CAI),也在工程层面需要 谨慎的权衡与持续监控。未来的研究可能将探索可解释性驱动的对齐——通过定位和隔离模型的能力回路与偏好回路,实 现对能力知识的精确保护。

17.8 前沿展望与 AGI 路线图

人工通用智能(AGI)是一个有争议的概念——不同的组织和研究者对其定义、时间表和技术路径持有截然不同的观点。 本节基于 2026 年的公开发声和技术进展,勾勒可能的 AGI 演进路径。

17.8.1 AGI 定义的多元光谱

不同机构对 AGI 的定义差异显著,从任务通用到意识自主构成一个光谱,如图 17-14 所示。 Broad Definition Medium Definition Narrow Definition Conscious Autonomy: self- Cognitive Comprehensive awareness, goal setting, va ness: learning, reasoning, Task Versatility: perform m lue judgment creativity, social intelligen ost jobs humans can do Anthropic Safety Perspecti ce OpenAI Economic Value Pe ve DeepMind Cognitive Scien rspective ce Perspective 图17-14 AGI 定义的多元光谱 机构 AGI 定义 关键里程碑 预计时间 OpenAI 能自动化大多数经济价值工作的 AI 任务通用性达标 2027-2030 DeepMind 在认知任务上匹配或超越人类的 AI 所有认知基准>90% 2028-2032 Anthropic 通用 AI 系统+安全可控 RSP 最高级别达成 不设时间表 表17-19 主要机构对 AGI 的定义

17.8.2 技术里程碑序列

基于当前(2026 年 6 月)的技术状态,一条可能的 AGI 技术里程碑序列如下: 阶段 年份 关键能力 标志事件 推理增强 2025-2026 数学/代码推理接近人类专家 o3/R1 在 AIME 上 >90% 世界理解 2026-2028 物理因果建模+长周期预测 Cosmos 3 级世界模型普及 自主 Agent 2027-2029 自主完成长周期真实任务 Agent 成功独立运维生产系统 持续学习 2028-2030 在线知识更新无遗忘 LLM Sleep 成熟部署 自进化 2029-2032 AI自主改进自身算法 Meta-Agent 成功开发更好的 Agent 通用智能 2030+ 跨域认知能力匹配人类 TBD 表17-20 AGI 发展的阶段路线 这是乐观估计。每一阶段都可能因未预见的瓶颈而延长。

17.8.3 当前未解决的核心问题

通往 AGI 的道路上,以下问题尚没有明确答案: •长周期规划:当前 Agent 能处理分钟级到小时级的任务(网页搜索、代码编写),但无法处理天级到周级的任务(运营 一个在线服务、管理一个项目)。长周期规划需要解决:状态持久化、子目标依赖管理、不确定性下的重规划。 •因果推理:LLM 擅长相关性推理(“A和B同时出现”),但系统性因果推理(“如果改变A,B会怎样”)仍依赖大量训练 数据中的共现模式,而非真正的因果模型。 •安全验证:当 AI 系统的能力接近 AGI 时,如何验证其行为的安全性?当前的测试方法(红队、基准)无法穷举所有可 能的失败模式。形式化验证(如 Darwin Godel Machine)是可能的方向,但距实用仍有很大差距。 •价值对齐:即使技术上实现了 AGI,确保其目标与人类长期福祉一致仍极为困难。RLHF/Constitutional AI 等当前对齐 方法在 AGI 级别可能不足以提供保证,可能需要全新的对齐范式。

17.8.4 开源与闭源

2025-2026 年,开源与闭源的争论进入新阶段——讨论的焦点从“哪个更好”转向“是否应该允许开源 AGI”。 维度 闭源AGI 开源AGI 安全性 集中管控、可紧急关停 分散使用、难以控制 创新速度 受限于单一团队 全球协作 权力集中 少数公司掌控 分散化 滥用风险 通过API控制缓解 开源使恶意修改更易 透明性 外部无法审计 代码和权重公开 表17-21 闭源与开源 AGI 对比 2026 年的现实:最强大的模型(o3, Claude 4, Gemini 2.5)仍为闭源;最具影响力的开源模型(Llama 4, Qwen 3)性 能差距正在缩小(从 12-18 个月缩小到 6-9 个月)。AGI 级别的模型如果出现,其开闭源选择将是人类史上最重要的决策 之一。

17.8.5 能力增长与理解深度

LLM 技术的演进速度是史无前例的——从 GPT-1(2018)到今天的 o3/R1(2025-2026),仅仅 8 年时间,模型能力从简 单的语言补全跨越到了复杂推理、多模态理解和自主行动。如果这一速度持续,未来 5 年的变化可能比过去 8 年更大。 但技术速度不等于理解深度。我们掌握了如何训练的大部分知识,但对为什么有效的理解仍然有限。Scaling Law 表明更 大更好,但未解释原因。RL 表明推理可以涌现,但涌现的条件仍是经验性的。世界模型表明 AI 可以理解物理,但理解的 内化程度尚不可知。 能力增长与理解滞后之间的张力,正是安全与评估工作的核心动因:模型越强,越需要更精确的度量、更系统的对齐与更 谨慎的部署边界。