为什么需要一份"潜空间"综述
过去两年,语言模型研究出现了一个明显转向:越来越多的关键内部过程不再以人类可读的 token 序列展开,而是在连续的潜空间中完成。这包括潜推理(COCONUT、Huginn、SoftCoT)、潜感知(Mirage、LVR、3DThinker)、潜记忆(MemGen、VisMem、CoMEM)、潜通信(C2C、LatentMAS、ThoughtComm)、潜具身(UniVLA、LAPA、Motus、OccVLA)等多个方向。这些工作虽然都冠以"latent"之名,但分散在不同模态、不同机制、不同任务设定下,缺乏统一的概念框架与比较基准。
已有的综述大多只聚焦"潜推理"或"隐式推理"这一单一现象,把潜空间当作推理效率的优化技巧。本综述的核心论断是:潜空间不应被视为推理压缩的辅助手段,而应被理解为语言模型下一代计算的"机器原生基底"(machine-native substrate)。这一论断的依据有三:
第一,显式 token 空间存在结构性瓶颈——语言冗余、离散化瓶颈、顺序解码成本、语义损失。复杂、多模态、长时程任务中的中间状态难以用自然语言无损外化。第二,潜空间作为连续、紧凑、可微的表示介质,天然支持更高保真度的信息承载与更灵活的计算分配。第三,从 2025 年下半年开始,潜空间方法已从文本推理扩展到视觉、记忆、协作、具身全谱系,呈现出"系统级范式"而非"任务级技巧"的特征。
基于此,综述围绕五个递进问题组织叙事:潜空间是什么(基础)→ 它如何发展(演化)→ 它如何工作(机制)→ 它能做什么(能力)→ 它将走向何方(展望)。这条叙事线既保留了清晰的故事弧,又允许通过共享的机制原则与能力结果对异构方法进行横向比较。
基础:潜空间是什么,与显式空间、视觉潜空间有何不同
2.1 概念界定
在经典自回归语言模型(含 LLM、VLM、VLA 及以语言为骨干的智能体系统)中,整个生成过程在"显式空间"(explicit space / verbal space)展开:输入与输出都是来自有限词表的离散 subword token,训练目标是 next-token prediction。然而模型内部并非只在符号上运算——它先将 token 映射为连续表示,再经过多层非线性变换。潜空间就是这一族隐藏状态空间:上下文、语义、句法、关系特征被联合编码其中。一条 token 序列在显式空间对应潜空间中的一条轨迹,潜状态再投影回词表空间给出下一 token 的分布。
综述给出的形式化定义是:标准自回归生成 y ∼ Φ_θ(·|x) 完全在 token 空间进行;潜空间方法引入额外的连续潜变量 z ∈ H,使生成条件化为 y ∼ Φ_θ(·|x, z)。z 提供了一个额外通道,用于编码难以直接用 token 表达的全局语义、多模态特征、中间推理状态、结构约束等任务相关因子。
2.2 与显式空间的对比
综述从表示属性与功能能力两个维度对比潜空间与显式空间,这是理解整篇综述的概念基石。
表示属性四维对比:
- 人类可读 vs 机器原生:显式空间每个状态都是自然语言 token,可直接被人阅读与验证;潜空间是高维实值向量,单维与人类可解释特征无直接对应,但免去了人机信号转换的冗余开销。
- 离散符号 vs 连续灵活:显式 CoT 轨迹可能长达数千 token,多数 token 服务于语法连贯而非实质语义;潜空间丢弃表面语言冗余,将核心语义压缩为连续形式,在推理、视觉融合、智能体通信中天然适配。
- 低效 vs 高效:显式自回归至少有三重低效——语言冗余、每步强制表示转换、严格顺序解码;潜空间方法可绕过强制转换,采用循环或 looped 计算模式提升效率。
- 语义有损 vs 高保真:将连续激活外化为离散 token 引入量化瓶颈,细粒度不确定性、中间计算痕迹、跨模态对齐等结构可能被压缩、扭曲或丢弃;潜空间保留连续信息,可承载自然语言无法表达的内容。
功能能力四维对比:
- 可操作性(Operability):潜空间是可微流形,支持拼接、线性组合、可控语义引导、主动干预、迭代交织等高级操作;离散 token 不可微,只能做有限的间接 token 级操作。
- 表达力(Expressiveness):潜空间原则上可表达包括整个显式空间在内的更广表示,支持高效通信、视觉感知、具身动作规划、潜记忆形成。
- 可扩展性(Scalability):向量表示的紧凑性与可并行性使潜空间天然受益于更长推理轨迹、更深智能体交互轮次、更大测试时算力的扩展。
- 泛化性(Generalization):嵌入抽象语义概念而非表面语言模式,迁移学习与跨域鲁棒性均被实证受益。
但综述也明确指出一个结构性张力:潜空间在效率、表达力上的增益,恰恰以牺牲可评估性、可控性、可解释性为代价——这三项是显式空间的优势,也是第 7 节挑战部分的核心议题。
2.3 与生成式视觉模型潜空间的区别
一个容易混淆的问题是:扩散模型(如 Stable Diffusion、Sora)也使用"潜空间",它与语言模型的潜空间有何不同?综述从三个维度做了清晰切割:
- 训练目标:视觉潜空间由重建目标显式塑造,几何被锚定到视觉信号统计结构,线性插值产生感知连贯的中间体,距离携带可解释的感知意义;语言模型隐藏状态由预测目标组织,对空间几何无显式约束。
- 结构:视觉潜空间保持显式时空结构(图像为 patch 网格、视频沿时间轴扩展),空间邻近与时序连贯是强归纳先验;语言模型潜空间聚焦语言语义,缺乏空间拓扑或物理动力学。
- 可控性:视觉生成通过姿态序列、深度图、分割掩码、参考图等专用架构通路实现精细空间局部控制;语言模型潜空间的控制则需通过 steering vector、激活干预等间接手段。
这一区分至关重要:它说明本综述讨论的"潜空间"是一个语言模型原生的、由预测目标塑造的连续计算基底,不能简单套用 VAE/LDM 的几何直觉。
演化:从原型到爆发的四阶段轨迹
综述将潜空间研究的演化划分为四个时间上和主题上连贯的阶段,并明确指出每个阶段的核心驱动力与瓶颈——这种"阶段—瓶颈—下一阶段"的叙事结构是理解领域动态的关键。
3.1 原型阶段(Previous – 2025.3):可行性证明
原型阶段回答的问题是:大模型是否必须用自然语言外化每一步推理?这一阶段包含两条线索。
理论验证:HCoT 通过对比语义对齐证明完整 CoT 轨迹可被压缩为紧凑的特殊 token 表示,暗示显式 CoT 对模型本身而言大量信息是冗余的;Zhang & Viteri 从激活中提取 steering vector,注入后可在无微调、无显式提示下激发 CoT 式推理;Hu 等给出 Hopfield 式解读,将推理框架为表示空间间的跃迁;Latent Space Chain-of-Embedding 证明 LLM 可通过潜嵌入而非显式语言输出进行自评估。这些前驱工作确立了一个关键洞见:语言模型的能力并不根本绑定于离散 token 序列,而已经大量编码在其潜空间中。
早期探索:COCONUT 提出首个完整的连续潜空间推理框架,将最后隐藏状态回喂为下一输入嵌入,形成"连续思维"循环,绕过离散词表瓶颈,其关键发现是连续思维向量可编码多个潜在下一步的超position,实现潜空间中的涌现式广度优先搜索;CCoT 引入"沉思 token"将显式推理链压缩为密集潜形式;Liu 等通过离线协处理器用潜嵌入增强 KV cache,保持解码器完全冻结;Huginn 用循环深度在潜空间扩展测试时算力;SoftCoT 提供首个即插即用方案,将实例特定的软思维 token 投影到冻结骨干的表示空间以避免灾难性遗忘。
阶段瓶颈:缺乏对"为何潜推理有效、何时优于显式 CoT、如何超越孤立概念验证进行评估"的系统说明。可解释性、形式化、可比性是核心挑战,直接驱动下一阶段。
3.2 形成阶段(2025.4 – 2025.7):理论系统化与技术成型
形成阶段从原型洞见走向可实践的研究项目,以文本潜推理为主,伴随多模态与具身的初步扩展。
理论系统化:Zhu 等的 Reasoning by Superposition 给出首个形式复杂度分析,证明连续思维向量作为叠加态可同时编码多个搜索前沿,为 COCONUT 的经验行为提供严格解释;CoT2 量化并行度与嵌入维度的关系,引入连续监督与 RL 用于连续思维优化;Saunshi 等证明带潜迭代的 looped transformer 可表达比标准 transformer 严格更复杂的计算,建立循环深度架构的理论分离结果。
技术成型:表示设计方面,Assorted 混合潜离散 token 与文本 token 实现更短轨迹更高精度;CODI 形式化自蒸馏流程,同一模型同时作为教师与学生分别在显式与潜空间生成推理链;BoLT 将注意力转向预训练,把网络文本视为思维过程的压缩结果,用 bootstrapping 实现数据高效预训练。优化方面,HRPO、System-1.5、CoLaR 分别引入潜强化方法、语言与潜空间间的自适应计算分配、动态推理时可控压缩。
多模态初探:Mirage 让 VLM 通过将隐藏状态重铸为与文本交织的潜视觉 token 来"视觉思考",实现类似人类心理表象的内部视觉操作;UniVLA 引入以任务为中心的潜动作表示用于跨具身机器人策略,从互联网规模视频学习潜动作表示。
阶段瓶颈:方法仍在较窄设定下开发与评估,文本中心假设强、下游多样性有限、记忆/规划/通信/动作之间整合弱。下一阶段的核心问题从"潜推理能否形式化"转向"潜空间范式能跨域、跨模态、跨系统泛化多远"。
3.3 扩张阶段(2025.8 – 2025.11):多模态多领域生态
扩张阶段将潜空间研究从文本中心景观转变为多模态、多领域生态系统,沿并发维度快速多样化。
技术成熟:MemGen 开创智能体潜记忆,交织推理与记忆使规划、程序性、工作记忆类型在无显式监督下涌现;测试时扩展方面,LTPO 将潜思维向量视为可优化参数配合在线策略梯度,Ouro 将优化移入预训练 via looped language model,You 等通过随机采样策略实现并行测试时扩展配合潜奖励模型做轨迹选择;RL 驱动优化方面,SofT-GRPO 通过 Gumbel 重参数化策略优化解决将 RL 应用于连续潜推理的可微性挑战;交织与混合方向,SpiralThinker 与 CLaRa 分别提出文本-潜迭代交织与共享连续空间中的统一检索增强生成。领域特定应用开始涌现:搜索推荐统一、代码语言模型可解释性、System 1/2 双架构通信。
范式/场景扩张:视觉潜方法爆发,LVR 与 Monet 引入视觉嵌入空间中的自回归推理,生成与文本交织的潜状态用于细粒度视觉理解;3DThinker 通过将潜表示与 3D 基础模型对齐,从有限 2D 视图扩展到 3D 心理模拟;VisMem 提出认知启发的短时/长时潜视觉记忆模块,CoMEM 扩展视觉智能体的连续记忆;Latent Sketchpad 与 LaCoT 探索视觉草稿本与变分推理。潜通信作为多智能体新范式诞生:C2C 通过 KV-cache 投影与融合实现 LLM 间直接语义通信;ThoughtComm 发展心智到心智潜思维通信的理论框架;LatentMAS 通过共享潜工作记忆实现潜协作,显著减少输出 token 同时提升精度。具身领域同样扩展:LAPA 与 LAWM 通过世界建模从无标签视频自监督预训练潜动作;OccVLA 集成隐式 3D 占据监督用于可解释轨迹规划;SRPO 用 RL 配合潜世界表示训练 VLA;ATE 通过统一潜引导实现数据高效的 VLA 适配。
阶段瓶颈:快速扩张带来碎片化——不同工作采用不同架构假设、优化目标、评估标准、潜接口,难以比较方法或识别稳定设计原则。这为爆发期奠定基础,研究前沿转向架构专门化、优化精细化与将潜空间巩固为一级计算范式的更成熟尝试。
3.4 爆发阶段(2025.12 – 至今):全方位爆发
爆发阶段代表领域的爆炸性加速,特征是所有研究线程的全方位爆发:架构与表示专门化(为潜表示专门设计的模型)、计算与优化精细化(解决探索崩溃、潜奖励编码等细粒度挑战)、多场景激增(跨语言、视觉、动作、多智能体的统一框架)。
架构专门化:Dreamer 与 LoopFormer 引入结合序列注意力与深度计算、弹性循环的深度循环设计,实现预算感知推理与更灵活的算力分配;MLRA 通过低秩投影修订注意力机制;DLCM 将潜计算粒度从 token 级移至概念级,配合自适应概念边界。这些工作表明架构发展正超越对序列模型的渐进修改,走向专用潜空间系统。
优化精细化:ReLaX 与 Active Latent Planning 推进潜空间探索,从模仿学习转向更显式的基于 RL 的规划;Özeren 与 Aßenmacher 的系统分析表明 RL 仍对设计选择敏感并持续面临优化挑战;LED 通过利用循环深度上的熵变解决后训练探索崩溃;Latent Thinking Optimization 表明潜思维本身可编码奖励相关信息,开启直接优化潜轨迹而不完全依赖外部奖励模型的可能性。优化正成为独立的进展轴线而非次要关切。
视觉任务:ILVR 与 CrystaL 探索视觉-文本交织推理并报告推理过程中视觉潜表示的涌现;LIVR 与 Mull-Tokens 进一步将视觉推理推入潜空间并提出模态无关的潜思维机制;VL-JEPA 与 DMLR 扩展视觉推理的设计空间。
多智能体:Dery 等通过 K-V cache 对齐配合轻量适配器实现异构内部状态间的翻译;L2-VMAS 与 Wormhole 扩展到视觉与异构多智能体设定;LatentMem 引入共享潜记忆机制用于多智能体经验积累。
具身 VLA:Motus 与 VLA-JEPA 发展统一潜动作世界模型,在共享潜空间内整合动作生成与环境理解;Villa-X 与 JALA 提升潜动作建模的表达力与可扩展性;CoWVLA 引入潜运动空间的世界模型推理;WholeBodyVLA、SwiftVLA、LoLA 强化潜动作表示在 VLA 预训练与部署中的中心地位。
阶段瓶颈:一旦潜空间方法变得专门化、强大且普及,最难的问题不再是演示而是巩固——潜接口标准化、跨模态原则化评估、潜效率与可解释性的对齐、将潜计算整合入更广智能体系统。爆发期不是故事的终点,而是揭示下一阶段进展将取决于把快速增长的技术集合转化为连贯的潜计算科学与工程。
机制轴:架构、表示、计算、优化四条主线
机制部分回答"潜空间如何被实例化、结构化、操作化"。综述将设计空间沿四个互补轴线组织,这是整篇综述技术含量最高的部分,也是研究者最可直接借鉴的分类框架。
4.1 架构(Architecture):潜空间在模型中的结构角色
架构轴按"潜空间 H 在 Φ 中被整合的位置"区分为三类,对应 Φ = (Φ_back, Φ_comp, Φ_aux) 的三种角色。
骨干(Backbone):潜计算内生于主生成架构,通过循环、looping、递归结构使潜操作成为骨干的原生机制。形式化为 h_{t+1} = Φ_back(h_{1:t}, x, y_{1:t})。骨干方法可从三个视角理解:
- 参数共享:Huginn 用共享循环块在多个深度步复用,大幅减少唯一参数数同时启用测试时扩展;Looped Trans. 强制显式层循环并引入 looping 正则化稳定隐藏状态动力学;PHD-Trans. 将缓存管理与滑动窗口注意力结合,使循环计算在长上下文解码下保持实用。
- 迭代精修:Ouro 引入递归推理框架,迭代可作为替代扩展轴;LoopFormer 引入弹性深度 looped transformer,循环次数可跨输入或算力预算变化;PonderLM2 用 Jacobi 式并行更新进行迭代精修,在保留解码效率的同时实现更丰富的内部计算。
- 增强骨干:Heima 与 DLCM 用分层 encoder-decoder 组织潜计算,后者将计算从 token 移到压缩概念空间;Dreamer 与 MLRA 设计序列-深度稀疏注意力混合与低秩注意力;MoLAE 在低维上重构潜专家混合。
组件(Component):保留原骨干架构但增加功能模块来构造、变换、存储或检索潜表示。形式化为 z = Φ_comp(h, x),骨干仍是主生成器,组件作为潜空间上的插件算子。覆盖生成头、投影头、对齐、控制、存储等模块家族,在保留骨干的同时赋予潜机制。代表方法包括 SoftCoT、CODI、KAVA、AlignVLM、CoMEM、DeltaKV 等。
辅助模型(Auxiliary Model):利用额外模型提供监督信号或中间特征来引导或补充宿主模型。适用于需要外部教师、判别器、奖励模型或对齐器的场景,是连接潜表示与外部监督的桥梁。
4.2 表示(Representation):潜变量的形式
表示轴描述潜变量的形式,区分为内部、外部、可学习、混合四类。
- 内部表示:直接复用骨干自身的隐藏状态作为潜变量(如 COCONUT 回喂最后隐藏状态、Huginn 共享块输出)。优势是零额外参数、与骨干语义空间天然对齐;挑战是表示空间受骨干预训练约束。
- 外部表示:从外部源(如 VAE/VQ-AE 编码器、视觉编码器、3D 基础模型)引入潜变量。适用于多模态融合与跨具身迁移,但需解决模态间隙与对齐稳定性。
- 可学习表示:引入新初始化的可学习潜 token 或软思维向量(如 SoftCoT、Assorted、Latent-SFT)。灵活性最高,可与任务目标联合优化,但需防止灾难性遗忘与表示漂移。
- 混合表示:组合上述多种形式(如文本 token 与潜离散 token 交织、视觉潜 token 与文本交替)。在表达力与可控性间取得平衡,是当前实践中的主流选择。
4.3 计算(Computation):潜空间如何参与信息处理
计算轴捕获潜空间参与信息处理的方式,分为压缩、扩展、自适应、交织四类。
- 压缩计算:将长显式 CoT 压缩为紧凑潜状态。CCoT、Assorted、CODI 等证明推理链可被压缩数个量级而保留功能价值,揭示 token 级推理的根本冗余。
- 扩展计算:在潜空间中扩展有效深度与容量而不按比例扩展显式 token 生成。Huginn、Ouro、LoopFormer、Dreamer 通过循环块迭代实现测试时算力扩展;形式化结果表明 looped transformer 可表达严格更复杂的计算。
- 自适应计算:动态、输入相关的算力分配。PonderLM、System-1.5、CoLaR 通过实例级引导、RL 停止、动态终止、主动预算确定,使算力按问题复杂度成比例投入。
- 交织计算:在显式与潜空间之间交替。SpiralThinker、CLaRa、Hybrid latent-explicit 系统表明模型可在紧凑内部搜索与选择性外化间灵活切换,强推理器受益于协调多推理路径与模式而非承诺单一线性轨迹。
4.4 优化(Optimization):何时与如何塑造潜空间
优化轴聚焦潜空间何时被诱导、对齐或精修,跨越预训练、后训练、推理时三个阶段。
- 预训练:BoLT 将网络文本视为思维过程压缩结果用 bootstrapping 预训练;Ouro 将优化移入预训练 via looped language model;LAPA、LAWM 从无标签视频自监督预训练潜动作。预训练阶段塑造潜空间几何,是长期泛化能力的基础。
- 后训练:HRPO、SofT-GRPO、LTPO、LatentSeek、I2B-LPOP、ATP-Latent 等用 RL 与策略梯度直接优化潜轨迹;LED 解决后训练探索崩溃;Latent Thinking Optimization 表明潜思维本身可编码奖励信息。后训练是当前最活跃的优化方向,但综述指出 RL 仍对设计选择敏感。
- 推理时:通过 steering vector、激活干预、潜引导、测试时扩展在推理阶段塑造潜空间。Liu 等的离线协处理器、Zhang & Viteri 的 steering vector 注入、LF-Steering 等都属于此类。推理时方法无需重训练,部署成本低,但效果受限于预训练表示的可操控性。
综述强调一个重要趋势:领域正从启发式使用走向系统化原则,从外部集成走向内部启用,从静态固定走向动态自适应,从常规设计走向多范式。未来研究与其说是给现有模型加潜空间,不如说是设计以潜空间为内在核心的模型。
能力轴:推理、规划、建模、感知、记忆、协作、具身
能力部分回答"潜计算能在下游启用什么"。综述沿七个维度系统考察,每个维度都对应一类"难以、昂贵或根本有损地用自然语言外化"的结构——这正是潜空间作为通用基底的核心价值。
5.1 推理(Reasoning)
潜推理指通过内部连续表示而非显式 token 逐步语言化进行逻辑演绎、关系计算与结论生成。综述沿六个子能力组织:
- 隐式推断:COCONUT 证明连续思维向量可编码多推理路径超 position,实现涌现式广度优先搜索,模型可在承诺语言前内部推断。
- 紧凑轨迹:大量监督与后训练研究表明长推理链可被吸收进紧凑潜状态而保留功能价值,揭示 token 级推理的根本冗余。
- 连续精修:软 token 方法用概率加权嵌入混合或概念级混合替代离散采样;扩散与马尔可夫动力学使早期推理决策可被修订;能量一致性约束保证潜状态在可同时优化的同时保持连贯。
- 分支路径:并行潜推理通过软路径采样、随机宽度、Jacobi 迭代实现同时搜索多条候选轨迹;混合潜-显式系统在紧凑内部搜索与选择性外化间灵活切换。
- 模态泛化:模态无关连续思维证明潜推理范式跨语言、视觉、异构基底适用;跨模态迁移与效率技术表明该能力可跨模态移动;化学合成、叙事生成、新颖性发现、联合嵌入预测等领域应用展示广泛适用性。
5.2 规划(Planning)
规划关注通过解空间景观搜索最优轨迹,潜流形的连续可微性允许基于梯度的策略优化与迭代轨迹精修。与推理聚焦给定上下文内的逻辑演绎不同,规划强调计算的前瞻组织——决定在哪分配资源、如何探索解空间、何时终止搜索。四个子能力:
- 可控探索:基于 RL 的轨迹优化表明连续思维表示可通过策略梯度、Gumbel 重参数化、测试时精修直接改进;训练稳定性与多样性通过探索崩溃预防、系统设计分析、对比奖励塑造解决。
- 高效搜索:探索恢复与轨迹多样化通过熵利用、潜解码、受控嵌入探索维持推理多样性;几何引导搜索利用流形内在属性实现实例级定位与长上下文前瞻。
- 自适应预算:自适应深度与视野确定通过实例级引导、RL 停止、动态终止、主动预算确定,使算力按问题复杂度成比例投入。
- 序列决策:在推荐、检索、跨域适配中潜规划改进序列预测、重排、迁移;在多步规划与工具使用中支持持续状态跟踪、中间决策优化、多模态智能体紧控;进一步扩展到重参数化动作空间本身——将循环低熵脚手架压缩为紧凑潜动作单元以直接减少有效决策视野同时保留可执行性。
5.3 建模(Modeling)
建模关注对潜表示本身的刻画、检查与塑造——推理与规划关注模型在潜空间计算什么,建模关注潜表示让我们理解与控制关于计算的什么。四个子能力:
- 丰富表达:表达力分析证明连续思维向量同时编码多搜索前沿并实现可证大于 CoT 的表达力;监控能力分析揭示效率与可解释性的权衡;根本性限制结果表明探索与执行不能在固定预算内同时优化,推理深度与正确性在某些条件下弱相关。
- 自检视:有效性探测检查潜 token 是否编码真实推理还是利用伪迹;透明性与可视化方法通过潜辩论、几何可视化、极性感知探测使内部表示可解释;表示级分析展示信息保存与丰富语义维度;信息流研究揭示多跳推理路径与跨语言转换机制。
- 鲁棒控制:潜空间是模型安全的双刃剑——攻击向量利用潜融合与基于反馈的梯度及潜 CoT 中的后门触发;分层防御提供可控引导、对抗训练、特征激活引导、流式风险检测;训练阶段安全解决对抗正则化、对比遗忘、人类偏好建模。
- 可扩展计算:形式化表达力结果确认 looped transformer 可表达严格更复杂计算;循环块扩展迭代共享块用于测试时算力、扩展 looped 预训练、引入 encode-think-decode 架构;渐进精修与架构变体通过深度循环注意力、弹性深度、多分辨率递归扩展灵活性。
5.4 感知(Perception)
潜感知解决 VLM 在连续高保真潜空间中理解、表示、处理视觉信息的根本挑战。当前 VLM 将丰富视觉内容转为离散文本 token 不可避免地丢弃空间结构、细粒度细节、关系几何。潜感知通过保留密集、空间结构的信息克服此限制。三个递进子能力:
- 多模态推断:基础潜视觉推理表明生成与更新与文本交织的潜视觉状态可实现仅靠文本推理无法达到的细粒度视觉理解;后续工作通过选择性计算、粗到细处理、无像素级重建的联合嵌入预测保持准确与高效;多模态协调与对齐研究表明结构化视觉潜可被丰富、稳定、推广到时序域。
- 启发式想象:内部视觉想象赋能潜操作并将 VLM 特征与 3D 基础模型对齐;视觉草稿本引入通过连续视觉 token 捕获密集空间与几何信息的草图机制;感知保真保持确保潜视觉表示在蒸馏期间保持保真并跨模态间隙动态重聚焦注意力。
- 忠实接地:通过表示级干预改善 VLM 输出忠实性,解决幻觉问题——潜引导与架构对齐纠正视觉-文本错位并解决根因;感知接地 token 通过深度图与检测输出提供辅助信号;表示分析与诊断揭示感知失败何时发生并支持校准不确定性估计。
5.5 记忆(Memory)
记忆是 LLM 的必要补充——其无状态架构需要外部机制跨推理步保留知识。但基于 token 的记忆引入自身瓶颈:将累积上下文表示为离散序列膨胀提示长度、降低检索保真、阻止自适应记忆整合所需的基于梯度的优化。潜记忆通过将持久知识编码为连续向量解决此问题,实现紧凑跨上下文保留与卓越保真和适应性。三个递进子能力:
- 工作保留:通过 cache 干预实现跨推理步的紧凑信息保留,如 DeltaKV、CoMEM 系列。
- 持久心智:自演化知识存储,MemGen 交织推理与记忆使规划、程序性、工作记忆类型在无显式监督下涌现;LatentEvolve、KAVA、SALS 推动潜记忆的自演化。
- 多模态召回:VisMem 提出认知启发的短时/长时潜视觉记忆模块;FlashMem、G-MemLLM、PolarMem 等扩展多模态与持久化记忆。
5.6 协作(Collaboration)
潜通信作为多智能体新范式,使多个智能体通过潜通道直接交换语义内容而非仅靠离散语言。C2C 通过 KV-cache 投影与融合实现 LLM 间直接语义通信;ThoughtComm 发展心智到心智潜思维通信的理论框架;LatentMAS 通过共享潜工作记忆实现潜协作,显著减少输出 token 同时提升精度;Interlat、KVCAL、L2-VMAS、MAS4TS、Primitives、Wormhole、LatentMem 扩展到视觉、异构、共享记忆等设定。潜通信正成为可扩展智能体间协调的重要机制。
5.7 具身(Embodiment)
具身方向将潜计算扩展到物理交互,支持接地动作、预测前瞻、空间想象、跨异构身体的迁移。潜表示日益作为感知、生成、动作的统一接口,潜动作建模正成为中心设计范式。Motus 与 VLA-JEPA 发展统一潜动作世界模型;Villa-X 与 JALA 提升潜动作建模表达力与可扩展性;CoWVLA 引入潜运动空间的世界模型推理;WholeBodyVLA、SwiftVLA、LoLA、Future-VLA、LaST-VLA、RD-VLA、ColaVLA、LatentVLA、CDrive、LangForce、OccVLA 等强化潜动作表示在 VLA 预训练与部署中的中心地位。LAPA、UniVLA、ThinkAct、SRPO、GLaDATE、CLAP、LatBot、VITAL 等覆盖从自监督预训练到 RL 世界模型的完整具身潜空间栈。
二维分类法:方法图谱与代表性工作
综述最具操作性的贡献是"机制×能力"二维分类法。机制轴的四条主线(架构/表示/计算/优化)与能力轴的七大领域(推理/规划/建模/感知/记忆/协作/具身)交叉形成一张方法图谱,每个方法可被定位到一个或多个单元格。这种设计让研究者既能沿机制主线比较设计原则,又能沿能力域比较下游效果,避免被任务特定标签束缚。
从方法图谱中可以读出几个结构性观察:
第一,方法分布不均。推理与感知方向方法最密集,反映这两个能力是潜空间最早成熟的应用场景;建模与协作方向方法相对稀疏,是未来增长的潜力区。机制轴上,组件类与优化后训练类方法占多数,说明"在保留骨干的前提下加潜模块"与"用 RL 后训练塑造潜轨迹"是当前两条主流工程路径;骨干类与预训练类方法相对少但影响力大(如 COCONUT、Huginn、Ouro、LoopFormer),代表更深层的架构创新。
第二,单方法多归属是常态。COCONUT 同时属于骨干-内部-压缩-预训练与推理-建模;Huginn 同时属于骨干-内部-扩展-推理时与推理-建模;CODI 同时属于组件-混合-压缩-后训练与推理。综述明确指出"单一方法可隶属一个或多个机制与能力",并在可视化中采用最合适的分类。这意味着二维分类法不是非此即彼的标签,而是定位坐标系。
第三,演化沿对角线推进。原型阶段方法集中在"组件-内部-压缩-推理"区域;形成阶段向"骨干-可学习-扩展-预训练"与"推理-建模"扩展;扩张阶段覆盖"组件-外部-交织-后训练"与"感知-记忆-协作-具身";爆发阶段则在"骨干-混合-自适应-推理时"与全能力域同时深化。这条对角线反映了从浅层插件到深层架构、从单一能力到全能力谱系的演化逻辑。
代表性骨干方法的关键指标对比如下(基于综述 Table 2 整理):
| 时间 | 骨干 | 规模 | 层数 | 核心架构特征 |
|---|---|---|---|---|
| 2025.01 | Heima | 19B | 72 | encoder-decoder / 渐进 / 自适应解码 |
| 2025.02 | Huginn | 3.5B | 8 | decoder-only / 循环深度 / 共享循环块 / 测试时 |
| 2025.02 | Looped Trans. | 1.5B | 24 | decoder-only / looped model / looping 正则化 |
| 2025.03 | MoLAE | 0.1B | 12 | 潜专家混合 / 共享投影 / 低维 |
| 2025.04 | PHD-Trans. | 1.2B | 16 | decoder-only / 缓存管理 / 滑动窗口注意力 |
| 2025.09 | PonderLM2 | 0.5B/1.4B | 24 | decoder-only / 迭代精修 / Jacobi 并行更新 |
| 2025.10 | Ouro | 1.4B/2.6B | 24/48 | decoder-only / 递归推理 / 参数共享循环 |
| 2025.12 | DLCM | 1B/2B | 16/32 | encoder-decoder / 大概念模型 / 分层异构 |
| 2026.01 | Dreamer | 2.9B | 32 | 深度循环 / 序列-深度稀疏注意力混合 |
| 2026.02 | LoopFormer | - | - | decoder-only / 弹性深度 looped transformer |
| 2026.03 | MLRA | 2.3B | - | 多头低秩注意力 / 四路张量并行解码 |
这张表显示了一个清晰趋势:骨干方法从 2025 年初的小规模循环块实验,演化到 2026 年初的 2–3B 级专用潜空间架构,架构特征也从单一循环深度发展到弹性深度、概念级、低秩注意力等多元化设计。
挑战:可评估性、可控性、可解释性三重缺口
综述在展望部分之前专门列出挑战,这是整篇综述最清醒的部分。潜空间的连续性、压缩性、灵活性、表达力这些使其强大的属性,恰恰也使其难以检查、评估与治理,导致相对低的可评估性、可控性、可解释性。这三重缺口不是工程细节,而是潜空间能否成为通用智能可靠基础的根本障碍。
7.1 可评估性(Evaluability)
潜推理方法的核心挑战在于有限的可评估性。与显式推理轨迹不同,潜轨迹不直接可被人检查,难以判断中间计算是否正确、完整、甚至与任务相关。这种不透明性实质性地约束了过程级验证——研究者常无法区分真正结构化的中间推理与仅和正确输出相关的表示。因此潜推理系统的评估仍主要依赖最终答案准确率或事后语言化,两者都只提供关于实际推理过程的间接且可能不完整的证据。
尽管近期已有研究开始提出潜空间推理的基准化策略,领域仍缺乏成熟且广泛接受的监督与评估协议。现有方法在任务、数据集、测量标准上碎片化,尚无标准化框架评估潜推理轨迹的忠实性、鲁棒性、内部一致性。基准碎片化与指标不一致使方法间公平比较困难、阻碍累积进展、复杂化真正方法论进步的识别。
7.2 可控性(Controllability)
虽然潜空间原则上是高度可操作的计算与控制基底,但实现对潜表示的可靠且可泛化的操控在实践中仍是重大挑战。对隐藏状态的细粒度干预确实能以有用且有时惊人精确的方式重塑模型行为,但此类干预常受相对低可控性困扰。核心困难不仅在于识别在哪及如何干预,更在于确定高层语义意图应如何被指定才能同时满足机器可执行、足够精确、人类操作者可理解。这暴露了连续内部动力学与离散可解释目标之间的更深缺口。真正可控的潜系统需要的不仅是局部引导技术,而是能将显式目标、安全要求、资源约束稳健自适应地映射到内部计算过程的原则化机制。
7.3 可解释性(Interpretability)
困难源于潜表示的本质:高维、分布式、常深度纠缠,单维及其诱导轨迹都不能整洁地映射到稳定语义概念。涌现的是一个表达力巨大但内部组织抗拒人类理解的空间。这种不透明使解释模型为何达到特定结论、追踪信息如何跨计算阶段变换、确定错误与错位从何首先产生都变得困难。更重要的是,问题不仅是认识论的更是制度性的:通过不可 scrutinize 的潜操作推理的系统可能变得更强大同时变得更不可审计、更不可诊断、更不可问责。
展望:理论、多模态、下游任务、可治理性
展望部分将未来方向组织为四个相互交织的轴线,核心论断是:潜空间研究的下一步不仅是产出更好的潜推理方法,而是将潜空间确立为机器智能的原生基底。显式语言可能仍是指令、生成、验证的接口,而潜空间日益成为模型思考、理解、模拟、记忆、行动的内部工作空间。
8.1 理论(Theory)
核心优先级是从经验成功走向原则化的理论理解。关键问题不是潜推理是否比语言化推理更高效,而是何时它更可操作、更表达、更可扩展、更可泛化作为计算基底。领域必须从分散的理论验证进展到潜表示、潜计算及其启用能力增益的统一框架。
现有工作已开始提供表达力与计算优势的形式说明,但系统性理论仍欠发达。未来研究应阐明潜推理如何运作、为何、何时、在何种约束下超越显式或语言推理。这需要对潜轨迹的几何、语义、优化动力学、计算组织有更深入说明。同样重要的是将显式与潜空间原则化地表述为语言智能内两种互补表示体制——显式语言作为外部可访问接口,潜空间作为推理、抽象、记忆、模拟、规划的内部工作空间。理论目标是解释两空间如何交互、何种信息与操作最自然分配给各自、协调中出现何种权衡。
未来工作还必须发展可信潜空间的原则化理论。因潜轨迹本质上不透明于直接人类检查,进展不能仅依赖结果级性能。领域需要可评估性、可控性、可解释性的严格框架,配合标准化基准与监督协议,以评估潜计算的忠实性、鲁棒性、内部一致性。
8.2 多模态(Multimodal)
多模态智能的未来不应被理解为给语言模型添加更多感官通道,而是潜空间作为共享计算工作空间的涌现——语言、视觉、动作、记忆、智能体间通信可在连续表示内联合处理。两个主要方向:
第一,从文本中介多模态走向模态原生多模态潜计算。现有多模态系统常将非语言输入翻译为文本或 token 化形式后再进行高层操作。潜表示可保留高保真信息、减少模态间隙、支持比显式符号通道更平滑的融合、对齐、交互。长期目标不是用语言描述感知,而是让模型直接在视觉、空间、动作导向的潜空间内操作。
第二,从孤立多模态模型走向集成多模态系统。潜空间不仅启用推理,还启用规划、建模、感知、记忆、协作、具身——统一这些能力的是它们都涉及难以用自然语言外化的结构。未来多模态 AI 可能依赖感知、世界建模、记忆形成、通信、动作规划通过共同潜基底协调的架构,而非松耦合模块或额外计算。
8.3 下游任务(Downstream Task)
未来下游进展应被理解为更广的转移:显式语言仍是指令、监督、验证的接口,潜空间日益作为计算的内部工作空间。最有前景的下游任务是那些中间状态难以被离散语言轨迹捕获的:搜索密集推理、序列规划、视觉感知、长时程记忆、多智能体协调、具身控制。在这些设定中,潜表示为紧凑搜索、连续精修、更丰富视觉接地、持久记忆、更高带宽协调、可迁移动作抽象提供统一基底;未来系统可能在潜空间内执行大多数内部推理、规划、状态演化,仅外化最终输出或战略选择的检查点。
8.4 可治理性(Governable)
有前景的未来方向是将潜空间发展为可观察、可治理的基底。未来工作应超越改进潜推理准确性,建立可信潜计算的完整方法论:评估潜轨迹忠实性与鲁棒性的基准套件;提供过程级信号而非仅最终答案反馈的监督策略;将内部动力学与显式目标、资源预算、安全要求对齐的可控潜接口;识别潜表示中语义结构、因果路径、失败源的可解释框架。这些努力将帮助弥合机器原生计算效率与人类监督需求之间的缺口,使潜空间能作为可靠基底服务。
对研究与产业的启示
这份综述对两类读者有不同但同样重要的启示。
对研究者,二维分类法提供了定位自己工作的坐标系。新方法应明确声明其在机制轴(架构/表示/计算/优化)与能力轴(推理/规划/建模/感知/记忆/协作/具身)上的归属,并解释为何这种组合优于已有替代。综述揭示的稀疏区(如建模×协作、骨干×预训练×具身)是高潜力研究方向。三重缺口(可评估性、可控性、可解释性)不是要回避的副作用,而是值得专门攻关的一级研究问题——任何在三者之一取得原则化进展的工作都将具有高影响力。理论方向尤其需要补充:现有形式化结果(如 Reasoning by Superposition、looped transformer 表达力分离)仍是局部证明,缺乏统一框架。
对产业实践者,综述提供了几条可迁移的工程判断。第一,不要把潜空间当作简单的 CoT 压缩——它是计算基底的迁移,涉及架构、表示、计算、优化的协同设计;浅层插件(如 SoftCoT 式软 token)可作为低成本入门,但天花板受限于骨干表示空间。第二,后训练 RL 是当前最活跃的优化路径,但综述明确指出 RL 仍对设计选择敏感并面临探索崩溃,部署前需充分的稳定性验证。第三,多模态与具身是潜空间的最大蓝海——文本中介的多模态架构在细粒度视觉与空间推理上有结构性瓶颈,模态原生潜计算是下一代 VLM/VLA 的方向。第四,可治理性是部署前置条件——在生产系统中使用潜推理前,必须建立过程级评估、可控接口、可解释框架,否则系统将变得"更强大同时更不可审计"。
对 DeepResearch2AGI 关注的生物医药与 AI for Science 读者,还有一个值得注意的迁移方向:综述在推理部分提及化学合成、叙事生成、新颖性发现、联合嵌入预测等领域的潜推理应用,表明潜空间范式不限于自然语言,也可作为科学推理的连续计算基底。蛋白设计中的"思维链"是否可被压缩为潜状态、分子生成的搜索是否可在潜空间并行、多智能体科研协作是否可用潜通信提升带宽——这些都是综述框架可直接迁移的开放问题。
参考信息
原文:Yu, Chen, He, Fu, Dong, Yang, Xu, Ma, Hu, et al. "The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook." arXiv:2604.02029 [cs.CL], July 2026. arxiv.org/abs/2604.02029
配套仓库:github.com/YU-deep/Awesome-Latent-Space — 持续更新的论文与方法列表
核心机构:新加坡国立大学、复旦大学、清华大学、上海人工智能实验室、浙江大学、人民大学、香港中文大学、香港科技大学、DeepWisdom、南京大学、上海交通大学、南洋理工大学、腾讯混元、QuantaAlpha、北京邮电大学、之江实验室、中国科学院大学、香港科技大学(广州)、中山大学
核心贡献者:Xinlei Yu(组织者)、Zhangquan Chen、Yongbo He、Tianyu Fu、Guanting Dong、Cheng Yang、Chengming Xu、Yue Ma、Xiaobin Hu 等;核心导师:Cheng Tan、Jiangning Zhang、Wenqi Ren、Yanwei Fu、Yong Liu、Yu Wang、Xiangyu Yue、Yu-Gang Jiang、Shuicheng Yan
综述结构:7 章 — 1 引言 / 2 基础 / 3 演化 / 4 机制 / 5 能力 / 6 展望 / 7 结论;含 8 张图、多张方法对比表、200+ 方法引用
许可证:arXiv 预印本(社区维护,欢迎贡献)
关键技术关联:
· COCONUT (2024) — 首个完整连续潜空间推理框架,连续思维循环
· Huginn (2025.02) — 循环深度 + 共享循环块 + 测试时扩展
· SoftCoT (2025) — 首个即插即用软思维 token 方案
· Ouro (2025.10) — 递归推理作为替代扩展轴
· LoopFormer (2026.02) — 弹性深度 looped transformer
· Dreamer (2026.01) — 深度循环 + 序列-深度稀疏注意力混合
· MLRA (2026.03) — 多头低秩注意力 + 四路张量并行
· DLCM (2025.12) — 概念级潜计算 + 大概念模型
· MemGen / VisMem / CoMEM — 潜记忆三路线
· C2C / LatentMAS / ThoughtComm — 潜通信三路线
· UniVLA / LAPA / Motus / OccVLA — 潜具身动作四路线
· SofT-GRPO / LED / Latent Thinking Optimization — 潜 RL 优化三路线