智能,不只是模型:从计算与不确定性到解决方案系统的演进
过去几年,AI 的进步常常被等同于模型能力的进步:更大的模型、更长的上下文、更强的推理、更高的基准分数。
但模型只是智能系统的一部分。
如果把视角从“模型有多强”扩大到“一个系统如何解决问题”,会发现一个更基本的问题:
如何在有限的计算成本下,把问题解决到足够低的不确定性。
从这个角度看,搜索、AI 模型和机制,是解决问题的三种基本方式。它们共同工作,并随着问题逐渐成熟,使解决方案系统不断向更合适的计算—不确定性权衡移动。
一、计算成本与不确定性
假设存在一种算法,可以百分之百正确地解决某个问题,但需要 \(10^{100}\) 次计算。
它并不是一个可用的解决方案。
反过来,如果一种方法几乎不需要计算,但我们完全不知道结果是否可靠,它同样没有太大价值。
因此,一个解决方案系统至少有两个基本属性:
\[\boxed{C=\text{计算成本}}\]和
\[\boxed{U=\text{不确定性}}\]智能系统寻找的不是单纯的
\[\min U\]而是更合适的
\[\boxed{(C,U)}\]组合。
这里需要区分误差与不确定性。
假设真实世界为 \(W\),解决方案系统为 \(S\),两者之间存在真实差距:
\[E=D(S,W)\]这个差距客观存在,但由于真实世界无法被完整观测,通常也无法直接知道 \(E\)。能够获得的,是基于已有数据、实验和经验,对这个差距的估计:
\[p(E\mid \mathcal D)\]误差是解决方案与真实世界之间真实但未知的差距;不确定性是我们对这个差距的认识。
一个智能系统真正需要判断的是:当前的不确定性是否已经足够低;如果还不够,继续投入多少计算才值得。
所以智能从一开始就是一个关于计算成本与不确定性联合优化的问题。
二、三种基本的解决方式
改善计算—不确定性权衡,大体有三种基本方式:
\[\boxed{ \text{搜索} \qquad \text{AI 模型} \qquad \text{机制} }\]它们不是互斥的路线,而是计算发生在何处、如何降低不确定性的三种不同安排:
- 搜索:投入较高且可变的在线计算,通过试验、执行和验证获得新信息,直接降低当前问题的不确定性。
- AI 模型:把大量计算前移到训练阶段,将历史经验压缩进参数,以较低的在线计算换取快速预测,同时保留统计与分布变化带来的不确定性。
- 机制:执行已经明确规定的映射,计算成本通常更稳定、可预期;在适用条件内不确定性最低,但风险集中在规则是否正确、适用边界是否成立。
三种方式对应的不是简单的“高成本到低成本”,而是不同的计算—不确定性结构。
搜索
搜索通过探索不同可能性,并从环境、模拟、执行或验证中获得新的信息。它把计算放在问题发生之后:搜索越深、分支越多,在线计算成本越高;得到的反馈越充分、验证越可靠,当前问题的不确定性通常越低。
例如围棋中,从当前状态出发,可以展开多个候选动作:
\[s \rightarrow a_1,a_2,\ldots,a_n \rightarrow \text{不同未来结果}\]程序开发中也可以:
\[\text{修改} \rightarrow \text{运行} \rightarrow \text{观察} \rightarrow \text{再次修改}\]搜索的本质是:
投入在线计算,以获得新的信息,从而降低不确定性。
搜索可以适应缺少先验经验的新问题,但成本会随搜索空间迅速增长,而且不确定性能否真正下降,取决于环境能否提供有效反馈。
AI 模型
当同类问题已经积累了大量历史经验,就不必每次重新搜索。AI 模型把过去反复付出的搜索与学习成本,压缩为一次前向计算。
给定历史数据
\[(x_1,y_1),\ldots,(x_n,y_n)\]可以学习
\[f_\theta(x)\approx y\]之后面对新的输入,可以直接通过模型得到预测。
围棋中,原本可能需要展开大量未来局面:
\[s_t \rightarrow a_t \rightarrow s_{t+1} \rightarrow \cdots \rightarrow R\]经过学习后,可以直接估计
\[V_\theta(s)\]或者
\[\pi_\theta(a\mid s)\]AI 模型的训练成本可能很高,但可以被大量后续调用分摊,因此单次推理的在线计算通常远低于重新搜索。代价是模型给出的是统计估计:数据覆盖不足、环境变化和置信度失准,都会留下不确定性。
因此,AI 模型的核心交换是:
用历史经验和离线计算,换取更低的在线计算,同时接受可估计但无法完全消除的统计不确定性。
机制
还有一些问题,其输入到输出的映射已经可以被明确表达:
\[y=f(x)\]例如算术算法、编译器、数据库事务、网络协议和各种确定性的程序。
这类解决方式可以称为机制。
机制仍然需要计算,但它执行的是一个已经被明确规定的映射,而不是通过统计方式估计这个映射。它的计算成本不一定总是最低,却通常更加稳定、可分析和可复用。
在规则正确且适用条件成立时,机制的不确定性最低;它的不确定性主要来自机制之外:规格是否写对、输入是否满足假设、环境是否已经变化。一旦越过适用边界,确定性的执行也可能稳定地产生错误结果。
因此,机制的核心特征是:
在明确边界内,用可预期的计算获得稳定结果,把不确定性集中到规则和边界本身。
三、协同与解决方案系统的右移
真实的解决方案系统通常不是三选一,而是三者共同工作。
更好的 AI 模型可以提高搜索效率:
\[\text{AI 模型} \rightarrow \text{更高效的搜索}\]搜索产生的新经验又可以改善模型:
\[\text{搜索} \rightarrow \text{新经验} \rightarrow \text{更好的 AI 模型}\]机制则可以提供可靠的执行与验证能力:
\[\text{机制} \rightarrow \text{执行与验证} \rightarrow \text{更好的搜索}\]因此,更准确的结构是:
\[\boxed{ \text{搜索} \leftrightarrow \text{AI 模型} \leftrightarrow \text{机制} }\]三者共同组成解决方案系统,并共同改善计算与不确定性的权衡。协同描述的是它们在同一时刻如何组合;右移描述的是这种组合如何随问题成熟而变化。
三种方式虽然共同存在,但对于一个逐渐成熟的问题范围,解决方案系统的重心通常会发生变化:
\[\boxed{ \text{以搜索为主} \rightarrow \text{以 AI 模型为主} \rightarrow \text{以机制为主} }\]这种变化可以称为解决方案系统的右移。
一个新的问题往往缺乏足够经验,因此需要大量搜索、试验和验证。随着经验积累,越来越多判断可以由 AI 模型直接完成。当其中一些规律进一步被理解、形式化和验证后,又可以沉淀成明确的机制。
右移并不意味着搜索或模型消失,而是:
对于同一个问题范围,解决方案系统不断重新组织,以获得更合适的计算成本与不确定性组合。
围棋就是典型例子。一个陌生局面可能需要大量搜索;更强的策略模型和价值模型可以减少无效搜索;部分已经完全解决的局部问题,则可以直接使用确定策略或查表。
软件工程也有类似过程。一个陌生故障最初可能需要反复修改、运行和观察;大量类似经验积累后,AI 模型可以直接给出较好的解决方案;其中稳定、重复的问题进一步可能变成编译器检查、静态分析规则、库或者接口。
昨天需要反复搜索的问题,今天可能只需要调用一个已有机制。
科学和工程的发展同样如此:许多问题最初依赖实验和试错,之后形成经验模型,其中稳定的规律进一步成为公式、算法、机器和基础设施。
从这个角度看,文明积累的一个重要过程,就是让越来越多问题拥有更靠右的解决方案系统。
四、右移与问题边界扩张
对于一个固定的问题范围,进步表现为解决方案不断右移。但对于整个智能系统,更重要的变化是:
\[\boxed{\text{可以解决的问题边界不断扩张}}\]这两件事彼此关联。
现代软件开发建立在处理器、操作系统、编译器、网络、数据库和软件库之上。这些底层问题已经拥有成熟的解决方案,因此开发者不需要重新研究整数如何表示,也不需要重新实现网络协议。有限的计算和认知资源可以直接投入到更大的问题上。
AI 系统也是一样。可靠的代码执行器、数据库、计算器和各种工具,使它能够直接探索更高层的问题,而不必重新解决底层能力。
因此,智能进步同时包含两个方向:
\[\boxed{\text{已有问题不断右移}}\]和
\[\boxed{\text{新的问题边界不断向外扩张}}\]新的问题边界通常仍然更依赖搜索,因为那里缺少足够经验和成熟机制。但新的搜索并不是从零开始。它建立在大量已经右移的模型和机制之上。
于是,已有问题的右移,又进一步提高了探索新问题的效率。
这也给出了对智能进步更完整的定义。
从这个框架出发,智能不能简单等同于模型能力,也不能简单定义为降低不确定性。
更完整的描述是:
智能是在计算与不确定性的共同约束下,不断发现和组织更好解决方案系统的能力。
它的进步表现为两个过程:已有解决方案不断右移,以及可解决的问题边界不断扩张。
这两个过程彼此促进。右移让已有问题以更合适的方式被解决;由此释放出的计算资源和已经积累的能力,又让系统可以进入更大的未知空间。
因此,智能的发展不是简单地“模型越来越强”。更准确的图景是:
\[\boxed{ \text{搜索} \leftrightarrow \text{AI 模型} \leftrightarrow \text{机制} }\]一个个问题的解决方案重心持续向右移动,而整个系统能够处理的问题边界持续向外扩张。
五、对下一代 AI 的启示
今天的 AI 发展很容易隐含一个等式:
\[\text{更强的 AI} \approx \text{更强的 AI 模型}\]但 AI 模型只是完整智能架构中的一个组成部分。
更强的系统需要能够联合组织搜索、AI 模型和机制,并根据当前问题的计算成本与不确定性,选择合适的解决方式。有些问题可以直接由模型解决;有些问题需要投入更多搜索和验证;有些问题已经存在可靠机制,直接执行更加合适。
更进一步,一个能够持续进化的系统,还应该改变自己解决同类问题的方式。
如果某类问题长期依赖昂贵搜索,可以通过学习把更多工作交给 AI 模型。如果某些规律已经足够稳定,可以进一步形式化成机制。如果已有机制的适用条件发生变化,则重新引入模型和搜索。
因此,AI 的自我改进不应只表现为
\[\theta_t\rightarrow\theta_{t+1}\]更完整的变化是整个解决方案架构的变化:
\[\boxed{\mathcal A_t\rightarrow\mathcal A_{t+1}}\]未来真正重要的 AI 系统,可能不是单纯拥有一个更强的模型,而是能够持续优化自身的解决方案结构。
结语
整个框架可以压缩成四点:
第一,任何解决方案都同时受到计算成本与不确定性的约束。
第二,搜索、AI 模型和机制,是处理这一权衡的三种基本方式,并且彼此协同。
第三,对于逐渐成熟的问题,解决方案系统的重心往往会从搜索向 AI 模型,再向机制右移。
第四,已有问题不断右移,使有限的计算资源能够投入更大的未知问题边界。
智能的进步不仅是解决越来越难的问题,更是不断找到更好的方式解决已经遇到的问题,从而把计算投入到更大的未知世界。
下一代 AI 的关键,也许不只是获得一个更强的模型,而是形成一个能够持续推动已有问题右移、并不断扩张自身问题边界的解决方案系统。