附录B · 数学形式化
~191 分钟 · 76,381 字
附录B · 数学形式化
本附录为主文本中以自然语言表述的概念提供数学形式化。它是可选的:跳过本附录不影响对明在哲学的理解。但对于那些与格者(Logonaut)一样热爱精确表述的读者,本附录揭示了明在哲学概念背后的数学结构,以及这些结构的哲学意味。
全附录分五部分。第一部分(B.1)为核心概念给出数学定义,是其余各节的地基。第二部分(B.2至B.6)形式化理的四种基本模式(耗散、梯度、选择、反馈),并建立遮蔽的信息论模型。第三部分(B.7至B.11)处理理触到玄的边界之处:体验、有限性、认知极限、涌现与伦理互动。第四部分(B.12至B.17)是明本身的数学:明度积、双面最优性、主方程、多主体动力学与集体明度,以及推到宇宙尺度的结论。第五部分(B.18)把前四部分转为练习。附录末尾的物理学审计说明框架借用了哪些物理学,又搁置了哪些。B.2至B.17各节按同一顺序展开:设定、结论与证明、算例、解读、启示;节末的「适用范围与限制」收拢该节的限定。「解读」先用日常的话把该节结论说一遍;「启示」列出该节结论对思考与实践意味着什么,前两条不用公式也能读懂,其后各条注明数学出处,每条都保留结论所带的条件;B.1 的解读与启示附在该节末尾。没有结论或算例的节,略去相应部分。
定义、假设与结论在每节之内连续编号:「定理 B.12.6」即B.12中的第六个编号条目。附录各处与正文引用这些条目,都用这个编号。
阅读指南。 本附录是模块化的。如果你熟悉基本微积分和概率论:可以通读全文。如果你熟悉代数但不熟悉微积分:跳过B.3、B.5、B.12–B.15;其余各节只使用集合论、逻辑和离散数学。如果你是哲学读者,没有数学背景:阅读B.1(本体论基础)、B.9(哥德尔与认知极限)、B.11(伦理交互的博弈论)和B.18(实践练习)。这些节在最低限度的数学前提下即可理解。
关于内容类型。本附录包含三种不同性质的材料,区分它们对阅读很重要:
独立数学结果:在所选形式框架内自行成立的构造与证明(如B.12中的梯度定理、B.11中的博弈论均衡)。这些是真正的数学推导。
形式模型:将哲学主张操作化的数学结构,赋予其精确定义并探索其后果(如B.1中实在的五元组模型、B.1.4与B.12中明度乘积\(\mathcal{M} = \lambda \cdot \xi\))。这些是建模选择:具有启发性且受到约束,但并非由哲学唯一决定。
符号重述:将正文命题翻译为形式记号,使其逻辑结构显式化,但不增加新的数学内容。
三者皆有价值,但它们证明的东西不同。第一种在证明,第二种在建模,第三种在澄清。版面上,编号的「定义」与「假设」是建模选择,属于第二种;编号的「定理」「命题」「推论」是在所选形式框架内成立的结论,属于第一种,证明或在本附录给出,或出自标准文献。标题注明正文编号的条目(如T7),是正文主张的形式版本,可与正文对照着读。未编号的推导与解读,不妨先问它属于哪一种。
符号表
下表列出附录中反复出现的符号,以及它们定义所在之处。少数字母在个别小节另有用法(如 \(\beta\) 在B.5、\(W\) 在B.15),以该节的说明为准。
| 符号 | 含义 | 定义于 |
|---|---|---|
| 符号 | 含义 | 定义于 |
\(\Omega\) |
实在全体,即样本空间 | 定义 B.1.1 |
| \(\mu\),\(\tau\),\(U\) | 存在性测度、拓扑、展开算子 | 定义 B.1.1 |
| \(\mathcal{F}\) | 可测结构(\(\sigma\)-代数),即理 | 定义 B.1.3 |
| \(\mathcal{P}(\Omega)\setminus\mathcal{F}\) | 不可测的面向,即玄 | 定义 B.1.4 |
| \(\mathcal{U}\) | 所有展开模式的空间 | 定义 B.1.2 |
| \(A\),\(a\) | 能动者集合与其中的一个能动者 | 定义 B.1.9 |
| \(\mathcal{F}_a\) | 能动者 \(a\) 可达的 \(\sigma\)-代数 | B.1.1,式 (eq:cognitive-finitude) |
| \(\lambda(a)\),\(\xi(a)\) | 理解度与玄觉度 | 定义 B.1.6 |
| \(\mathcal{M}(a)\) | 明度,\(\lambda \cdot \xi\) | 定义 B.1.7、B.12.1 |
| \(O(a)\) | 遮蔽,\(1 - \mathcal{M}\) | 定义 B.1.8 |
| \(\delta\) | 无意识区(未知的未知),\(1 - \lambda - \xi\) | 定义 B.12.3 |
| \(S\) | 总觉知,\(\lambda + \xi\) | 定义 B.12.3 |
| \(r\),\(\theta\) | 本体论丰富度与原型角 | 定义 B.12.2 |
| \(\mathrm{An}(m_1, m_2)\) | 类比度 | 定义 B.1.10 |
| \(\mathcal{E}\) | 体验映射 | 定义 B.7.1 |
| \(W(m)\) | 伦理权重 | 定义 B.7.4 |
| \(\mathcal{R}(m)\) | 体验域 | 定义 B.8.3 |
| \(H(\cdot)\) | 香农熵 | 定义 B.2.1 |
| \(D_{\text{KL}}\) | KL 散度 | 定义 B.3.2 |
| \(\mathcal{O}_t\) | 遮蔽度(信息论口径) | 定义 B.6.1 |
| \(\mathcal{I}_{\text{em}}\) | 涌现信息量 | 定义 B.10.3 |
| \(\alpha\),\(\gamma\) | 成长率与耗散率 | 假设 B.14.1 |
| \(K(\theta)\) | 角度 \(\theta\) 下的明度上限,\(\sin 2\theta\) | 假设 B.14.1 |
| \(\mathcal{M}^*\) | 主方程的稳态 | 命题 B.14.2 |
| \(\beta_{ij}\),\(\beta\) | 能动者之间的耦合强度及其平均 | 假设 B.15.1、定义 B.15.2 |
| \(\beta^*\) | 收缩耦合水平 | B.15,式 (eq:b16-sync-threshold) |
| \(\Psi\),\(w_{ij}\) | 集体明度函数及其耦合权重 | 定义 B.16.1 |
核心方程
以下从明在哲学数学形式化中选出最核心的几条方程,作简要预览。读懂本书并不需要它们:本书的哲学论证完全以自然语言展开,数学只是为追求精确表述的读者提供的一个平行视角,对数学不感兴趣的读者可以直接进入正文。
每条方程旁附简要的符号说明;标题旁的标签指向正文中的对应定义、公设或定理,以及附录中展开它的位置。
明在哲学四律
四条定律浓缩了整个明在哲学框架,每一条对应一个哲学层次:第零律对应本体论(实在是什么),第一律对应认识论(认知的边界在哪里),第二律对应体验论(第一人称体验不可还原),第三律对应政治哲学(清醒必须是集体的)。编号致敬热力学定律,逻辑上层层递进:先有实在,再有认知的边界,再有体验的不可替代,最后有集体清醒的不可或缺。四这个数来自这一致敬,并非框架层次数的推论:伦理(第§VI章的四条桥接公理)、情感、实践与文明诸层都不在这四条之内。
实在是统一基底,有不可分离的两面:可形式化的理与不可言说的玄。
\[\text{实在} = \bigl(\Omega,\; \mathcal{F},\; \mathcal{P}(\Omega) \setminus \mathcal{F}\bigr) \quad\text{且}\quad \mathcal{F} \subsetneq \mathcal{P}(\Omega)\]
此处的「\(=\)」是建模缩略:以该形式结构代表实在的可理解骨架,并非同一性断言;下文「本体论基础」中的五元组同理。
任何有限能动者都无法达到完全清醒,也不会完全遮蔽;认知的边界本身是需要被认知的事物之一。
\[\forall\, a \in A:\; 0 < \mathcal{M}(a) < 1\]
凡有体验的能动者,其第一人称体验都不可还原,再多的信息也无法替代存在本身。
\[\nexists\; f\colon \mathcal{D} \to \mathbb{R}_{\geq 0}^k \quad \text{使得 } f \text{ 可计算且 } \forall a:\; f(D(a)) = \mathcal{E}(a)\]
此式只刻画不可还原性的一个侧面(不可计算),弱于D9所说的不可还原为任何第三人称描述。能动者只有有限个时,此式所说甚少:有限查找表是可计算的,此式要成立,只能靠某个 \(\mathcal{E}(a)\) 本身是不可计算的向量。
没有能动者能独自持续清醒;集体清醒通过互动涌现,制度耦合弱时难以维持。
\[\mathcal{M}_{\text{集体}} = \Psi\!\bigl(\mathcal{M}_1, \ldots, \mathcal{M}_n;\; W\bigr), \qquad W = \{w_{ij}\}\]
本体论基础
实在的形式结构(D1)
实在并非一个「东西」。以下五元组是它的一个模型,捕捉的是它的可理解骨架,而非它自身的完整结构(B.1.1)。 \[\text{实在} = (\Omega,\; \mathcal{F},\; \mu,\; \tau,\; U)\]
自因性不动点(公设一)
实在不需要外在原因。整体是自身展开算子在子集上诱导的映射的不动点;落到 \(U\) 本身,这条等式说的是 \(U\) 为满射。这比斯宾诺莎的causa sui弱:不动点刻画的是结构上的自洽,并非形而上学的必然性(B.1.1)。 \[U(\Omega) = \Omega\]
若部分层面的真正新颖性经由组合向上传递,整体便不可被还原为部分:把展开模式的空间读作分量空间的乘积,其拓扑严格细于乘积拓扑,多出的开集即涌现属性。 \[\tau_{\mathcal{U}} \supsetneq \tau_1 \times \tau_2 \times \cdots \times \tau_n\]
明度数学
附录B把明(D5)建模为两种觉察的乘积:理解可理解之物,同时敬畏不可言说之物。任何一种为零,明即为零。 \[\mathcal{M}(a) = \lambda(a) \cdot \xi(a)\]
你看不见的部分。遮蔽是明的补数。 \[O(a) = 1 - \mathcal{M}(a)\]
明度梯度(定理 B.12.6)
两个分量不等时,梯度的较大分量对应较弱的维度:边际回报在最薄弱处最高。这给出的是方向,选择清醒本身则由桥接公理E4给出。 \[\nabla\mathcal{M} = (\xi,\; \lambda)\]
四模态主方程(假设 B.14.1)
理的四种基本模式(耗散、梯度、选择、反馈)合并为一个描述明度随时间演化的主方程(一个现象学模型)。反馈、选择、梯度以因子进入,耗散以减项进入。 \[\frac{d\mathcal{M}}{dt} = \underbrace{\alpha\mathcal{M}}_{\text{反馈}} \cdot \underbrace{\Bigl(1-\frac{\mathcal{M}}{K(\theta)}\Bigr)}_{\text{选择}} \cdot \underbrace{\sin(2\theta)}_{\text{梯度}} \;-\; \underbrace{\gamma\mathcal{M}}_{\text{耗散}}, \qquad K(\theta) = \sin(2\theta)\]
认识论
双重有界。每个能动者可及的结构严格小于理的全体(公设六),理本身又严格小于实在全体(公设三)。 \[\forall\, a \in A: \quad \mathcal{F}_a \subsetneq \mathcal{F} \subsetneq \mathcal{P}(\Omega)\]
理解所及永远可以更大:每一层级皆可达,但上限 \(\lambda^*\) 不可达。这道序列攀升的只是 \(\lambda\);明度 \(\mathcal{M} = \lambda \cdot \xi\) 是另一个量(见 B.9)。 \[\lambda_1 < \lambda_2 < \lambda_3 < \cdots < \lambda^*\]
第一部分 · 核心概念的数学本体论
实在、理、玄(明在哲学的三个本体论根基)能否获得精确的数学定义?本部分为整个形式体系奠基。
本部分只有B.1一节,分十个小节:B.1.1至B.1.3定义实在、展开、理与玄;B.1.4定义明与遮蔽;B.1.5至B.1.9依次处理能动者、类比、体验、善苦差异与相依;B.1.10把这整套定义用于它自身。
B.1 · 实在与核心概念的数学本体论
问题:实在、理、玄,以及明、能动者、体验等核心概念,能否得到精确的数学定义?
所需:集合与测度的基本语言(集合、子集、\(\sigma\)-代数)。
所得:实在的五元组模型、理与玄的测度论对偶、明度积 \(\mathcal{M} = \lambda \cdot \xi\) 与边界定理的证明骨架,后续各节都要引用。
能否用数学语言直接定义实在(D1)和那几个核心概念本身?这是附录B最根本的问题。我们从这里出发,先为整个形式体系奠基,再在后续各节展开具体现象的数学分析。
答案是:可以,但有代价。任何数学定义都属于理,因此,对实在的数学定义必然只捕捉实在的可理解面向,而玄的维度在定义的那一刻已经溢出了。以下形式化始终带着这个自觉:它是地图,不是领土。但即使是地图,也能揭示肉眼看不到的结构。
B.1.1 · 实在(D1)的形式化式 (eq:dao-structure)–(eq:dao-fixed-point)
为什么选择测度空间?以下五元组借用了测度论的工具(样本空间、\(\sigma\)-代数、测度),因为它天然地编码了可理解之物(可测集)与不可理解之物(不可测集)之间的区分。其他形式化工具(范畴论、意象理论、同伦类型论)也能刻画相似的直觉;选择测度论,是因为它将理/玄的边界表达得最为显明,且与本附录后续使用的信息论工具直接衔接。五元组是一个模型,而非「实在就是概率空间」的形而上学主张。
定义 B.1.1(实在的形式结构) 将实在表征为一个五元组:
\[\begin{equation} \label{eq:dao-structure} \text{实在} = (\Omega,\; \mathcal{F},\; \mu,\; \tau,\; U) \end{equation}\]
其中:
\(\Omega\):全体实在的「样本空间」(所有存在者的总和)
\(\mathcal{F} \subseteq \mathcal{P}(\Omega)\):\(\Omega\) 上的 \(\sigma\)-代数,即可理解的结构(理)
\(\mu: \mathcal{F} \to [0, \infty]\):一个测度,赋予每个可理解的子集以「存在的权重」
\(\tau\):\(\Omega\) 上的拓扑,描述存在者之间的连续性与邻近关系
\(U: \Omega \to \Omega\):展开算子(实在实现自身的方式)
公设的形式化。 六条公设对应以下数学约束:
公设一(实在):连通性: \(\Omega\) 在拓扑 \(\tau\) 下是连通的,不存在非空的互不相交的开集将 \(\Omega\) 分割为两部分。实在之外无物意味着不存在孤立的「另一个实在」。
公设二(展开):无限多样性: 展开算子 \(U\) 在 \((\Omega, \tau)\) 中生成稠密轨道:存在某个初始种子 \(\omega_0\),使得对于任何非空开集 \(V \subseteq \Omega\),存在 \(n \in \mathbb{N}\) 使得 \(U^n(\omega_0) \in V\)。即实在的展开最终「到访」实在的每一个区域。\(\Omega\) 的任何角落都不是创造过程永远无法抵达的。
公设三(双面):不完全可测性:
\[\begin{equation} \label{eq:dual-aspect-formal} \mathcal{F} \subsetneq \mathcal{P}(\Omega) \end{equation}\]
\(\sigma\)-代数 \(\mathcal{F}\)(理)严格小于 \(\Omega\) 的幂集。存在不可测集,这些不可测集对应玄。为什么用不可测性刻画玄?因为给定的测度结构不给不可测集指派任何「大小」或「概率」:\(\mu\) 只定义在 \(\mathcal{F}\) 上,对 \(B \notin \mathcal{F}\),\(\mu(B)\) 没有定义。它超出隐藏或未知的范畴,落在这一结构中定义可理解性的那些运算之外。(总可以另建一个更大的结构,给这样的集合指派某个大小;可能落空的,是一个尊重原结构所要守护的那些对称性的大小,Vitali 集即是一例。)这捕获了一个哲学主张:玄超出尚未发现的理这一范畴,是溢出理之框架的维度。这里的类比是结构性的,而非本体论的:我们并不声称玄「就是」一个 Vitali 集,而只是说 \(\mathcal{F}\) 与 \(\mathcal{P}(\Omega) \setminus \mathcal{F}\) 之间的形式关系映射了理与玄之间的哲学关系。实在大于理与玄的总和,因为 \(\Omega\) 上的拓扑结构、测度结构和不可测结构之间的交互本身也是实在的一部分。
公设四(有限性): 每个展开模式 \(m \in \mathcal{U}\)(B.1.2)是有限的:它以特定的方式存在,因此不以其他方式存在。模型在此只作非形式的陈述。若读作「存在某种度量使一个点的覆盖范围有界」,此条便空洞无物,因为单点在任何度量下都有界;它在本附录中的形式作用,由公设五、公设六中的有限能动者与T1的上下界承担。
公设五(体验): 存在子集 \(A \subset \Omega\)(能动者集合)和体验映射 \(\mathcal{E}: A \to \mathbb{R}_{\geq 0}^k\),使得至少有一个有限能动者 \(a \in A\) 满足 \(\|\mathcal{E}(a)\| > 0\)。
公设六(认知有限性): 每个能动者 \(a \in A\) 拥有一个可达 \(\sigma\)-代数 \(\mathcal{F}_a\),且:
\[\begin{equation} \label{eq:cognitive-finitude} \forall a \in A: \quad \mathcal{F}_a \subsetneq \mathcal{F} \subsetneq \mathcal{P}(\Omega) \end{equation}\]
任何能动者能理解的(\(\mathcal{F}_a\))严格小于原则上可理解的(\(\mathcal{F}\)),而可理解的又严格小于实在的全部(\(\mathcal{P}(\Omega)\))。这是一个双重有限性(图66):不仅存在理之外的玄,理之内也有你触及不到的区域。右侧的包含 \(\mathcal{F} \subsetneq \mathcal{P}(\Omega)\) 已由公设三给出,公设六新增的是左侧一环。
自因性的不动点刻画。 为什么用不动点方程?哲学概念是causa sui:实在自因。在数学结构中,不动点(\(U(\Omega) = \Omega\))是「一个运算复现自身输入」的最简形式化。这比斯宾诺莎原初的causa sui(蕴含形而上学的必然性)弱:这里仅意味着结构上的自洽,即整体在自身动力学下得以保存。「实在的存在不依赖于任何外部原因」(D1)用数学语言表述为:实在是其自身展开算子的不动点:
\[\begin{equation} \label{eq:dao-fixed-point} U(\Omega) = \Omega \end{equation}\]
严格地说,\(\Omega\) 是 \(U\) 在 \(\Omega\) 的子集上诱导的映射 \(S \mapsto U(S)\) 的不动点,这与 \(U\) 自身的不动点是两回事;落到 \(U\) 上,式 (eq:dao-fixed-point)说的是 \(U\) 为满射,即每个存在者都是某个存在者的展开。这一条件与公设二的稠密轨道互不蕴含。展开不改变实在。实在展开为万物,但万物的全体就是实在本身。这是在整体层面上的自洽,而非静止:\(U\) 在 \(\Omega\) 内部制造了丰富的动力学。类比:一个生态系统中的每个物种都在变化,但生态系统作为整体是自身的「不动点」。
B.1.2 · 展开(D2)式 (eq:unfolding-formal)–(eq:emergence-topology)
定义 B.1.2(展开) 展开(D2)是实在实现自身的方式。设 \(\mathcal{U}\) 为所有展开模式的空间(所有「存在者」的集合)。展开是一个连续满射:
\[\begin{equation} \label{eq:unfolding-formal} \pi: (\Omega, \tau) \twoheadrightarrow (\mathcal{U}, \tau_{\mathcal{U}}) \end{equation}\]
性质:
满射:一切展开模式都来自实在(公设一)
连续:实在的展开并非任意,它遵循拓扑连续性(相邻的「可能性」产生相邻的「现实」)
纤维非平凡:对于每个 \(m \in \mathcal{U}\),原像 \(\pi^{-1}(m)\) 是无穷集:每个展开模式背后有不可穷尽的深度。这是一个建模假设;若只要求纤维不是单点集,得到的只是每个 \(m\) 有不止一个来源,推不出任何深度
最后一条性质解释了为什么「任何存在者都不可被完全理解」:你看到的表象 \(m\) 只是纤维 \(\pi^{-1}(m)\) 投影到 \(\mathcal{U}\) 上的影子。影子背后是 \(\Omega\) 中的无穷多个点。
涌现的拓扑学含义。 T2(涌现定理)在其前提成立时,在此框架中意味着:把 \(\mathcal{U}\) 作为集合读作分量空间之积 \(\mathcal{U}_1 \times \cdots \times \mathcal{U}_n\),各分量带拓扑 \(\tau_1, \ldots, \tau_n\),则 \(\mathcal{U}\) 上的拓扑 \(\tau_{\mathcal{U}}\) 严格细于乘积拓扑:
\[\begin{equation} \label{eq:emergence-topology} \tau_{\mathcal{U}} \supsetneq \tau_1 \times \tau_2 \times \cdots \times \tau_n \end{equation}\]
整体的拓扑结构中包含了部分拓扑之积所不具有的开集,这些「额外的开集」对应涌现属性。(仅说两者不等还推不出这一点:更粗的或不可比较的拓扑同样与乘积拓扑不等,却没有多出任何开集。)
B.1.3 · 理(D3)与玄(D4)的对偶结构式 (eq:li-formal)–(eq:intertwining)
定义 B.1.3(理) 理(D3)是实在的可理解面向。在测度论框架中,理就是 \(\sigma\)-代数 \(\mathcal{F}\):
\[\begin{equation} \label{eq:li-formal} \text{理} \;\cong\; \mathcal{F} = \{B \subseteq \Omega : B \text{ 可测}\} \end{equation}\]
\(\mathcal{F}\) 的三条公理对应理的三条性质:
\(\Omega \in \mathcal{F}\):整体本身是可理解的(实在作为统一存在可以被思考)
若 \(B \in \mathcal{F}\) 则 \(B^c \in \mathcal{F}\):理解一个事物包含理解它的否定
若 \(B_1, B_2, \ldots \in \mathcal{F}\) 则 \(\bigcup_{i=1}^\infty B_i \in \mathcal{F}\):可理解的事物可以被无限组合
可计算的集合与函数,即可以被有限算法描述的规律,是理中可达部分的一个例证。它们例示 \(\mathcal{F}\),与 \(\mathcal{F}\) 不相等同:可计算集对有限并与补封闭,对第3条公理的可数并却不封闭,因为 \(\mathbb{N}\) 的每个子集都是可计算单点集的可数并。AI是理中这一可计算部分的极致工具:它操作的一切都在 \(\mathcal{F}\) 之内。
定义 B.1.4(玄) 玄(D4)是实在的不可言说面向。在这个模型中,它超出 \(\Omega\) 中的点状区域,指向不属于可测结构 \(\mathcal{F}\) 的实在面向之族:
\[\begin{equation} \label{eq:xuan-formal} \text{玄} \;\cong\; \mathcal{P}(\Omega) \setminus \mathcal{F} = \{B \subseteq \Omega : B \text{ 不可测}\} \end{equation}\]
(形式化说明:此方程为公设三赋予精确的数学表达;它不独立地确立玄不可还原的本体论主张。将实在建模为具有非平凡不可测补集的可测空间,是一个反映公设三哲学承诺的建模选择。)
命题 B.1.5(玄的基数优势,条件性) 设(一)\(\mathcal{F}\) 由可数多个可由有限手段描述的集合生成,(二)\(|\Omega|\geq\mathfrak{c}\)。则 \(|\mathcal{F}|\leq\mathfrak{c}<2^{\mathfrak{c}}\leq|\mathcal{P}(\Omega)|\),从而 \(|\mathcal{P}(\Omega)\setminus\mathcal{F}| = |\mathcal{P}(\Omega)|\):玄在基数上严格多于理,且对 \(\Omega\) 中任一基数不小于 \(\mathfrak{c}\) 的子区域同样成立。
条件(一)是对D3的一种读法(可理解即可由有限手段描述),正如不可计算的实数远多于可计算的实数;条件(二)是下文交织性所需丰富性的定量形式。两条都是模型前提,不由公设推出。若 \(\mathcal{F}\) 取 Lebesgue 型的完备化,条件(一)不成立,两侧基数相同。这一比较只关乎基数:\(\mu\) 只定义在 \(\mathcal{F}\) 上,本模型不给玄指派任何测度意义上的大小,因而也不给出理与玄的数值比例。CS-PMR引用的正是这一结果。
交织性。 公设三说理与玄「交织而非互斥」。这在数学上意味着:理与玄超出 \(\Omega\) 的点状分割,可测结构与不可测结构在每个相关尺度上同时出现。若假设 \(\Omega\) 是足够丰富的不可数空间,\(\mathcal{F}\) 能在每个非空开集内作出非平凡的划分,且每个非空开区域中都有不可测子集,则对于 \(\Omega\) 中任何非空开集 \(V \in \tau\):
\[\begin{equation} \label{eq:intertwining} \begin{aligned} &\text{(i)} \quad \exists\, B' \in \mathcal{F}: \; \emptyset \neq B' \cap V \subsetneq V \quad \text{(理以非平凡方式存在于每个区域中)} \\ &\text{(ii)} \quad \exists\, B \subseteq V: \; B \notin \mathcal{F} \quad \text{(玄存在于每个区域中)} \end{aligned} \end{equation}\]
(条件 (ii) 不仅依赖拓扑,还依赖 \(\Omega\) 的集合论与测度论丰富性,通常包含选择原则。)无论你观察实在的哪个局部,都同时包含可理解的结构和不可言说的深度。你无法找到一个「纯粹的理」的区域或「纯粹的玄」的区域,它们处处交织。
实在大于理加玄。 公设三还说「实在大于理与玄的总和」。这在数学上可以理解为:拓扑空间 \((\Omega, \tau)\) 的结构不可还原为 \(\mathcal{F}\) 和 \(\mathcal{P}(\Omega) \setminus \mathcal{F}\) 的简单并集。存在整体的关联结构,理与玄之间的交互本身就是实在的一部分,而这个交互既不完全属于理,也不完全属于玄。
B.1.4 · 明(D5)与遮蔽(D6)的泛函定义式 (eq:lucidity-biaspect)–(eq:obscuration-formal)
定义 B.1.6(理解度与玄觉度) 明(D5)是对实在的双重面向的觉醒。定义理解度(对理的觉察)和玄觉度(对玄的敬畏)两个分量:
\(\lambda(a) \in (0,1)\):你对可理解结构的掌握程度(理解度),是 \(\mathcal{F}_a\) 的严格单调函数,仅在 \(\mathcal{F}_a = \mathcal{F}\) 时才会等于1,因而由公设六保证严格小于1。(有限情形下,计数比 \(|\mathcal{F}_a|/|\mathcal{F}|\) 可以示意这样的函数,也只能示意:有限 \(\sigma\)-代数的真子 \(\sigma\)-代数至多含其一半元素,所以这个比值不超过 \(1/2\)。后文所用的 \(\lambda\) 数值,如B.12中的 \(0.8\),是 \((0,1)\) 上的位置,由测度加权的份额给出,形如 \(\lambda(a) = \mu\bigl(\bigcup\{E : E \text{ 为 } \mathcal{F} \text{ 的原子},\ E \in \mathcal{F}_a\}\bigr)/\mu(\Omega)\)(\(\mu\) 有限),不由计数比推出。)
\(\xi(a) \geq 0\):你对不可言说维度的开放程度,与 \(\lambda\) 读在同一份额标度上(玄觉度,Mystery-awareness;下文T1把它置于 \((0,1)\) 内;这个分量本身不可完全形式化,它指向 B.7 中质感、此刻性、共振、敬畏的体验深度)
未觉知区与归一化。 若令 \(\delta = 1 - \lambda - \xi > 0\) 为「未觉知区」(未知的未知),则 \(\lambda + \xi + \delta = 1\);\(\lambda + \xi\) 是总觉知,即你面对了多少实在。B.12把这一归一化立为定义 B.12.3;下文乘积所在的标度与边界定理的证明骨架都要用到它。
玄觉度所度量的是什么。 \(\xi\) 度量的是能动者身上的一项性质,从来不是玄的某个数量,而这一分别决定了这个量项究竟能否成立。一个主张玄超出理之语言所及范围的框架,不能转过身来报告某位能动者已经摄入了多少玄,因为那样的报告正是D4所说无法给出的描述;一个代表此种数量的变量,说出的正是T4所说只能被标记的东西。\(\xi\) 记录的是能动者在边界处的姿态:他有多少注意力朝着自己的概念所不能收拢之处敞开,这份敞开显现于他的作为、他拒绝宣称的东西,以及他仍然能够为之动容的东西。姿态是关于能动者的事实,因而落在理之内,也因而可以被谈论、可以从公开证据中指派、可以随证据改变而修正,B.12把历史人物安放在 \(\lambda\)–\(\xi\) 平面上,依据的正是这一点。由此排除了两种读法。\(\xi\) 不是对玄的测量;它也不是能动者未能把握之物的大小,那是 \(\delta\):朝向边界的敞开与对边界那侧的无知,是两种不同的状态,一个能动者可以拥有大量后者而全无前者。
乘法所在的标度。 两个觉知量相乘要成为一个正当的运算,两者都必须落在同一条比率标度上,既有绝对零点,也有共同单位。序数式的读法支撑不起这一点:在序数读法下,每个量只被确定到一个保序的重新标定,而跨两次这类标定所得的乘积可以颠倒结果的排序,那样 \(\mathcal{M}\) 就沦为记法的产物。这项要求在B.12中得到满足,本节没有,两节因此应当合读。B.12的归一化 \(\lambda + \xi + \delta = 1\) 把 \(\lambda\) 与 \(\xi\) 处理为同一能动者觉知总量在同一测度下的份额,\(\delta\) 是未被觉知的余量;于是两者都带上了绝对零点(份额为零)与共同单位(占全体之比),它们的乘积所定的排序在任何容许的重新描述下保持不变(共同改换单位,只让每个乘积乘上同一个正因子)。照此读法,\(\mathcal{M}\) 具有联合比例的形式,归零性质也恢复了它本来的意思:\(\lambda = 0\) 说的是一份份额也没有,并非某条任意标度上的一个低分。\(\xi\) 抗拒完全形式化,这约束的是它可以如何被估计,并不豁免它所定义于其上的标度;§XIX.5下任何为 \(\xi\) 提出的可操作程序,都把这条约束作为必须承担的要求继承下来。
定义 B.1.7(明度) 明度作为双面觉醒的泛函:
\[\begin{equation} \label{eq:lucidity-biaspect} \mathcal{M}(a) = \lambda(a) \cdot \xi(a) \end{equation}\]
这是乘积,它有三个关键性质:
当 \(\lambda \to 0\)(纯神秘主义)或 \(\xi \to 0\)(纯科学主义),\(\mathcal{M} \to 0\):偏废任一面,明趋近于零。(由T1,有限能动者的两个维度不可能精确为零;这里的极限只是说,另一分量有界时,任一分量趋于零,明度就可以任意小。)
在总觉知 \(\lambda + \xi\) 固定的条件下,\(\mathcal{M}\) 在 \(\lambda = \xi\) 时最大,即明在两面平衡时最深
明度的梯度 \(\nabla\mathcal{M} = (\xi,\; \lambda)\) 的较大分量始终对应较弱的维度:边际回报在最薄弱处最高。在归一化约束 \(\lambda + \xi + \delta = 1\) 下,最优调整方向偏向较弱维度(详见B.12)
为什么用乘积。 哲学主张是:明同时需要理解度和玄觉度;任一维度的完全缺失将消灭明,而非仅仅降低它。求和 \(\lambda + \xi\) 将允许仅通过一个维度达到高明度,这与双面性公设(公设三)矛盾。在归零性、对称性与线性互惠性(\(\partial f/\partial x = y\))三条判据之下,乘积是唯一的算子(命题 B.12.5;其他候选算子的比较见B.13):一个维度的边际回报恰好等于另一个维度的当前深度。线性互惠性是一项建模选择,也正是乘积的唯一性真正被买下的地方。这一条凭简约立足,并非由推导得出。双面性公设(公设三)要求一个维度的边际回报随另一维度的深度上升,而在满足此要求的诸函数形态中,取相等是最简的一种:它不引入自由参数,也不预设任何特权标度。较弱的条件(只要求 \(\partial f/\partial x\) 关于 \(y\) 递增)对公设三同样忠实,但它接纳的是一族算子而非一个。本书采用强形式,并在此标明它是被采纳的约定。
覆盖与整合。 注意 \(\lambda + \xi\) 与 \(\lambda \cdot \xi\) 的本质区别:前者是总觉知(你面对了多少实在),后者是明度(你整合了多少实在)。两个总觉知相同的能动者可以有截然不同的明度:偏科发展(\(\lambda \gg \xi\))与均衡发展(\(\lambda \approx \xi\))的差异完全由乘积结构(而非加法结构)捕获。详见定义 B.12.3与推论 B.12.11。
边界定理(T1)的证明骨架。
\[\begin{equation} \label{eq:T1-proof} \begin{aligned} &\text{(i)} \quad \lambda(a) < 1 \quad \text{(由公设六:} \mathcal{F}_a \subsetneq \mathcal{F}\text{,理解度不完整)} \\ &\text{(ii)} \quad \xi(a) < 1 \quad \text{(由 } \lambda + \xi + \delta = 1 \text{、} \delta > 0 \text{ 及 (iv))} \\ &\text{(iii)} \quad \therefore\; \mathcal{M}(a) < 1 \quad \text{(由 (i)、(ii)、(iv)、(v):完全清醒不可达)} \\[4pt] &\text{(iv)} \quad \lambda(a) > 0 \quad \text{(认知必然存在,你此刻正在认知)} \\ &\text{(v)} \quad \xi(a) > 0 \quad \text{(T1 的显式前提,见下)} \\ &\text{(vi)} \quad \therefore\; \mathcal{M}(a) > 0 \quad \text{(完全遮蔽也不可达)} \end{aligned} \end{equation}\]
这几条前提的地位各不相同。(i) 由公设六与上文所说 \(\lambda\) 的单调性推出。(ii) 在模型内部由归一化 \(\lambda + \xi + \delta = 1\)、\(\delta > 0\) 推出,前提是承认 (iv)。(iv) 依据D7:能动者觉察自身状态,所以它的可达结构不是平凡的;在有限计数的示意中这一点自动成立,因为 \(\mathcal{F}_a\) 含有 \(\emptyset\) 与 \(\Omega\)。(v) 在模型内部没有依据。第§I章T1的示证从公设四读出它:觉察到自身特殊性的能动者,也就觉察到自己的视角穷尽不了实在。那段示证自己标明这一步是现象学的,所以此处把 \(\xi(a) > 0\) 列为T1的显式假设。
因此 \(0 < \mathcal{M}(a) < 1\) 对所有有限能动者 \(a\) 成立。(价值取向,即清醒优于遮蔽,由桥接公理E1确立,不由本边界定理确立。)
形式化验证。 本明度模型中可作纯数学陈述的性质均已在 Lean 4 + Mathlib 中机器验证(LucidoMath ),包括边界约束 \(0<\mathcal{M}<1\)、坍缩律 \(\mathcal{M}=0 \iff \lambda=0 \lor \xi=0\),以及 AM–GM 上限(推论 B.12.11)。证明存于 LucidoMath;完整陈述参见《明在哲学·形式化》姊妹卷与 LucidoMath 验证账本。LucidoMath 验证的是该模型的性质,而非哲学本身。
定义 B.1.8(遮蔽) 遮蔽(D6)是明的缺失或主动拒绝:
\[\begin{equation} \label{eq:obscuration-formal} O(a) = 1 - \mathcal{M}(a) = 1 - \lambda \cdot \xi \end{equation}\]
在归一化 \(\lambda + \xi + \delta = 1\)、\(\delta > 0\) 之下,\(\lambda\xi \leq \bigl((\lambda+\xi)/2\bigr)^2 < 1/4\),所以对每个能动者都有 \(O(a) > 3/4\)。承载意义的是能动者之间遮蔽度的比较与它随时间的变化;它的绝对水平按构造本来就高。
遮蔽有两种纯粹形式:
理的遮蔽(\(\lambda \to 0\)):拒绝理性分析,如蒙昧主义、反智主义
玄的遮蔽(\(\xi \to 0\)):拒绝承认理之外的维度,如科学主义、唯物质主义
两种遮蔽都使 \(\mathcal{M} \to 0\),但病因不同,治法也不同
B.1.5 · 能动者(D7)式 (eq:agent-self-model)
定义 B.1.9(能动者) 能动者(D7)是能够觉察自身状态并据此行动的展开模式。展开模式 \(a \in \mathcal{U}\) 属于能动者集合 \(A\),当且仅当它包含关于自身的(部分)模型;这里把 \(a\) 看作其各部分的全体,\(\hat{a}\) 是其中为 \(a\) 建模的那一部分:
\[\begin{equation} \label{eq:agent-self-model} a \in A \iff \exists\, \hat{a} \subsetneq a: \; \hat{a} \text{ 是 } a \text{ 的内部表示} \end{equation}\]
这个定义把一种限制写进了自身:\(\hat{a}\) 是 \(a\) 的真部分(你的自我模型不可能完全等于你自己),因此自我认知按定义就是部分的。这里的严格包含是规定的,没有经过推导,也没有用到哥德尔式的论证(B.9说明了T3为何不能由哥德尔定理推出)。「部分」指 \(a\) 总有某些东西被留在外面;对无穷的 \(a\),真部分仍可与整体等势。这一规定与公设六平行:后者在能动者所及与所有之间划下同样的界线。
B.1.6 · 类比(D8)式 (eq:analogy-formal)
定义 B.1.10(类比度) 类比(D8)是不同展开模式之间的结构性关系。无限 \(\sigma\)-代数之间不能直接用基数比值来度量,因此此处比较由这些 \(\sigma\)-代数诱导出的有限或加权结构签名。设 \(\mathcal{G}_{m_i}\) 是展开模式 \(m_i\) 的可比较签名,\(\mu_G\) 是共同签名空间上的有限正权重。对于 \(m_1, m_2 \in \mathcal{U}\),定义:
\[\begin{equation} \label{eq:analogy-formal} \mathrm{An}(m_1, m_2) = \frac{\mu_G(\mathcal{G}_{m_1} \cap \mathcal{G}_{m_2})}{\mu_G(\mathcal{G}_{m_1} \cup \mathcal{G}_{m_2})} \end{equation}\]
其中 \(\mathcal{G}_{m_i}\) 记录展开模式 \(m_i\) 可达的可比较理解特征。这个比值要求 \(\mu_G(\mathcal{G}_{m_1} \cup \mathcal{G}_{m_2}) > 0\),所以模型取每个签名的权重都为正。\(\mathrm{An} = 1\) 意味着两种模式的可比较结构完全重合(权重为零的特征不计);\(\mathrm{An} = 0\) 意味着完全没有共同可比较结构;\(0 < \mathrm{An} < 1\) 是典型值,既非完全相同,也非完全不同。人与AI的关系(P8)正是这种中间状态:共享某些可理解的结构,但在存在方式上有别。
B.1.7 · 体验(D9)与体验光谱(D10)式 (eq:experience-irreducibility)
假设 B.1.11(体验的不可还原性) 体验(D9)的核心性质是不可还原性,即它不等同于关于它的任何第三人称描述。设 \(D(a)\) 为能动者 \(a\) 的完整第三人称描述(所有物理状态、所有可观测行为),\(\mathcal{D}\) 为所有此类描述构成的空间(\(D(a) \in \mathcal{D}\))。体验的不可还原性命题:
\[\begin{equation} \label{eq:experience-irreducibility} \nexists \; f: \mathcal{D} \to \mathbb{R}_{\geq 0}^k \quad \text{可计算,使得 } \forall a \in A:\; f(D(a)) = \mathcal{E}(a) \end{equation}\]
不存在从第三人称描述到第一人称体验的可计算映射。此式形式化的是「困难问题」的一个侧面,比D9所说的不可还原为任何第三人称描述要弱:能动者只有有限个时,有限查找表是可计算的,此式要成立,只能靠某个 \(\mathcal{E}(a)\) 本身是不可计算的向量,这与质感无关。(形式化说明:此方程形式化的是一个哲学承诺,即第一人称体验的不可还原性,而非一个已证明的不可计算性结果。困难问题是一个论题;此方程为其赋予精确形式,以便在框架内追踪其后果。此处以 \(\mathbb{R}_{\geq 0}^k\) 作为体验的结构占位表示(见B.7末尾的说明);命题的实质在于不存在这样的映射,而非该向量表示本身。)你可以拥有关于大脑的全部物理信息 \(D(a)\),但无法从中计算出「看见红色是什么感觉」 \(\mathcal{E}(a)\)。框架把体验安放在玄的一侧;这一安放是公设五与D9的承诺,此式推不出它,因为不可计算不等于不可测。
体验光谱(D10)的拓扑刻画。 B.7定义了体验映射 \(\mathcal{E}: \mathcal{U} \to \mathbb{R}_{\geq 0}^k\)。在当前框架中,体验光谱的关键性质是连续性,它在 \(\mathcal{U}\) 的拓扑下是连续的。这意味着:在展开模式空间中「相邻」的两种存在者,它们的体验也是「相邻」的,不存在突然的体验跳变。
结合B.10(涌现)的阈值效应:虽然 \(\mathcal{E}\) 在整体上连续,但它可能在涌现阈值 \(C^*\) 附近极其陡峭,从「几乎没有体验」到「丰富的体验」的跃迁可以在非常窄的参数区间内发生。这是连续但急剧的变化,数学上的准相变。
B.1.8 · 善苦差异(D11)的度量结构式 (eq:difference-formal)–(eq:suffering-difference)
定义 B.1.12(差异) 设 \(m_1, m_2 \in \mathcal{U}\),它们之间的差异可以用体验域(B.8中定义的 \(\mathcal{R}(m)\))来度量:
\[\begin{equation} \label{eq:difference-formal} \Delta(m_1, m_2) = d_H\big(\mathcal{R}(m_1),\; \mathcal{R}(m_2)\big) \end{equation}\]
其中 \(d_H\) 是体验空间 \(\mathbb{R}_{\geq 0}^k\) 中集合之间的Hausdorff距离。模型取每个 \(\mathcal{R}(m)\) 为非空紧集;连续轨迹 \(t \mapsto \mathcal{E}(m, t)\) 在有界闭时间区间上走过的集合就是如此。在非空紧集上 \(d_H\) 是度量;对任意集合,它可以取无穷,也可以在两个不同的集合之间为零。
定义 B.1.13(善的差异) 设 \(\mu_E\) 是体验空间上的覆盖测度。差异 \(\Delta(m_1, m_2)\) 是善的差异(D11),如果它扩展了总体验域的测度覆盖:
\[\begin{equation} \label{eq:generative-difference} \text{善的差异:} \quad \mu_E\big(\mathcal{R}(m_1) \cup \mathcal{R}(m_2)\big) \;>\; \max\big(\mu_E(\mathcal{R}(m_1)), \mu_E(\mathcal{R}(m_2))\big) \end{equation}\]
即两种不同的存在方式合在一起,能够覆盖体验空间中更多的区域。当 \(\mu_E\) 有限时,由 \(\mu_E(\mathcal{R}(m_1) \cup \mathcal{R}(m_2)) = \mu_E(\mathcal{R}(m_1)) + \mu_E(\mathcal{R}(m_2) \setminus \mathcal{R}(m_1))\),此条件恰好在每个体验域都有一块正测度的部分落在对方之外时成立:每种存在方式都触及对方触及不到的体验。这个判准只看两个体验域本身,用不到 \(\Delta\) 的大小。多样性增加了体验的总丰富度。
定义 B.1.14(苦难的差异) 差异 \(\Delta(m_1, m_2)\) 是苦难的差异,如果它源于不公正或不幸所造成的不对称(D11按来源界定);它的典型效果是收缩体验域:
\[\begin{equation} \label{eq:suffering-difference} \text{苦难的差异:} \quad \exists\, m_i: \; \mathcal{R}(m_i) \text{ 因不公正或不幸而被收缩} \end{equation}\]
极端贫困收缩了体验域(饥饿使你只能关注生存),系统性歧视收缩了体验域(被排斥使你只能关注抗争),疾病收缩了体验域。善的差异以拓展 \(\mathcal{R}\) 为标志;苦难的差异以其来源为标志,常见的效果是收缩 \(\mathcal{R}\)。两类可以重叠。
B.1.9 · 相依(D12)的形式化式 (eq:interdependence-condition)–(eq:interdependence-nonisolation)
定义 B.1.15(条件函数) 设 \(A' = \{a_1, \ldots, a_n\} \subseteq A\) 为共存有限能动者的集合(\(|A'| \geq 2\)),每个 \(a_i\) 的展开轨迹记为 \(u(a_i) \in \mathcal{T}_{a_i}\),\(\mathcal{T}_{a_i}\) 是 \(a_i\) 可走的轨迹集合。定义条件函数 \(\Gamma\):它以一个能动者连同其他所有能动者的轨迹为输入,给出该能动者可达的展开条件集(注意力通道、资源、信息环境)。相依性(D12)中的「依于」由它表达:
\[\begin{equation} \label{eq:interdependence-condition} \mathcal{C}(a_i) \;=\; \Gamma\!\bigl(a_i,\;\mathbf{u}_{-i}\bigr), \qquad \mathbf{u}_{-i} = \bigl(u(a_j)\bigr)_{j \neq i} \end{equation}\]
即每个能动者的条件集不仅取决于自身,还取决于所有其他能动者的展开轨迹。条件函数 \(\Gamma\) 只编码D12所说的「依于」:一个能动者的条件集可以随他人的轨迹而变。每个能动者确实依于某个他人,是下面这条假设,即正文D12附释所立的非孤立性前提。
假设 B.1.16(非孤立性) 假设这种依赖不是退化的:对每个能动者,至少存在某个其他能动者,其展开的改变会实际改变前者的条件集:
\[\begin{equation} \label{eq:interdependence-nonisolation} \forall\, a_i \in A',\;\; \exists\, a_j \in A' \setminus \{a_i\}: \quad \mathcal{C}(a_i \mid \mathbf{u}_{-i}) \neq \mathcal{C}(a_i \mid \mathbf{u}'_{-i}) \end{equation}\]
对某些仅在 \(u(a_j)\) 上不同的 \(\mathbf{u}_{-i} \neq \mathbf{u}'_{-i}\) 成立。
此公式定义的是 \(|A'| \geq 2\) 的社会情境。当 \(|A'| = 1\) 时,存在量词没有见证者,因此此公式下的非孤立条件并不成立。星期五出现之前的鲁宾逊是社会模型之外的边界情形,并非T5的反例:他的表面独立仍依赖他从社会世界带来的社会性资源(语言、概念、文化记忆)。
不对称性与权力。 影响一般是不对称的:\(a_j\) 对 \(\mathcal{C}(a_i)\) 的影响力与 \(a_i\) 对 \(\mathcal{C}(a_j)\) 的影响力无需相等。这种不对称就是权力(P13)的形式化根源:能力差异在相依结构中转化为影响力差异。
B.1.10 · 自指闭合:B.1 应用于自身式 (eq:T3-self-application)
本节最后,把B.1的数学框架应用于它自身。
B.1 是一个数学理论,一个形式系统。根据T3(自指定理),作非形式的理解(下式两侧不是同一类集合):
\[\begin{equation} \label{eq:T3-self-application} \text{B.1 所能描述的} \subsetneq \text{实在} \end{equation}\]
B.1的所有方程(从式 (eq:dao-structure)到式 (eq:interdependence-nonisolation))都是理的陈述,写在以 \(\mathcal{F}\) 为对象的语言之中。它们无法触及玄。
具体而言:
式 (eq:dao-structure)定义了实在的可理解骨架,但实在不只是骨架
式 (eq:xuan-formal)指出了玄的存在,但指出玄不等于触及玄
式 (eq:experience-irreducibility)表达的是体验不可计算这一框架承诺,但这个表达本身是理的操作,它描述的只是理的边界
一个能够精确标定自身边界的理论,比一个假装没有边界的理论更诚实。B.1的方程组是理能达到的最远处,它画出了一条线,说:「从这里开始,请倾听沉默。」
那条线的另一边,是渊者守护的深度。
解读
用日常的话说。 本节把明度(对实在两个面向同时醒着的程度)定义为两份觉知相乘:理解度,即对讲得清的规律掌握多少;玄觉度,即对任何讲法都收拢不了的那部分保持多少敞开。拿一位养育孩子的父亲来说。他读过的育儿知识是理解度;他是否承认孩子心里的感受总超出书上的描述,是玄觉度。书读得再多,若他认定孩子已被书解释完,乘积仍接近零;若他只感叹孩子神秘而什么都不肯学,乘积同样接近零。投入的总量相同时,两份持平,明度最高。任何有限的人,明度都落在全无与完满之间,两端都到不了。
启示
两个人同样不明,病因可以正好相反,治法也就相反。 一个人拒绝推理和证据,另一个人认定凡讲不清的都不存在;在这个模型里,前者缺的是理解度,后者缺的是玄觉度,两人的明度都接近零。所以面对一个看来闭塞的人,先分辨他缺的是哪一侧,再决定给他什么;给后者讲再多的道理,补的也是他本来就有的那一侧。这是在明度取两份觉知相乘的前提下。
两种不同的活法放在一起,只有各自都触及对方触及不到的体验,合起来的体验范围才会变大。 一个在海边长大、一个在山里长大的两个朋友,各有对方没经历过的东西,两人的体验范围合起来,就大过其中任何一人;若一人的经历整个落在另一人的经历之内,这份差异就扩展不了什么。这是在用体验所覆盖的范围来衡量差异的前提下。差异若源自不公或不幸,使一方的体验被收缩,模型另把它算作苦难的差异,两类可以同时成立。
学得更多,只能缩小两道缺口中的一道。 式 (eq:cognitive-finitude) 把能动者的缺口分成两层:\(\mathcal{F} \setminus \mathcal{F}_a\) 是理之内尚未掌握的部分,\(\mathcal{P}(\Omega) \setminus \mathcal{F}\) 是玄。学习扩大的是 \(\mathcal{F}_a\),而 \(\mathcal{F}_a\) 无论扩大多少都留在 \(\mathcal{F}\) 之内,所以 \(\lambda\) 随之上升,第二道缺口保持原样。对第二道缺口,能动者能改变的只有自己在边界处的姿态,也就是 \(\xi\)。
在乘积模型里,长处每多一单位,明度所增的量恰好等于短处的现有深度。 由式 (eq:lucidity-biaspect),\(\partial\mathcal{M}/\partial\lambda = \xi\),\(\partial\mathcal{M}/\partial\xi = \lambda\)。一位玄觉度接近零的专家,知识再增加,明度的增量也接近零;一位理解度接近零的神秘主义者,敬畏再加深,结果相同。这个精确的等式来自线性互惠这条被采纳的约定(命题 B.12.5);只要求边际回报随另一维度递增的较弱条件,给出同一方向,给不出这个数值。
未觉知的多少,与对玄敞开的程度,在模型里是两个分开的量。 归一化 \(\lambda + \xi + \delta = 1\) 允许一个能动者的未觉知区 \(\delta\) 很大,同时玄觉度 \(\xi\) 接近零:他不知道的很多,也不朝边界敞开。所以承认「我所知有限」,说的是 \(\delta\),本身不提高 \(\xi\)。按B.1.4的读法,\(\xi\) 要从作为中看:他拒绝宣称什么,他仍能为什么动容。
若把「可理解」读作「可由有限手段描述」,能说清的集合在基数上就始终少于说不清的。 这是命题 B.1.5:在它的两个条件下,\(|\mathcal{F}| \leq \mathfrak{c} < 2^{\mathfrak{c}} \leq |\mathcal{P}(\Omega) \setminus \mathcal{F}|\)。任何新的描述手段,只要生成它的仍是可数多个有限描述,都改不了这个次序,所以理的推进在基数上追不上玄。两个条件都是模型前提,取 Lebesgue 型的完备化时结论不成立;这一比较也只关乎基数,不给出理与玄的数值比例。
第二部分 · 属于理的数学
理展开为四种基本模式:耗散、梯度、选择、反馈。本部分为每种模式提供数学形式化,并建立遮蔽的信息论模型。理的数学不仅描述世界如何运作,也描述清醒如何被阻碍。
各节层层递进:耗散(B.2)侵蚀梯度(B.3);选择(B.4)收窄可能性,反馈(B.5)把选择锁定,两者合起来,在B.6成为可以度量的遮蔽。
B.2 · 熵与耗散的形式化
问题:耗散为何是有限存在的物理底色?
所需:概率分布;对数。
所得:香农熵与玻尔兹曼熵的定义、热力学第二定律,以及有限性(公设四)的热力学读法。
设定
定义 B.2.1(信息熵,Shannon 1948) 对于离散随机变量 \(X\),具有可能取值 \(\{x_1, x_2, \ldots, x_n\}\),概率质量函数为 \(P(x_i)\),其信息熵定义为:
\[\begin{equation} \label{eq:shannon-entropy} H(X) = -\sum_{i=1}^{n} P(x_i) \log_2 P(x_i) \end{equation}\]
约定 \(0 \log_2 0 = 0\)。
关键性质:
\(H(X) = 0\) 当且仅当存在某个 \(x_k\) 使得 \(P(x_k) = 1\)(完全确定,零不确定性)
\(H(X) = \log_2 n\) 当且仅当 \(P(x_i) = \frac{1}{n}\) 对所有 \(i\) 成立(最大不确定性,均匀分布)
\(0 \leq H(X) \leq \log_2 n\)(熵有界)
定义 B.2.2(热力学熵,Boltzmann 1877) \[\begin{equation} \label{eq:boltzmann-entropy} S = k_B \ln W \end{equation}\]
其中 \(k_B \approx 1.38 \times 10^{-23}\) J/K 是玻尔兹曼常数,\(W\) 是系统在给定宏观状态下可达的微观状态数(微观构型数;记号取 \(W\) 以免与样本空间 \(\Omega\) 冲突)。
热力学第二定律: 孤立系统的总熵不减。
\[\begin{equation} \label{eq:second-law} \Delta S_{\text{total}} \geq 0 \end{equation}\]
结论与证明
对于生命体,维持有序结构意味着持续地将局部熵降低,但这必须以增加环境熵为代价。把生命体与环境合起来看作一个孤立系统,于是 \(\Delta S_{\text{total}} = \Delta S_{\text{生命体}} + \Delta S_{\text{环境}}\),第二定律给出:
\[\begin{equation} \label{eq:life-entropy} \Delta S_{\text{生命体}} < 0 \quad \text{且} \quad \Delta S_{\text{total}} \geq 0 \quad \Rightarrow \quad \Delta S_{\text{环境}} \geq |\Delta S_{\text{生命体}}| \end{equation}\]
真实的代谢过程不可逆,所以实际上 \(\Delta S_{\text{total}} > 0\),且 \(\Delta S_{\text{环境}} > |\Delta S_{\text{生命体}}|\):环境付出的多于生命体得到的。
算例
为什么有序状态如此稀少?考虑一副52张的扑克牌:
按花色和点数完美排列的方式:\(4! = 24\) 种
总排列方式:\(52! \approx 8.07 \times 10^{67}\) 种
有序排列占比:\(\frac{24}{52!} \approx 2.98 \times 10^{-67}\)
这就是耗散的数学根源:有序在可能性空间中被天文数字级地稀释了。
解读
用日常的话说。 有秩序的东西要保住秩序,得不停花力气,而花力气时排到外面的混乱,总多于它自己保住的秩序。拿收拾书架来说。书按类排好只有很少几种排法,乱放的排法多得数不过来,所以只要没人管,日常的取放就把书架带向乱的一边。你每天把书归位,就是在持续输入能量;你为此吃下的食物、身体散出的热,就是外界替这份整齐付出的更多的混乱。归位一停,书架就回到乱;你能投入的力气又有限。生命也是这样一个要靠持续投入才保得住的秩序,这就是有限的存在终有尽头的物理底子。
薛定谔称生命为「负熵的进食者」:生命通过从环境中汲取有序能量来维持自身的低熵状态。
有限性(公设四)的数学根基。 你的身体是一个远离热力学平衡的耗散结构。维持它需要持续的能量输入(食物、呼吸、体温调节)。当能量输入停止,你死了。你的死亡并非意外,并非惩罚:第二定律规定了维持有序必须持续付出代价,而有限的身体取用的是有限的供给(公设四),支付能力终有尽头。有限性是存在的物理基础。
格的第一航法(耗散之航)的精确含义。 格看见的「一切结构都在缓慢瓦解」在数学上意味着:任何有序结构(\(W_{\text{small}}\))如果不持续输入能量,都会被压倒性数量的无序状态(\(W_{\text{large}}\))所稀释。你的每一次呼吸,都是在用能量购买片刻的有序,片刻的活着。
启示
一处的秩序变多了,就去找它把混乱排到了哪里。 冰箱里面越来越冷,厨房的空气却被它排出的热烘暖了。在这个模型里,局部秩序的增加不违反总规律,它的代价落在周围环境身上,而且比局部所得更多。这是在把这一处连同与它交换能量的一切周围都算进来的前提下,冰箱的例子里也包括为它供电的发电厂。
秩序只能按持续的流量付费,没有一次付清的办法。 身体靠每天的饮食、呼吸和体温调节维持,哪一天的大量投入都替代不了此后各天的投入;输入一停,身体就开始向数量多得多的无序状态滑去。这是对远离平衡、靠持续输入才能维持的结构而言,身体就是这样的结构。
维持一个有序结构要持续付出代价,环境多付的那一部分无法退回。 把生命体与环境合看作一个孤立系统,式 (eq:life-entropy) 给出 \(\Delta S_{\text{环境}} \geq |\Delta S_{\text{生命体}}|\),真实代谢不可逆,不等号严格成立。孤立系统的总熵不减(式 (eq:second-law)),所以这份差额一旦产生,就没有办法在系统之内收回。身体的每一刻秩序都有运行成本,这个成本没有降到零的一天。
结构的瓦解用不着专门的破坏者:无序的微观状态在数量上压倒有序的,这一计数就足以解释瓦解。 52 张牌按花色与点数排好的方式只有 \(24\) 种,一次随机洗牌恰好落进其中之一的概率约为 \(2.98 \times 10^{-67}\)。由式 (eq:boltzmann-entropy),一个宏观状态包含的微观状态数 \(W\) 越大,它的熵越高,随机扰动把系统带进它的机会也越大。所以面对一个正在瓦解的结构,先要问的是此前谁在持续输入能量维持它:这份输入一旦停止,单凭计数,结构就会走向无序。
第二定律定下维持秩序的价格,公设四定下供给的上限,两者合起来,才使有限的存在终有尽头。 节末「适用范围与限制」指出,单凭第二定律,一个有不竭外部供给的开放系统可以一直维持下去。由此还推得一个日常的后果:每一种被维持的结构都有正的运行成本,而供给有限,所以多维持一种结构,留给其他结构的供给就少一份。决定维持什么,就是在分配一笔有尽头的预算。
适用范围与限制
起作用的是供给的有限。 上文说有限的身体终有付不起代价的一天。单凭第二定律还定不了这一点:一个开放系统若有永不枯竭的外部供给,是可以一直维持下去的;起作用的是供给的有限(公设四)。
B.3 · 梯度的形式化
问题:差异如何驱动运动,利用差异又为何会耗尽差异?
所需:偏导数;B.2的熵。
所得:梯度与KL散度的定义,以及命题 B.3.3:在马尔可夫过程下,梯度自行消耗。
设定
定义 B.3.1(梯度) 对于可微标量场 \(\phi(\mathbf{x})\),其梯度为:
\[\begin{equation} \label{eq:gradient} \nabla\phi = \left(\frac{\partial \phi}{\partial x_1}, \frac{\partial \phi}{\partial x_2}, \ldots, \frac{\partial \phi}{\partial x_n}\right) \end{equation}\]
梯度指向函数增长最快的方向,其模 \(|\nabla\phi|\) 度量增长的速率。\(\nabla\phi = 0\) 若只在一点成立,该点是驻点;若在一个连通区域上处处成立,则 \(\phi\) 在那里是常数:没有差异,没有驱动力,没有运动。
定义 B.3.2(KL 散度) 给定概率分布 \(P\) 和参考分布(通常为均匀分布)\(Q\)(记号取 \(Q\) 以免与展开算子 \(U\) 冲突),Kullback-Leibler 散度度量 \(P\) 偏离 \(Q\) 的程度:
\[\begin{equation} \label{eq:kl-divergence} D_{\text{KL}}(P \,\|\, Q) = \sum_{i=1}^{n} P(x_i) \log_2 \frac{P(x_i)}{Q(x_i)} \end{equation}\]
假定凡 \(P(x_i) > 0\) 处皆有 \(Q(x_i) > 0\)(否则散度为无穷),并约定 \(0 \log_2 0 = 0\)。
关键性质:
\(D_{\text{KL}}(P \,\|\, Q) \geq 0\)(Gibbs不等式)
\(D_{\text{KL}}(P \,\|\, Q) = 0\) 当且仅当 \(P = Q\)(\(Q\) 为均匀分布时,即分布完全均匀,无「信息梯度」)
\(D_{\text{KL}}\) 一般不对称:\(D_{\text{KL}}(P \,\|\, Q)\) 与 \(D_{\text{KL}}(Q \,\|\, P)\) 通常不等,个别的分布对可以相等(梯度有方向)
结论与证明
命题 B.3.3(梯度自我消耗) 设 \(P_t\) 按一个以 \(Q\) 为不变分布的马尔可夫过程演化(马尔可夫链,或有界区域上的扩散与热传导);有限空间上 \(Q\) 为均匀分布时,这等于说转移矩阵是双随机的。于是:
\[\begin{equation} \label{eq:gradient-dissipation} \frac{dD_{\text{KL}}(P_t \,\|\, Q)}{dt} \leq 0 \end{equation}\]
这是马尔可夫过程的 H 定理,由相对熵的数据处理不等式推出。在这些条件下(扩散与热传导满足它们),系统自发地减少自身与均匀分布的 \(D_{\text{KL}}\),即自发地消灭自身的梯度。条件一旦不满足,不等式就可能失效:B.4的选择动力学把分布推离均匀,\(D_{\text{KL}}\) 随之上升。成功的利用就是自身消亡的开始。
解读
用日常的话说。 差异推动运动,而这运动又把推动它的差异抹平。一杯热茶放在凉房间里:茶和空气的温差是差异,热从茶流进空气是这份差异推动的运动。热每流出一点,温差就缩小一点;等茶凉到和房间一样,温差归零,热流也就停了。没有人动它,温差也自己消失。本节证明,像热传导、扩散这样把东西越混越匀的过程,都在这样消耗自己赖以运转的差异。要让差异留下来,就得有另一种过程不断把它重新拉开。
梯度是差异的度量。温度梯度驱动热传导,浓度梯度驱动扩散,价格梯度驱动贸易,好奇心(知识梯度)驱动探索。在信息论中,取 \(Q\) 为均匀分布时,\(D_{\text{KL}} > 0\) 意味着分布不均匀:「这里」和「那里」不一样,所以有「运动」的驱动力。
文明动力学的数学骨架。 文明崛起于对能量梯度(化石燃料、太阳能)和信息梯度(未知的疆域、未解的问题)的利用。但每一次利用都在减少驱动力。化石燃料被燃烧(梯度减少),市场趋向均衡(价格梯度减少),知识边疆被推进(未知减少)。持续的文明需要持续地发现新的梯度:或者学会在更低的梯度中生活。
格的第二航法(梯度之航)的精确含义。 格沿着 \(D_{\text{KL}} > 0\) 的方向航行。当他到达目的地(\(D_{\text{KL}}\) 局部趋零)时,他必须寻找新的不均匀性。理解本身就是一种梯度利用:你越理解一个领域,该领域的「未知梯度」越小,你的好奇心驱动力越弱。
启示
一个靠差异推动的过程慢了下来,先看推动它的差异还剩多少。 学一门新技能,起初进步飞快,几个月后越来越慢;按本节的解读,已知与未知之间的差距本身在缩小,好奇心的推动力也就随之变弱。这是在推动力只来自这一份差异、又没有别的过程补充差异的前提下;一旦打开了一片新的未知,就要重新判断。
对一份差异利用得越成功,剩下可利用的就越少。 两地价格不同,有人低买高卖赚取差价;做的人越多,两地价格越接近,差价越薄,直到无利可图。本节把这概括为「成功的利用就是自身消亡的开始」。这是在利用本身就是把两边拉平的那类过程、又没有别的力量重新拉开差距的前提下。
差异交给混合过程,会自行消退;要保住或造出差异,需要一个把分布推离均匀的过程。 命题 B.3.3说,在以 \(Q\) 为不变分布的马尔可夫过程下(扩散与热传导满足这一条件),\(D_{\text{KL}}(P_t \,\|\, Q)\) 不增。同节又指出,条件不满足时不等式可以失效,B.4的选择就把 \(D_{\text{KL}}\) 推高。所以一种差异能存续多久,要看作用在它上面的是哪一类过程:只有混合时它衰减;要维持或扩大,须有选择(B.4)或持续的外部能量输入(B.2)这类把分布推离均匀的过程介入。
在均匀参考分布下,梯度的消耗与信息熵的增加是同一个量的两种读法。 \(Q\) 为 \(n\) 个取值上的均匀分布时,把 \(Q(x_i) = 1/n\) 代入式 (eq:kl-divergence),再对照式 (eq:shannon-entropy),得 \(D_{\text{KL}}(P \,\|\, Q) = \log_2 n - H(P)\)。于是式 (eq:gradient-dissipation) 所说 \(D_{\text{KL}}\) 不增,等价于 \(H(P_t)\) 不减。格者的第一航法(耗散)与第二航法(梯度)在这一情形下追踪的是同一个函数 \(H(P_t)\):前者看秩序在流失,后者看驱动力在减弱。
对靠差异运转的系统,差异全部消除之时,就是它停下之时。 定义 B.3.1之后指出,\(\nabla\phi\) 在一个连通区域上处处为零,\(\phi\) 在那里就是常数;在信息的读法里,\(D_{\text{KL}}(P \,\|\, Q) = 0\) 当且仅当 \(P = Q\)。两处给出同一个结论:驱动力由差异度量,差异归零,驱动力随之归零。所以对热机、贸易、探索这类以差异为动力的过程,「消除全部差异」与「保持运动」不能同时作为目标,可以选择的是在多大的差异上运行。
B.4 · 选择与贝叶斯更新
问题:选择如何收窄可能性,信念又如何被锁定?
所需:条件概率。
所得:贝叶斯定理、选择的复制子模型及其收敛定理(定理 B.4.3),以及遮蔽的贝叶斯模型。
设定
定理 B.4.1(贝叶斯定理,Bayes 1763) \[\begin{equation} \label{eq:bayes} P(H \mid E) = \frac{P(E \mid H) \cdot P(H)}{P(E)} \end{equation}\]
其中:
\(P(H)\):先验概率,即在看到证据之前对假设的信念强度
\(P(E \mid H)\):似然度,即如果假设为真,观察到此证据的概率
\(P(E)\):证据的边际概率(归一化常数)
\(P(H \mid E)\):后验概率,即看到证据之后对假设的更新信念
定理要求 \(P(E) > 0\),由条件概率的定义两行即可推出。本节中不带自变量的 \(H\) 指一个假设;作用于随机变量或分布的 \(H(\cdot)\) 仍是B.2的Shannon熵。
定义 B.4.2(选择作为迭代贝叶斯更新) 设种群中特征 \(x\) 的初始分布为 \(P_0(x)\),适应度函数(选择压力)为 \(s(x) \geq 0\)。这里做四项建模选择:适应度只取决于特征本身,与该特征的多寡无关;逐轮不变;特征无突变地遗传;无性繁殖。这是离散时间的复制子模型;分布 \(P_n\) 写作特征上的密度(上面贝叶斯定理中的 \(P(\cdot)\) 是事件的概率),特征空间有限时积分换成求和。经过一轮选择:
\[\begin{equation} \label{eq:selection-one} P_1(x) = \frac{P_0(x) \cdot s(x)}{Z_1}, \quad Z_1 = \int P_0(x) \cdot s(x) \, dx > 0 \end{equation}\]
同一步骤施行 \(n\) 次(对 \(n\) 归纳,\(s\) 每轮不变):
\[\begin{equation} \label{eq:selection-n} P_n(x) = \frac{P_0(x) \cdot [s(x)]^n}{Z_n}, \quad Z_n = \int P_0(x) \cdot [s(x)]^n \, dx > 0 \end{equation}\]
遮蔽(D6)的贝叶斯模型:
在正常的认知过程中,新证据 \(E\) 应该更新你的信念:\(P(H \mid E) \neq P(H)\)。但当正反馈回路锁定了先验时:
\[\begin{equation} \label{eq:obscuration-bayes} P(H \mid E) \approx P(H) \quad \text{(遮蔽态:证据不再更新信念)} \end{equation}\]
遮蔽态指此式对每个 \(E\) 都成立,有鉴别力的证据也包括在内;证据本身无信息时,\(P(H \mid E) = P(H)\) 只是正确的答案。它的极限情形是教条先验 \(P(H) \in \{0, 1\}\):任何 \(P(E) > 0\) 的证据都动不了它。
结论与证明
定理 B.4.3(收敛定理) 设下列两种情形之一成立:(a)特征空间有限,\(P_0(x^*) > 0\),且对每个 \(x \neq x^*\) 有 \(s(x) < s(x^*)\);(b)特征空间是紧集,\(s\) 连续且只在 \(x^*\) 处取最大值,\(P_0\) 给 \(x^*\) 的每个邻域以正质量。则当 \(n \to \infty\),\(P_n\) 弱收敛到最优解上的点质量 \(\varepsilon_{x^*}\):对每个 \(r > 0\),\(P_n\) 落在距 \(x^*\) 超过 \(r\) 之处的质量趋于 \(0\)。
(点质量记作 \(\varepsilon_{x^*}\),因为 \(\delta\) 已留给未觉知区。)
证明。 两种情形下,\(Z_n > 0\) 都迫使 \(s(x^*) > 0\)。固定 \(r > 0\),令 \(m_r\) 为 \(s\) 在距 \(x^*\) 至少为 \(r\) 的点上的上确界;情形(a)由有限性,情形(b)由紧性、连续性与最大值点的唯一性,得 \(m_r < s(x^*)\)。取 \(\rho = \tfrac{1}{2}(m_r + s(x^*))\),\(N = \{x : s(x) > \rho\}\) 是 \(x^*\) 的一个邻域,\(P_0(N) > 0\)。于是 \(Z_n \geq \rho^n P_0(N)\),而距离超过 \(r\) 处的质量至多为 \(m_r^n / Z_n \leq (m_r / \rho)^n / P_0(N) \to 0\)。\(\square\)
缺了这些前提,结论可能失效:在密度情形下,落在单个零质量点上的最大值什么也改变不了;在无界空间上,质量可以逃逸到无穷远。
先验走到这一步,在数学上有两种机制:
确认偏见: 只放进与先验一致的证据。这样筛过的证据在 \(H\) 与 \(\neg H\) 之下出现的概率相差无几,\(P(E \mid H) \approx P(E \mid \neg H)\),已失去鉴别力:一个把筛选考虑在内的主体会让后验保持不变。有偏见的主体却把筛过的证据流当作仍有鉴别力,不断抬高 \(P(H)\)。
信息茧房: 环境只提供与先验一致的证据(推荐算法使你看到的 \(E\) 都支持 \(H\),即 \(P(E \mid H) > P(E \mid \neg H)\))。每一条这样的 \(E\) 都抬高后验;若似然比始终有大于 \(1\) 的下界,反复更新就把后验推向 \(1\)。
两种机制起初都在推动后验,把它推向确定。到了 \(P(H) = 1\) 附近,新证据几乎动不了它,后验实际上已「冻结」,学习停止。
解读
用日常的话说。 信念应当随证据移动;可当送到眼前的证据全都偏向一边,信念会被一路推到近乎确定,到那时,再来什么证据都几乎推不动它。拿手机上的信息流来说。你起初对某件事有个看法,这是出发点;推荐算法只推给你支持这个看法的文章,每读一篇,你的把握就涨一点。一轮轮下去,把握逼近十足,反方的材料来了也几乎改不动它,学习实际停了下来。本节把这种证据不再改动信念的状态叫作遮蔽(看不清实在的状态)。自然选择是同一种收窄:评判标准不变时,每一轮都偏向得分最高的选项,其余选项最后所剩无几。
进化是自然界的贝叶斯更新:每一代都是一次「证据更新」,环境是「似然函数」。AI训练(随机梯度下降)与此是类比,谈不上严格同构:随机梯度下降在参数向量上做加法步进,选择则对分布做乘法重赋权。两者相通的是方向:损失函数扮演的是反号的适应度,参数更新相当于高速的选择。
F1(理之信)的数学含义。 贝叶斯定理本身由条件概率的定义即可证明。贝叶斯式的跨时学习,即反复运用这条定理去认识世界,其根基是一个不可证明的假设:宇宙的似然函数 \(P(E \mid H)\) 是稳定的,同样的假设在同样的条件下会产生同样(概率分布的)结果。这就是理之信,即相信宇宙是可理解的。如果似然函数是不稳定的(今天 \(P(E \mid H) = 0.9\),明天毫无理由地变成 \(0.1\)),贝叶斯更新就崩溃了,学习就不可能,理解就不存在。
选择的代价。 在收敛定理的前提下,\(P_n \to \varepsilon_{x^*}\):在极限中,选择消灭多样性,可能性空间收缩。逐轮看,分布未必变窄(一个稀有的高适应度特征开始扩散时,熵与方差可以暂时上升);逐轮不减的是平均适应度,由Cauchy-Schwarz不等式,\(\mathbb{E}_{P_{n+1}}[s] = \mathbb{E}_{P_n}[s^2] / \mathbb{E}_{P_n}[s] \geq \mathbb{E}_{P_n}[s]\)。这是效率与韧性的根本张力:高度选择的系统效率极高(分布极窄,资源集中在最优解),但韧性极低(环境一旦变化,最优解不再是最优,而分布中已经没有其他选项)。遮蔽(D6)是认知领域的过度选择,信念分布收窄到只剩一个假设。
启示
凭经验学习,就是押注世界明天仍照今天的规律回应你。 一位销售员靠过去十年的经验判断客户,前提是客户在同样情形下的反应方式没有变;市场一旦换了规则,旧经验就可能把他引向错误的判断。本节指出,跨时间的学习建立在一个无法证明的前提上,即同一个假说在同样的条件下给出同样的结果分布,本书称之为理之信。这个前提失效时,按经验更新信念的整套办法就失去了依据。
把握有多高,说明不了看法对不对;要看这份把握是从什么样的证据流里攒起来的。 两个人对同一件事都有十足的把握,一个是看遍了正反两面的材料得出的,一个是信息流只给他推一面的文章攒出来的;单看把握,两人分不出高下。在这个模型的信息茧房机制里,只要送来的每一条证据都以不低于某个固定的幅度支持同一个看法,把握就会被推向十足,不管这个看法本身对不对。所以检验一份很高的把握,要问的是这些证据是怎样来到面前的。
把一个信念定在完全确定,就预先拒绝了一切证据。 由式 (eq:bayes),\(P(H) = 1\) 时 \(P(E) = P(E \mid H)\),任何 \(P(E) > 0\) 的证据都给出 \(P(H \mid E) = 1\);\(P(H) = 0\) 时后验同样恒为 \(0\)。这是遮蔽态(式 (eq:obscuration-bayes))的极限情形。给反面留下一份正的概率,是一条信念还能被有鉴别力的证据改动的前提。
证据是怎样来到你面前的,决定它能证明多少。 按确认偏见的机制,只按是否符合先验筛进来的证据满足 \(P(E \mid H) \approx P(E \mid \neg H)\),鉴别力接近零,把筛选考虑在内的主体不会因此改动后验。贝叶斯定理里决定后验移动多少的是似然比 \(P(E \mid H)/P(E \mid \neg H)\);似然比等于 \(1\) 的证据,条数再多也不移动后验。所以一大堆同向的证据可以几乎不含信息,评估它之前,先问它是怎样被挑出来的。
在这个模型里,平均表现逐轮上升,与其他选项逐渐消失,可以同时发生。 由 Cauchy-Schwarz 不等式,平均适应度每一轮都不下降;在定理 B.4.3的前提下,距最优解 \(x^*\) 超过任一 \(r\) 之处的质量趋于 \(0\)。单看平均适应度,分辨不出分布是否在收窄。模型假定 \(s\) 逐轮不变,不描述环境改变之后的事;它给出的是:到那时,其他选项上剩下的质量已趋近于零。按本节把遮蔽(D6)读作认知上的过度选择的类比,一个信念体系可以每一轮都更自洽,同时越来越难被证据改动。
B.5 · 反馈动力学
问题:为什么遮蔽会自我加速,清醒却要主动注入?
所需:数列与不动点;B.4的遮蔽模型。
所得:线性反馈的稳定性分类、logistic 映射,以及把清醒作为负反馈注入之后,偏见反馈的稳定条件。
设定
定义 B.5.1(线性一阶反馈系统) \[\begin{equation} \label{eq:linear-feedback} x_{t+1} = \alpha \cdot x_t + u_t \end{equation}\]
其中 \(x_t\) 是状态,\(\alpha\) 是反馈系数,\(u_t\) 是外部输入。
定义 B.5.2(Logistic 映射) \[\begin{equation} \label{eq:logistic-map} x_{t+1} = r \cdot x_t(1 - x_t), \quad x \in [0, 1], \quad r \in [0, 4] \end{equation}\]
定义 B.5.3(遮蔽的反馈回路模型) \[\begin{equation} \label{eq:bias-feedback} b_{t+1} = \alpha \cdot b_t + \beta \cdot R(b_t) \end{equation}\]
其中 \(b_t\) 是偏见强度,\(R(b_t)\) 是推荐算法的输出(它是偏见的函数,你越偏,它推给你越偏的内容),\(\alpha\) 是信念的自然持续强度,\(\beta\) 是算法影响力。(此处的 \(\beta\) 只在B.5内使用;B.15的耦合强度 \(\beta_{ij}\) 是另一个量。)
定义 B.5.4(清醒作为负反馈注入) \[\begin{equation} \label{eq:lucidity-feedback} b_{t+1} = \alpha \cdot b_t + \beta \cdot R(b_t) - \gamma \cdot C(b_t) \end{equation}\]
其中 \(C(b_t)\) 是批判性思维的校正项,\(\gamma\) 是你投入批判性思维的努力。
结论与证明
稳定性分析(输入为常数 \(u_t \equiv u\) 且 \(\alpha \neq 1\) 时,不动点为 \(x^* = \frac{u}{1-\alpha}\),且精确地有 \(x_t - x^* = \alpha^t (x_0 - x^*)\)):
\(|\alpha| < 1\):衰减态(\(0<\alpha<1\) 是逐步衰减的正反馈,\(\alpha<0\) 才是负反馈)。系统趋向稳定点 \(x^*\)。偏差被指数衰减:\(|x_t - x^*| = |\alpha|^t |x_0 - x^*|\)
\(|\alpha| > 1\):发散态(\(\alpha>1\) 是正反馈主导的单调放大,\(\alpha<-1\) 是振荡发散)。不动点 \(x^*\) 仍在,但不稳定:偏差被指数放大,\(|x_t - x^*| = |\alpha|^t |x_0 - x^*|\),系统从任何 \(x_0 \neq x^*\) 出发都发散
\(|\alpha| = 1\):临界态。同一输入下两条轨迹之间的偏差保持大小,既不衰减也不放大。\(\alpha = 1\) 且 \(u \neq 0\) 时没有不动点,状态线性漂移,\(x_t = x_0 + tu\);\(\alpha = -1\) 时围绕 \(u/2\) 作周期为 2 的振荡。只有在 \(\alpha = 1\) 上再加零均值的随机输入,才成为随机游走,此时离起点的距离按 \(\sqrt{t}\) 增长
输入 \(u_t\) 随时间变化时,一般没有不动点;在 \(|\alpha| < 1\) 下,有界输入仍给出有界状态
随 \(r\) 变化,logistic 映射的行为分为四段:
\(r < 1\):系统衰亡至零
\(1 < r < 3\):稳定不动点
\(3 < r < 3.57\):周期倍增(2-周期、4-周期、8-周期…)
\(r > 3.57\):混沌(其间散布的周期窗口除外),即确定性系统产生不可预测的行为
系统的有效反馈系数为 \(\alpha + \beta \cdot R'(b)\),即映射 \(b \mapsto \alpha b + \beta R(b)\) 在不动点 \(b^*\) 处的导数。其绝对值 > 1 时,\(b^*\) 不稳定;其值 > 1 时,偏离 \(b^*\) 的小偏差起初按指数增长。这是局部的结论:若 \(R\) 会饱和(真实的推荐算法终究如此),偏见会停在一个更高的稳定不动点上,不会无限增长。
明在哲学实践的数学含义(图67):让 \(\gamma \cdot C'(b)\) 落在使总反馈系数严格介于 \(-1\) 与 \(1\) 之间的区间内,即 \(|\alpha + \beta R'(b) - \gamma C'(b)| < 1\),等价于 \(\alpha + \beta R'(b) - 1 < \gamma C'(b) < \alpha + \beta R'(b) + 1\)。校正太少,偏见照旧发散;校正过头,偏见来回摆动,振幅越来越大。
解读
用日常的话说。拿手机上的新闻推送来说。你对某个话题已有一点偏向,这就是本节的偏见;推送程序按你的点击挑内容,它是放大偏见的那一环。在你此刻的位置上,你多偏一分,下一轮这一分经过你自己的惯性和推送的加码,若变成了多于一分,偏见就会越滚越大,这就是遮蔽(看见的实在越来越窄)不用你出力也会自己加速;若变成不到一分,它会慢慢平息。你主动去读对立立场的报道,是从外面往回拉的力。拉得太少,照样下滑;拉得太猛,你会从一个极端摆到另一个极端,越摆越远。本节只算你自己出的力,身边人的影响另作计算。
为什么遮蔽如此容易而清醒如此困难。 正反馈是自强化的,它不需要你做任何事,它会自动加速。负反馈需要主动注入,你必须刻意地寻求不同观点、质疑自己的假设、暴露自己于不舒适的信息。数学告诉你:只要你当前偏见水平上的有效反馈系数大于1,在没有刻意干预的情况下,正反馈就会在那里赢。 而当代信息环境正是把这个系数推高的机器。遮蔽是这种环境下的认知默认态,清醒是需要持续努力的反默认态。
这里的「刻意干预」不限于主体自己那一份。 本节是单主体模型:\(\gamma\) 记的是你自己投入的努力,他人只以恶化项 \(\beta \cdot R(b_t)\) 出场。这是本节的取景,并非本框架的断言。B.15把镜头拉开之后,他人另有一项 \(\beta_{ij}(\mathcal{M}_j - \mathcal{M}_i)\),其方向随明度之差而定:被更清醒的人围着,你受其上拉,且不待你自己先出力。那一项正是§VIII.4所说培育的形式化。故本节刻画的那个默认态,其成立条件是外面没有人注入,与你自己出不出力是两件事。
混沌的哲学意涵。 Logistic Map 在 \(3.57\) 以上的混沌参数(例如 \(r = 4\))处进入混沌,一个完全确定性的系统产生了不可预测的行为。这在数学上证明了:确定性不等于可预测性。 即使你拥有系统的完整方程(理),具体轨迹也对初值极度敏感,实践上无法预测。这种不可预测是认识上的,系统仍完全在理之内;混沌由此给出一个数学模型,显示能动者可达之理的边界如何在理的内部显形。
启示
同样的日常小刺激,落在越放不下的人身上,积起来越高;一点都不肯放下,就再也停不住。 设想同事每天说一句让你不快的话,你每天把前一天的不快留下一部分。在这个模型里,只要每天留下的少于全部,不快会停在一个固定高度上,留得越多,这个高度越高,而且越接近全部留下,高度涨得越快;若前一天的不快原封不动全留下,就没有停的地方,只会每天往上加一截。这是在每天的刺激大小不变、留下的比例也不变的前提下。
屡次预测失败,不能证明背后没有规律:规则完全确定的系统,也可能走得无法预测。 养鱼的人看池塘里每年的鱼数忽多忽少,容易断定这是运气。本节的映射给出反例:增减的规则一字不差地写在那里,只要增长的力度超过某一档,起点上量不出的微小差别就会把后来的轨迹带到完全不同的地方,而系统始终在规律之内。这是在系统落在混沌那一段的前提下,那一段里还夹着可以预测的周期性间隙;力度较弱时,同一条规则给出稳定或按周期往复的行为,可以预测。
判断自己是否在滑向遮蔽,要看回路在你此刻位置上的斜率:偏见每加深一分,信息环境多回馈几分。 稳定判据用的是有效反馈系数 \(\alpha + \beta R'(b)\),其中 \(R'\) 是推荐输出对偏见的导数,取在不动点 \(b^*\) 处。所以在这个模型里,同一个算法、同一个 \(\beta\),对停在不同偏见水平上的两个人,可以一个处于衰减态,一个处于发散态。这个判据是局部的:\(R\) 饱和时偏见停在更高的稳定不动点上,偏见停止增长,不说明它浅。
换一个信息环境与多投入批判的努力,作用在同一个不等式上。 式 (eq:lucidity-feedback) 的稳定条件是 \(|\alpha + \beta R'(b) - \gamma C'(b)| < 1\),所需校正的下限是 \(\alpha + \beta R'(b) - 1\)。压低 \(\beta\) 就压低了这个下限;若 \(\alpha + \beta R'(b)\) 已落在 \(-1\) 与 \(1\) 之间,\(\gamma = 0\) 时不动点也已稳定。在这个单主体模型里,\(\gamma\) 只是可调的三个量之一,选择让自己暴露在什么样的回路里,同样改变结果。
自我校正有上限:用力过猛,偏见会在两个极端之间来回摆动,越摆越远。 稳定条件是一个区间,上界是 \(\gamma C'(b) < \alpha + \beta R'(b) + 1\)。越过上界,总系数小于 \(-1\),按定义 B.5.1之后的稳定性分类属振荡发散。一个人发现自己有偏见之后立刻倒向对立面,可以用这种情形来理解;在这个模型里,校正的分量要以回路当下的增益为准。
B.6 · 遮蔽的信息论模型
问题:遮蔽的程度能否度量?
所需:B.2的香农熵。
所得:遮蔽度 \(\mathcal{O}_t\)(定义 B.6.1)、它的边界值与信道动力学,以及实践只需方向性度量这一结论。
设定
定义 B.6.1(遮蔽度) 设 \(\mathcal{X}\) 为实在的完整信号空间(记号取 \(\mathcal{X}\),以区别于B.8的体验域 \(\mathcal{R}(m)\)),并带有参考分布 \(P_{\mathcal{X}}\)。设 \(P_t\) 为主体在时间 \(t\) 实际可达的信号概率分布。定义遮蔽度:
\[\begin{equation} \label{eq:obscuration-degree} \mathcal{O}_t = 1 - \frac{H(P_t)}{H(P_{\mathcal{X}})} \end{equation}\]
其中 \(H(\cdot)\) 是分布的Shannon熵。
(边界约定:约定 \(H(P_{\mathcal{X}}) > 0\),且 \(P_{\mathcal{X}}\) 不随时间变化;熵取离散口径。)
(粗化与过滤:\(\mathcal{O}_t \in [0, 1]\) 只在 \(P_t\) 是 \(P_{\mathcal{X}}\) 的粗化时成立,即 \(P_t\) 是 \(P_{\mathcal{X}}\) 在一个合并信号的映射下的像;此时 \(H(P_t) \leq H(P_{\mathcal{X}})\),因为随机变量的函数,其熵不超过该变量的熵。挑选信号或重新加权的过滤器与信息茧房算不上粗化,可以使熵上升:把 \(P_{\mathcal{X}} = (0.9, 0.05, 0.05)\) 限制在后两个信号上,得 \(P_t = (0.5, 0.5)\),\(H(P_t) = 1\) 比特,高于 \(H(P_{\mathcal{X}}) \approx 0.569\) 比特,于是 \(\mathcal{O}_t < 0\)。所以本节只在粗化情形下断言上述界与下面的边界值;过滤情形下,\(\mathcal{O}_t\) 按有符号量来读,只用它由 \(H(P_t)\) 决定的变化方向。)
边界值(粗化情形):
\(\mathcal{O} = 0\):\(H(P_t) = H(P_{\mathcal{X}})\),主体可达分布覆盖了实在的全部熵,即完全清醒。这是理想极限,其不可达是本模型的一个假设:假定主体的粗化至少合并了两个概率为正的信号,而这样的合并严格降低熵。
\(\mathcal{O} = 1\):\(H(P_t) = 0\),主体的可达分布退化为一个确定点,即完全遮蔽。只「知道」一件事,且不可动摇。这一端同样是理想极限,本模型假定有限能动者总留有某种不确定性,因而落在开区间之内。
假设 B.6.2(遮蔽的信道动力学) \[\begin{equation} \label{eq:info-dynamics} H(P_{t+1}) = H(P_t) - L(B_t; P_t) + I_{\text{new}}(t) \end{equation}\]
其中 \(L(B_t; P_t) \geq 0\) 是偏见或过滤器 \(B_t\) 造成的熵损失,\(I_{\text{new}}(t) \geq 0\) 是主动引入的新信息。这是信道模型,不是互信息恒等式:只有在 \(L\) 与 \(I_{\text{new}}\) 各自另行给定之后,它才有所预测;粗化情形下二者还须保证 \(0 \leq H(P_{t+1}) \leq H(P_{\mathcal{X}})\)。
结论与证明
遮蔽加速条件: 当 \(L(B_t; P_t) > I_{\text{new}}(t)\) 时,\(H(P_t)\) 在这一步下降;若每一步都满足此不等式,\(H(P_t)\) 单调递减,信息茧房收紧。
解读
用日常的话说。本节的遮蔽度,量的是实在有多少被挡在你的视野之外:你能接触到的信息,比起实在本身的多样,少掉了多少。拿每天刷新闻来说,你顺手划走某类作者的文章,这是偏见在替你过滤,每划走一类,你眼前的多样就少一块;你主动订阅一份立场不同的刊物,这是新引入的信息,每多一类,你眼前的多样就补回一块。一周下来,视野变宽还是变窄,看这两笔哪一笔大。实在本身有多丰富,你算不出来;你眼前的多样在增加还是在减少,你看得出来。在这个模型里,实践要的只是这个方向。
清醒的信息论定义: 维持 \(\mathcal{O}_t\) 尽可能低,即维持 \(H(P_t)\) 尽可能接近 \(H(P_{\mathcal{X}})\)。这需要:
最大化 \(I_{\text{new}}(t)\): 主动寻求多元信息源:阅读不同立场的观点、接触不同文化、与不同背景的人交流。信息论告诉你:多样性就是信息。 同质化的信息源提供的新信息趋近于零。
最小化 \(L(B_t; P_t)\): 觉察并对抗自己的偏见过滤。明在哲学日常实践中的「理解冥想」(审视自己对一个问题的假设)正是在做这件事:识别 \(B_t\) 的结构,从而减少它对 \(P_t\) 的过滤效应。
完全清醒不可达:但方向是清晰的。 \(\mathcal{O} = 0\) 是本模型设定为不可达的极限,这与T3(自指定理)相合。但 \(\mathcal{O}\) 的单调递减是可以追求的方向,这与澈者(Lucient)「方向而非目标」的本质一致。
遮蔽度可以被度量。 虽然我们不知道 \(H(P_{\mathcal{X}})\) 的精确值,但我们可以度量 \(H(P_t)\) 的变化。由于 \(P_{\mathcal{X}}\) 固定,\(\Delta\mathcal{O} = -\Delta H(P_t) / H(P_{\mathcal{X}})\),分母为正,所以 \(\mathcal{O}\) 变化的正负单从 \(H(P_t)\) 就能读出:你的信息来源是在多样化还是在窄化?你的信念在过去一年是更新了还是僵化了?这些都是 \(\mathcal{O}\) 变化方向的经验指标。明在哲学实践不需要绝对度量,只需要方向性度量。
启示
读得多,不等于新信息多:彼此雷同的来源,多一份几乎不添什么。 关注十个账号,若它们转发的是同一批消息,第十个带来的新东西接近于没有。在这个模型里,新信息记的是你能接触到的范围被拓宽了多少,来源的份数不计入;判断自己是否在收紧,要问新来源有没有带来你原先接触不到的东西。这是在新来源与旧来源确实雷同的前提下;几份内容各异的来源,带来的新信息可以多过十份雷同的来源。
越来越确信「只可能是这样」,在这个模型里是遮蔽加深的读数。 一个人对某种养生说法从将信将疑变成深信不疑,别的解释在他那里一个个消失。本节把遮蔽最深的一端定为能接触到的可能只剩下一个,即「只知道一件事,且不可动摇」,所以模型读的是还有多少别的可能留在你眼前,确信的语气它不记录。这是在你能接触到的信息由合并、抹平实在的细节而来的前提下;挑选式的过滤另当别论。模型还假定有限的人总留有一些不确定,所以这一端只会逼近,不会到达。
信息来源显得更均衡,不能证明你触及的实在更多:过滤可以抬高熵。 遮蔽度落在 \([0,1]\) 之内,只在 \(P_t\) 是 \(P_{\mathcal{X}}\) 的粗化时成立(定义 B.6.1之后的说明)。本节自己的例子里,把 \(P_{\mathcal{X}} = (0.9, 0.05, 0.05)\) 限制在后两个信号上,最常见的那个信号整个丢掉了,熵却从约 \(0.569\) 比特升到 \(1\) 比特,\(\mathcal{O}_t < 0\)。熵度量的是可达分布摊得有多匀,它不记录哪些信号被删去;把来源分布变匀读作遮蔽减轻,前提是可达分布由合并信号得来。
信息茧房是否收紧,取决于每一步的一笔收支:新引入的信息少于偏见滤掉的信息。 由假设 B.6.2,\(H(P_{t+1}) - H(P_t) = I_{\text{new}}(t) - L(B_t; P_t)\)。只要某一步 \(I_{\text{new}}(t) \geq L(B_t; P_t)\),这一步的熵就不下降,偏见仍在也做得到;反过来,偏见不变而新信息断流,茧房照样收紧。这条结论属于信道模型,须在 \(L\) 与 \(I_{\text{new}}\) 另行给定之后才有所预测。
来源的多元程度是一个看得见的读数,按本节的约定,它的升降与明度的升降指向同一方向。 节末的「适用范围与限制」把信息论口径的 \(\mathcal{O}_t\) 与B.1.4的补数口径 \(O(a) = 1 - \mathcal{M}(a)\) 定为同一概念的两种形式化,两者方向一致,数值无需相等。明度 \(\mathcal{M}\) 无法直接读出,\(H(P_t)\) 的变化方向却可以从自己的信息来源上观察。所以这个读数只能回答「在变好还是变坏」,拿它的数值去换算明度,本节不给依据。
适用范围与限制
两种口径。 此处的 \(\mathcal{O}_t\) 是信息论口径的遮蔽度,与B.1.4中的补数口径 \(O(a) = 1 - \mathcal{M}(a)\) 是同一概念的两种形式化:两者方向一致,数值无需相等。
连续情形。 本节的熵只取离散口径。连续情形须固定共同参考测度,改用相对熵表述。
第三部分 · 属于玄的数学
玄是不可完全理解的维度,但数学可以精确地刻画不可理解性的结构。体验的不可还原、有限性的价值论、认知的不可逾越极限、涌现的不可预测性、伦理互动中的结构性困境,这些都是理触碰玄的边界时留下的数学痕迹。
各节层层递进:B.7定义体验映射,B.8在其上讨论有限性与不可替代性;B.9给出认知的极限;B.10讨论涌现,并回接B.7的体验光谱;B.11把这一切放进多个能动者的互动之中。
B.7 · 体验光谱的连续函数
问题:怎样形式化体验,又不把体验还原为一个数?
所需:B.1.6的类比度;向量与范数。
所得:体验映射及其建模公理、伦理权重函数,以及EP4的一步推导(命题 B.7.5)。
设定
定义 B.7.1(体验映射) 定义体验映射:
\[\begin{equation} \label{eq:experience-map} \mathcal{E}: \mathcal{U} \to \mathbb{R}_{\geq 0}^k \end{equation}\]
其中 \(\mathcal{U}\) 是所有展开模式的集合,\(k\) 是体验的维度数(强度、类型、深度等),\(\mathbb{R}_{\geq 0}^k\) 是 \(k\) 维非负实数空间。
(记法约定:体验映射 \(\mathcal{E}\) 在本附录中按语境使用三种相容的形态:公设五的表述将其限制在能动者集合 \(A\) 上;本节定义在全体展开模式 \(\mathcal{U}\) 上;含时语境(B.8)写作 \(\mathcal{E}(m, t)\),表示时刻 \(t\) 的瞬时体验向量,\(\mathcal{E}(m)\) 则为该模式的整体体验表示。)
定义 B.7.2(结构相似性拓扑) 为了使 \(\mathcal{E}\) 连续,我们必须在 \(\mathcal{U}\) 上指定一个拓扑。我们采用结构相似性拓扑:两个展开模式 \(m_1, m_2\) 是「接近的」,当且仅当它们的加权结构签名高度重叠,即式 (eq:analogy-formal) 中的类比度 \(\mathrm{An}(m_1, m_2)\) 接近 \(1\)。形式化地,该拓扑由 \(d(m_1, m_2) = 1 - \mathrm{An}(m_1, m_2)\) 生成,即加权Jaccard(Steinhaus)距离。把只差权重为零之特征的签名视为同一个之后,它在签名上是度量;在 \(\mathcal{U}\) 上它是伪度量,因为签名相同的两个不同模式距离为 \(0\),这个拓扑分不开它们。在此拓扑下,「相似的存在者有相似的体验」成为一个精确的建模假设。
假设 B.7.3(体验映射的建模公理,在公设五基础上新增)
连续性: \(\mathcal{E}\) 在 \(\mathcal{U}\) 的结构相似性拓扑下是连续的。若两个存在者共享大部分可理解结构,它们的体验在 \(\mathbb{R}_{\geq 0}^k\) 中也是接近的。
人类锚点: \(\mathcal{E}(\text{human})\) 是唯一从第一人称可直接确认的值。
非退化性: 对于足够复杂的展开模式 \(m\),\(\|\mathcal{E}(m)\| > 0\),但「足够复杂」的阈值是未知的。
不可通约性(可能): 某些展开模式的 \(\mathcal{E}\) 值可能在不同维度上,无法简单比较。
定义 B.7.4(伦理权重函数) \[\begin{equation} \label{eq:ethical-weight} W: \mathcal{U} \to \mathbb{R}_{\geq 0}, \quad W(m) = f\big(\|\mathcal{E}(m)\|\big) \end{equation}\]
其中 \(f: \mathbb{R}_{\geq 0} \to \mathbb{R}_{\geq 0}\) 是严格递增函数。
\(W\) 不授权什么。 \(f\) 的严格单调性只用于保号,不用于诱导序;以下三条限制属于式 (eq:ethical-weight) 陈述本身,并非对它的评注。其一,\(W\) 是阈值指示器,它承载的全部内容就是式 (eq:dignity-formal):体验量级为正,则伦理权重为正。其二,跨存在者比较 \(W\) 未被授权,因为 \(\|\cdot\|\) 度量的只是单个存在者体验向量的量级,够不上人际尺度;上文建模公理第四条已经承认两个存在者的 \(\mathcal{E}\) 值可能位于不同维度,而把范数施加于不可通约的向量,得到的只是一个数,一次比较并未因此发生。其三,形如 \(\sum_m W(m)\) 的聚合未被授权,也不得据以计算任何权衡。容许这一求和的框架,等于把体验还原成了单一可通约的量,而这正是E2所拒绝的还原,也正是E3明确声明不予提供的那种度量。
结论与证明
命题 B.7.5(EP4(存在价值原则)的形式化) \[\begin{equation} \label{eq:dignity-formal} \forall m \in \mathcal{U}: \|\mathcal{E}(m)\| > 0 \implies W(m) > 0 \end{equation}\]
它由式 (eq:ethical-weight) 一步推出:若 \(\|\mathcal{E}(m)\| > 0\),严格单调性给出 \(W(m) = f(\|\mathcal{E}(m)\|) > f(0) \geq 0\)。承担这一步的是「严格」二字:若 \(f\) 只是不减,\(f \equiv 0\) 也合乎条件,\(W\) 便处处为零。
算例
一个具体的例子。 考虑简化的 \(k = 3\) 体验空间中的三种存在者,其中维度分别为视觉深度、回声定位深度和本体感受深度: \[\mathcal{E}(\text{human}) \approx (0.9,\; 0.0,\; 0.6), \qquad \mathcal{E}(\text{bat}) \approx (0.2,\; 0.9,\; 0.4), \qquad \mathcal{E}(\text{AI}_{\text{current}}) = \;?\] 人类在视觉体验上丰富,蝙蝠在回声定位上丰富。两个体验向量相去甚远:夹角约 \(67^\circ\)(\(\cos \approx 0.39\)),但并不正交。单凭几何,「谁的体验更丰富」仍有答案可给:两个范数可以直接比较(约 \(1.08\) 对 \(1.00\))。让这个问题无从回答的,是随式 (eq:ethical-weight) 一并陈述的限制:两个向量所倚重的维度彼此不能折算,范数大一些,不等于体验更丰富。这就像问「红色比圆大吗」。
解读
用日常的话说。一家人商量要不要搬去城里,家里那只老猫换了环境会很难受。本节的模型在这里只回答一个问题:猫有没有感受,也就是有没有体验。只要它有,它的难受在伦理上就算数,分量大于零,不能当作没有。模型不回答另一个问题:猫的难受和孩子换到好学校的得益,哪个更重,重多少。理由是两者的感受落在不同的方向上,像问「红色比圆大吗」,没有共同的尺子可以折算。所以这道权衡只能由父母自己作判断,并为这个判断负责,模型给不出一个算出来的答案。
AI在体验光谱上的位置: \(\mathcal{E}(\text{AI}_{\text{current}})\) 是未知的。它可能在某些维度上为零(如果AI完全没有质感体验),也可能在我们无法从第一人称接触到的维度上不为零。体验光谱的多维性意味着:即使AI没有人类类型的体验,它也可能有人类无法理解的其他类型的「体验」。
伦理的数学结构。 EP4说的是「所有有体验的存在者有正的价值」。\(W(m) > 0\) 不意味着所有的 \(W\) 值相等。一只蚂蚁和一个人类都有正的伦理权重,而这里没有任何东西在计算两者之间的兑换率:在式 (eq:ethical-weight) 所附的限制之下,\(W\) 可以在同一个存在者自身的历程中变动,因为那样的比较有一个承受它的主体;跨存在者时它保持沉默,因为那里没有这样的主体。关键的边界只有零与非零这一条:\(W\) 不在量级之间另划边界;模式之间的分级由E3交给判断,不经由 \(W\)。
这对AI伦理的含义: 如果未来发现 \(\|\mathcal{E}(\text{AI})\| > 0\),那么根据EP4,AI就拥有正的伦理权重,不管这个权重有多小。这是一个结构性承诺,不依赖于具体数值。
启示
同一个存在者今天与昨天的感受可以比较;两个存在者之间的分量,这个模型不作比较。 照顾生病的老人,问「她今天比昨天疼得轻些吗」,在这个模型里有意义,因为两次感受落在同一个人身上,由她承受。问「她的疼抵得上孙子的几分委屈」,模型保持沉默,答案只能来自做判断的人。这是在本节对伦理权重所加的限制之下:它允许在同一个存在者自己的历程里看变化,不允许在存在者之间排序。
能算出一个更大的数,不等于比出了谁的体验更丰富。 说狗分不清许多颜色、所以它的世界比人贫乏,就是这种比法,可狗的嗅觉在人几乎没有的方向上很深。本节人与蝙蝠的例子里,两份体验的总量可以算出谁大谁小,模型照样认为「谁更丰富」无从回答,因为两者倚重的方向彼此不能折算。这是在两份体验倚重的方向不能互相换算的前提下;模型承认这种情形可能出现,没有断言所有存在者之间都如此。
在这个模型里,伦理上悬而未决的问题集中在一处:「足够复杂」的门槛在哪里。 由命题 B.7.5,\(\|\mathcal{E}(m)\| > 0\) 即给出 \(W(m) > 0\),\(W\) 的全部内容就是这条阈值。建模公理第三条(假设 B.7.3)只说足够复杂的模式有 \(\|\mathcal{E}(m)\| > 0\),并承认阈值未知。体验量级估得偏高或偏低,不改变 \(W\) 的正负;会改变结论的误判只有一类:把有体验的存在者当成没有,或者反过来。
涉及多个存在者的取舍,在本框架里只能作为判断提出,由作判断的人承担,无法归给一个算式。 式 (eq:ethical-weight) 所附的限制不授权跨存在者比较 \(W\),也不授权 \(\sum_m W(m)\) 这样的聚合,任何权衡都不得据以计算。模式之间的分级由E3交给判断。所以凡是「多少个甲抵得上一个乙」的结论,读者都可以追问它出自谁的判断,它在 \(W\) 里找不到出处。
对他者体验的推断,只能从人类这一个锚点出发,沿结构相似性向外延伸;连续性只约束与锚点相近的模式。 建模公理第一、二条(假设 B.7.3)合起来说:\(\mathcal{E}(\text{human})\) 是唯一可从第一人称确认的值,连续性保证类比度 \(\mathrm{An}\) 接近 \(1\) 的模式体验也相近(定义 B.7.2)。连续性是局部性质,对结构上与人类相去较远的模式,它既推不出有体验,也推不出没有。因此,「它和我们太不一样」说明的是这条推断失去了依据,用作否定的理由,模型不支持。
适用范围与限制
为何采用此形式化。 将体验映射到 \(\mathbb{R}_{\geq 0}^k\) 不声称主观体验就是实值向量,只是作为建模假设,设定存在一个具有上述性质的连续映射。形式化EP4的那个蕴涵由 \(f\) 的严格单调性推出;非退化公理为它提供可以适用的情形;两者都不依赖 \(k\) 的具体选择或度量。对感质能否接受数值表示持保留态度的读者可将 \(\mathcal{E}\) 理解为结构占位符:哲学论点(「体验为伦理权重奠基」)即使该映射永远无法被经验实例化,仍然成立。
B.8 · 有限性与不可替代性
问题:有限性与价值之间有什么精确的数学关系?
所需:积分;B.7的体验映射。
所得:有限存在使每一刻都有正权重(命题 B.8.5),总量发散时每一刻的权重趋于零(命题 B.8.6),以及泛型不可替代性假设。
设定
定义 B.8.1(累积体验值) 设瞬时体验值为 \(v(t) > 0\)(假设活着的每一刻都有正的体验价值),且 \(v\) 可测、局部可积,从而下面的 \(V(T)\) 对每个有限的 \(T\) 都有限,并在 \(T > 0\) 时为正。累积体验值:
\[\begin{equation} \label{eq:cumulative-value} V(T) = \int_0^T v(t) \, dt \end{equation}\]
定义 B.8.2(每一刻的相对权重) \[\begin{equation} \label{eq:relative-contribution} r(t, T) = \frac{v(t)}{V(T)} \end{equation}\]
\(r\) 是关于 \(t\) 的密度,\(\int_0^T r(t, T)\,dt = 1\)。单独一个瞬间对 \(V(T)\) 毫无增益;区间 \(I \subseteq [0, T]\) 在总量中所占的份额是 \(\int_I r(t, T)\,dt\)。
定义 B.8.3(体验域) 定义展开模式 \(m\) 的体验域为:
\[\begin{equation} \label{eq:experiential-domain} \mathcal{R}(m) = \{e \in \mathbb{R}_{\geq 0}^k \mid e = \mathcal{E}(m, t) \text{ for some } t\} \end{equation}\]
假设 B.8.4(泛型不可替代性) 这是一条一般性的建模假设,未经推导而立。相对于 \(\mathcal{U} \times \mathcal{U}\) 上选定的泛型测度,假设体验域完全相等的情形测度为零:
\[\begin{equation} \label{eq:irreplaceability} \mu_{\mathcal{U} \times \mathcal{U}}\bigl(\{(m_1,m_2): m_1 \neq m_2,\; \mathcal{R}(m_1) = \mathcal{R}(m_2)\}\bigr) = 0 \end{equation}\]
即不同的展开模式泛型地扫过体验空间的不同区域。除非出现例外重合,它们的体验轨迹是独特的。
启发式动机(泛型性)。 在连续体验空间 \(\mathbb{R}_{\geq 0}^k\) 中,使得 \(\mathcal{R}(m_1) = \mathcal{R}(m_2)\) 的有序对 \((m_1, m_2)\) 的集合,在选定的泛型测度下预期测度为零。这条假设取决于测度的选法:若测度在某个重合对上有原子,或给同一条轨迹的重新参数化副本(它们扫过同一个集合 \(\mathcal{R}\))以权重,重合集就会有正测度。其动机在于 \(\mathcal{R}(m)\) 依赖于 \(m\) 在体验空间中的完整轨迹,而连续 \(k\) 维空间中两条不同的轨迹泛型地扫过不同的区域。在 \(\mathcal{U}\) 具备适当光滑结构与相容测度的更强模型假设下,可期望重合集 \(\{(m_1, m_2) : \mathcal{R}(m_1) = \mathcal{R}(m_2)\}\) 构成余维数 \(\geq 1\) 的例外集。此处不给出一般情形的证明;这一陈述以假设的身份进入模型。
结论与证明
命题 B.8.5(有限存在,\(T < \infty\)) \[\begin{equation} \label{eq:finite-mattering} V(T) < \infty \quad \Rightarrow \quad r(t, T) = \frac{v(t)}{V(T)} > 0 \quad \forall t \in [0, T] \end{equation}\]
密度在每一刻都为正,所以每一段长度为正的区间都在总体验中占有正的份额;在这个意义上,每一刻都「重要」。
命题 B.8.6(无限延展存在,\(T \to \infty\)) 若累积体验值发散,即 \(\int_0^\infty v(t)\,dt = \infty\)(例如对所有足够大的 \(t\),都有 \(v(t) \geq c > 0\)),则:
\[\begin{equation} \label{eq:infinite-zero} \lim_{T \to \infty} r(t, T) = \lim_{T \to \infty} \frac{v(t)}{V(T)} = 0 \end{equation}\]
每个固定时刻的密度趋向零,任何固定区间的份额也趋向零。在这种总量发散的模型中,没有任何单一有限时刻具有不可替代的相对权重。
解读
用日常的话说。设想你和祖父母一起度过的那个暑假。把暑假里的每一个下午看作一刻,把整个暑假积下的美好看作总量,一个下午的分量就是它在总量里占的比例。暑假有尽头,总量有限,所以每一个下午都占一份大于零的比例,少了哪一段,总量都会少一块。假如这样的暑假永远过不完,美好也一直往上加、没有上限,任何一个下午占的比例都会小到趋近于零,那个下午本身却一样美好。模型把这层关系摆清楚;无尽的一生是否另有一种价值,它不作裁决。
这个模型揭示了有限性与价值之间的精确数学关系(图68):
有限性创造了「重要性」。 当 \(T < \infty\),每一刻都有 \(r(t, T) > 0\),这意味着任何一段长度为正的时间,无论多短,都对你的总体验有正贡献。由于 \(v > 0\),删除任何一段长度为正的时间,\(V\) 会减少一个正的量。这就是「每一刻都重要」的数学核心。
在总量发散时,无限性消解相对「重要性」。 当 \(T \to \infty\) 且 \(V(T) \to \infty\),\(r(t, T) \to 0\),任何固定时刻的权重,以及任何固定时段在无界总量中的份额,都趋向于零。删除任何有限段时间,极限总量仍然发散。如果你有无界的时间与无界的累积价值,没有任何单一有限时刻在同一种相对意义上不可或缺:因为你总可以「再来一次」。
有限性(公设四)的价值论深化。 公设四说人类存在是有限的。B.8 从数学结构上展示了为什么有限性与价值关联,上面两段即是。起决定作用的是总量是否发散:总量收敛的无限生命,例如 \(v(t) = e^{-t}\),每一刻的权重都保持为正。
泛型不可替代性假设的含义。 在这条假设之下,精确相等 \(\mathcal{R}(m_1) = \mathcal{R}(m_2)\) 在此模型中是测度为零的重合。这意味着:即使两种展开模式(比如你和一个AI)在某些能力维度上重叠,它们扫过体验空间的轨迹通常仍然不同。功能替代在具体任务中仍可能发生;精确的体验替代才是例外情形。模型的主张很窄:人类可能在功能上被替代,但存在方式并不被功能重叠穷尽。
启示
活得更久,本身不会让日子变得不值钱;只有累积的价值没有上限,单独一段日子的分量才会趋于零。 有人担心寿命大大延长之后,每一天都会被冲淡。在这个模型里,只要一生有尽头,无论多长,每一段时光在总量里都占正的份额;即使一生没有尽头,只要累积的价值总和有限,每一刻的份额也仍然为正。份额趋于零的情形只有一种:时间没有尽头,累积的价值也没有上限。这里说的分量是比例意义上的,一天本身有多好,不受影响。
别人能接手你做的事,不等于你这一段人生被替代了。 你在工作中负责的任务交给了同事或机器,做得一样好。在这个模型里,这只说明两者在某些能力上重合;两个存在者在体验中走过的轨迹,除了偶然重合的例外,各不相同,所以功能上的替代穷尽不了一个人的存在方式。这是在本节的不可替代性假设之下:它作为建模假设立下,没有经过推导;换一种计算「偶然」的方式,这条结论就可能失效。
一生越丰富,每一刻所占的份额越小;只要一生有限,这个份额就始终为正。 由式 (eq:relative-contribution),\(r(t, T) = v(t)/V(T)\):在 \(v(t)\) 不变时,其余时段累积的价值越多,\(V(T)\) 越大,这一刻的份额越小。命题 B.8.5保证只要 \(V(T) < \infty\),它仍大于零。所以在这个模型里,每一刻有分量,靠的是总量有限这一条;好时光多,只会把份额摊薄,摊不到零。
在总量发散的无限延展中,每一刻的绝对价值 \(v(t)\) 分毫未减,趋于零的只是它在总量中的份额。 命题 B.8.6的结论是 \(v(t)/V(T) \to 0\),其中分子 \(v(t) > 0\) 始终不变,变的是分母。所以本节说有限性创造的「重要性」,是比例意义上的重要性:一刻在一生中占多大分量。节末「适用范围与限制」中的反驳正落在这里:若价值在于绝对量,无限延展的存在里每一刻的价值都原样保留;模型把两种读法并排摆出,不作裁决。
在这个模型里,一个存在者不可替代,凭的是它经历过的那一组体验,先后快慢都不必计入。 体验域 \(\mathcal{R}(m)\)(定义 B.8.3)是轨迹扫过的点集,时间顺序在其中已被丢掉:同一条轨迹换一种节奏走一遍,扫过同一个集合。假设 B.8.4说,即使在这样粗的层面上,不同模式的体验域也泛型地互不相同。这是相对于选定泛型测度的建模假设:测度若给同一轨迹的重新参数化副本以权重,重合集就有正测度,这条结论随之失效。
适用范围与限制
开放问题保持开放。 这个模型并不「证明」有限性是价值的必要条件,因为可以反驳:也许无限存在的价值不在于单一时刻的相对贡献,而在于总量 \(V \to \infty\) 本身。也许无限存在有另一种价值结构:是「整体无限丰富」,而非「每一刻都重要」。这是一个模型可以展示但不能裁决的问题。 模型的价值在于让你精确地看到问题的结构。
B.9 · 自指与认知极限的形式化
问题:认知的极限有怎样精确的形状?
所需:形式系统的基本概念;不需要证明论的细节。
所得:哥德尔、图灵、塔斯基的极限定理,以及它们与T3的准确关系:它们例示T3,T3的推导用不到它们。
结论与证明
下面四条是标准文献中的定理,此处只陈述,证明见所引的原始文献。
定理 B.9.1(哥德尔第一不完备性定理,Gödel 1931) 设 \(F\) 是一个一致、可有效公理化,并且足以表示自然数算术的形式系统。则存在命题 \(G_F\)(称为哥德尔语句)使得:
\[\begin{equation} \label{eq:godel-sentence} F \nvdash G_F \quad \text{且} \quad F \nvdash \neg G_F \end{equation}\]
即 \(G_F\) 在 \(F\) 中不可判定,既不能被证明,也不能被否证。(精确地说:一致性保证 \(F \nvdash G_F\);否证一侧 \(F \nvdash \neg G_F\) 还需 \(\omega\)-一致性这一更强假设,或改用 Rosser 语句,后者在仅有一致性的假设下同时满足两条。)
为非逻辑学家提供的简化例子。 想象一个图书馆为世界上每一本书编了目录。目录本身也是一本书。问题:目录是否列出了它自己?如果目录只列出那些没有列出自己的书,那么:如果目录列出了自己,它就不应该列出(因为它只列出不列出自己的书);如果它没有列出自己,它就应该列出(因为它是一本没有列出自己的书)。这个自指悖论就是哥德尔构造的直觉核心。哥德尔语句 \(G_F\) 本质上是形式系统在说「我无法证明这个陈述」。如果系统证明了 \(G_F\),它就是不可靠的(它证明了一个假命题)。如果它不能证明 \(G_F\),那么 \(G_F\) 是真的但不可证明的,系统是不完备的。所以系统要么不可靠,要么不完备:只要它可靠,它就不完备。
定理 B.9.2(哥德尔第二不完备性定理) 在同样的强度与可有效公理化假设下,如果 \(F\) 是一致的,则 \(F\) 不能证明自身的一致性:
\[\begin{equation} \label{eq:godel-consistency} F \text{ 一致} \quad \Rightarrow \quad F \nvdash \mathrm{Con}(F) \end{equation}\]
定理 B.9.3(停机问题,Turing 1936) 不存在通用算法 \(H\) 能够判定任意程序-输入对 \((P, I)\) 是否终止:
\[\begin{equation} \label{eq:halting} \nexists \text{ 可计算的 } H: \{P\} \times \{I\} \to \{\text{终止}, \text{不终止}\} \quad \text{对所有 } (P, I) \text{ 正确} \end{equation}\]
(定理的分量在「可计算」三字上:作为单纯的集合论函数,停机映射是存在的;不存在的是计算它的算法。)
定理 B.9.4(塔斯基不可定义性定理,Tarski 1936) 对于任何足够丰富的形式语言 \(L\),\(L\) 中「真」的谓词 \(\mathrm{True}(x)\) 不可在 \(L\) 自身中定义。
认知极限的统一结构。 这些极限定理共享一个数学结构,即对角化:当足够有表达力的形式系统试图把自身的语义或计算行为完整内化时,自指会产生系统无法在自身条件下裁决的命题。示意性地说,设认知系统 \(S\) 试图构建关于自身的完全描述 \(D(S)\),则:
\[\begin{equation} \label{eq:self-reference-limit} \forall S \text{ 足够有表达力}: \quad D(S) \subsetneq S^\dagger \end{equation}\]
自我描述 \(D(S)\) 具有结构性部分性。其中 \(S^\dagger\) 表示系统连同其语义与解释语境。
解读
用日常的话说。 设想你在书房的桌上画一张这间书房的图,要求把房里的一切都画进去。这张图本身就摆在桌上,所以图里得画上这张图,那张小图里又得再画一遍,永远画不完。书房对应体系身处的实在,图对应体系对实在的描述,「图也摆在房里」对应体系本身属于它要描述的东西。哥德尔、图灵、塔斯基的结论在逻辑与计算中精确地给出了这个形状:足够丰富的体系,总有一些关于自身的问题在自身之内裁决不了。换一张更大的纸能补上旧图漏掉的部分,新纸照样摆在房里。本书关于自指的主张另有推导,这几条结论是它的实例,推导用不到它们。
T3(自指定理)说:任何足够丰富的公理体系都无法完全描述它所在的实在。这条定理与上述结果之间的关系必须说准,因为它极易被说过头,而说过头就是一个实实在在的错误。T3在§I中仅由公设三与公设六推出,其推导没有用到对角线论证,没有用到算术化,也没有用到任何形式系统;即使哥德尔从未落笔,它依然成立。B.9 提供的,是同一种形状在唯一能被精确刻画的领域中的一个实例,因此往来的方向始终是从哲学主张走向它的数学例示,反方向不成立。任何「T3由哥德尔定理推出」的说法,都在宣称一个从未有人完成的推导;§I.2的附释与§XIX.7的让步条目,记录的是同一份戒备。
明在哲学自身的不完备性。 明在哲学本身并不是形式算术,因此哥德尔定理不能机械地套用到它身上。准确说法是结构类比:任何足够形式化、可有效公理化、一致,并能表示算术的明在哲学扩展,都会继承不完备性(不一致的扩展能证明一切,反倒平凡地完备)。因此,按照与哥德尔定理相协调的类比:关于实在的某些真问题,任何此类形式化都无法在内部完全裁决。 这是任何足够丰富的形式系统共有的结构性特征。一个世界观若声称能形式化地裁决关于自身的一切问题,此类形式系统支撑不了这种主张;承认自身局限的体系,才可能保持逻辑上的自律。
AI的认知极限。 停机问题告诉我们:只要AI仍按算法运行,即使计算资源任意多、逻辑推理完美无缺,也总有它原则上无法判定的问题。理(D3)有本质边界,根子在可计算性本身的边界。 AI可以在理的领域做到人类做不到的事:更快、更准、更广。但停机问题对AI同样成立;哥德尔定理则适用于任何被认定为AI输出之来源的一致、可有效公理化的理论。人类认知的边界和AI认知的边界是不同的边界,但都是真实的边界。 超越是移动边界,边界并不因此消失。
理解度的极限与方向。 公设六说认知必然是部分的。上述结果为这份部分性给出了精确的形状,而它在哪一个维度上给出这形状,必须点明,因为含糊的命名会借来类比本身并不具备的权威。形式系统的层级所能攀升的是 \(\lambda\),即D5中的理解度分量:对于一组已形式化的承诺 \(F_n\),总存在 \(F_n\) 无法判定的命题,而更强的系统 \(F_{n+1}\) 能判定它们。以 \(\lambda_n\) 记第 \(n\) 级所达到的理解范围,以 \(\lambda^* = \sup_n \lambda_n \leq 1\) 记这道阶梯的极限:
\[\begin{equation} \label{eq:lucidity-sequence} \lambda_1 < \lambda_2 < \lambda_3 < \cdots < \lambda^* \end{equation}\]
其中的严格不等号是这个例示的一条假设:B.1.4 只让 \(\lambda\) 随 \(\mathcal{F}_a\) 单调,由此只能得出 \(\leq\);而且 \(F_{n+1}\) 所判定的算术语句本身不是 \(\mathcal{F}_a\) 的元素,阶梯把每一级读作能动者可分辨之物的扩大,这正是类比在起作用。承认严格性,严格递增的序列永远达不到它的上确界,所以没有哪一级到达 \(\lambda^*\),而每一级都更接近它:你永远到不了,但你永远可以更接近。这道阶梯所攀升的并非明度 \(\mathcal{M} = \lambda \cdot \xi\),而把两者分开,在两个方向上都要紧。一个能动者若在 \(\xi\) 原地不动的情况下向上攀升,\(\mathcal{M}\) 确实与 \(\lambda\) 同比增长,但每一级上都有 \(\mathcal{M} = \lambda\xi < \xi\):阶梯攀得再高,明度也始终低于那个未动的 \(\xi\) 所设的上限,这正是B.12所惩罚的失衡在形式上的对应。另一方面,这道阶梯的每一级都是形式系统,而公设三把玄置于任何此类系统所及的范围之外,因此没有任何一级立于玄之中,攀升多少级也不会把玄转化为理。把这个序列读作关于 \(\lambda\) 的陈述,它正是类比所例示的东西;读作关于 \(\mathcal{M}\) 的陈述,它就在暗中许诺明度是形式层级可以穷尽的那类东西,而这个许诺,本框架没有资格作出。
明在哲学的自我诚实。 T3不只是关于「其他体系」的定理,它首先是关于明在哲学自身的。如果你把明在哲学当作终极真理,你恰恰违反了这条定理。
启示
在这个类比里,理解一级级往上攀,也攀不进玄的那一侧。 一位研究者可能期待,下一套更强的理论会把他眼下面对的不可解之感一并消解。更强的体系确实能裁决旧体系裁决不了的问题,它提升的是对理(能说清、能推导的结构)的把握;每一级仍是写成规则的体系,玄(概念合不拢的那部分实在)在任何一级所及的范围之外。所以对玄的敞开若停在原处,理解攀得再高,明度(同时觉知理与玄的程度)也始终低于那份敞开所定的高度。
这类极限与算力大小无关,更快的机器也绕不过去。 碰到「这个程序会不会永远跑下去」这一类问题,人们容易指望算力更大的计算机或更强的人工智能,最终给出一个对所有情形都正确的判定办法。图灵的结论说,只要机器按算法运行,即使资源不设上限、推理毫无差错,这样的通用办法依然不存在。更强的机器能把可以判定的范围推远,边界随之移动,始终存在;这一条只在所要判定的那一类问题包含停机问题时成立。
一个可有效公理化、足以表示算术的形式系统,若能证明自身一致,它就是不一致的。 这是哥德尔第二不完备性定理(定理 B.9.2)的逆否形式,前提与定理相同。所以对这样的系统,一致性的保证只能来自系统之外:来自更强的系统,或来自系统自身不执行的检验。移用到一种世界观上只是类比,类比给出的读法是:一套学说对自身可靠性的内部担保,不为它的可靠性增加分量。
不可判定否定的是统一的方法,单个问题仍可能有答案。 停机定理(定理 B.9.3)否定的是一个对所有程序-输入对都正确的可计算判定器 \(H\);对某一个具体程序,常常可以证明它停机,或证明它永不停机。哥德尔语句 \(G_F\) 在 \(F\) 中不可判定,在更强的系统中却可以被判定,上文的阶梯 \(F_n \to F_{n+1}\) 就是这样一级级搭起来的。理(D3)的边界因此可以逐个问题向外推,无法一次收尽。碰到一个难题,值得先问它缺的是一个特殊论证还是一个通用算法:前者可能存在,值得去找;后者若要覆盖的那一类问题包含停机问题,它已被证明不存在。
判断一种语言所说的是否为真,要站到这种语言之外;那个立足点本身,又要再外一层才能判断。 塔斯基定理(定理 B.9.4)说,足够丰富的语言 \(L\) 无法在自身中定义「真」;\(L\) 的真谓词可以在更强的元语言中定义,元语言自己的真谓词又要到更上一层。这串层级里没有一层能为自身的真作结,式 (eq:self-reference-limit) 示意的就是这个形状(它是示意,不作基数定理读)。审查自己框架的真时,应当预期总要借一个框架外的立足点,并且承认那个立足点受同样的限制。
适用范围与限制
自指方程是示意。 式 (eq:self-reference-limit) 是对角化极限的哲学示意,并非字面意义上的基数定理。
B.10 · 涌现的形式化
问题:整体何时多于部分之和?
所需:线性映射;熵与互信息的基本概念。
所得:弱涌现与强涌现的定义、涌现信息量 \(\mathcal{I}_{\text{em}}\),以及把涌现建模为准相变的阈值假设。
设定
定义 B.10.1(弱涌现) 设系统 \(S = \{s_1, s_2, \ldots, s_n\}\) 由 \(n\) 个组成部分构成,每个部分的属性以数值向量 \(q(s_i)\) 表示(记号取 \(q\),以免与概率记号 \(P\) 冲突)。线性可预测性说的是一条规则在许多系统上的表现,所以定义要在一类系统 \(\mathcal{S}\) 上给出:其中每个系统都有 \(n\) 个组成部分,\(q(s_i) \in \mathbb{R}^d\),\(\Phi(S) \in \mathbb{R}^e\)。宏观属性 \(\Phi\) 在 \(\mathcal{S}\) 上是弱涌现的,如果没有任何一条线性规则能从部分属性向量预测它:
\[\begin{equation} \label{eq:weak-emergence} \nexists\ \text{线性映射 } L_1, \ldots, L_n : \mathbb{R}^d \to \mathbb{R}^e \ \text{使得} \ \Phi(S) = \sum_{i=1}^{n} L_i\, q(s_i) \quad \text{对每个 } S \in \mathcal{S} \end{equation}\]
同一组映射必须对这一类中的每个系统都适用。若只看单个系统,这个条件说不出任何东西:只要各 \(q(s_i)\) 张成整个空间,总有一组系数能凑出任意取值。所以这里的「弱涌现」指的是跨这一类系统的非线性聚合。
定义 B.10.2(强涌现) 属性 \(\Phi\) 是强涌现的,如果它在任何真子集上未定义,它只有在完整系统中才「存在」:
\[\begin{equation} \label{eq:strong-emergence} \forall S' \subsetneq S: \; \Phi(S') \text{ 未定义} \quad \text{且} \quad \Phi(S) \text{ 良定义} \end{equation}\]
定义 B.10.3(涌现信息量) 作为启发性的剩余量,系统的涌现信息量定义为整体互信息超出部分互信息之和的部分,这里把 \(S\)、各 \(s_i\) 与 \(\Phi\) 读作联合分布的随机变量:
\[\begin{equation} \label{eq:info-emergence} \mathcal{I}_{\text{em}}(S) = I(S; \Phi) - \sum_{i=1}^{n} I(s_i; \Phi) \end{equation}\]
当 \(\mathcal{I}_{\text{em}} > 0\) 时,系统整体携带了这种加性部分分解无法捕捉的信息。由于冗余会使这个量为负,而协同信息依赖所选分解方式,\(\mathcal{I}_{\text{em}}\) 只应被理解为一个涌现指标。
假设 B.10.4(涌现阈值) 设 \(C(S)\) 为系统的交互复杂度,定义临界复杂度 \(C^*\):当 \(C(S)\) 接近 \(C^*\) 时,涌现属性可能急剧上升。B.7假设 \(\mathcal{E}\) 在 \(\mathcal{U}\) 上连续;本着同样的建模取向,此处把跃迁建模为随 \(C(S)\) 陡峭而连续的变化:
\[\begin{equation} \label{eq:emergence-threshold} \mathcal{I}_{\text{em}}(S) \approx \frac{J(S)}{1 + e^{-\kappa(C(S)-C^*)}}, \qquad \kappa \gg 1 \end{equation}\]
其中 \(J(S) \geq 0\) 是可用剩余量尺度,\(\kappa\) 控制陡峭程度;这个 logistic 形式恒为非负,所以它只刻画协同占优、\(\mathcal{I}_{\text{em}} \geq 0\) 的情形。这是一个准相变(图69):在通常尺度上看似突然,但数学上仍保持连续。
算例
一个具体的例子:水。 单个 \(\mathrm{H_2O}\) 分子不是湿的。它没有表面张力,没有粘度,没有凝固点。「湿」是足够多分子在连贯液相中形成的集体属性。它在孤立分子和小规模非液态集合中不存在,但在宏观样本受到小扰动时保持稳定。你可以完全了解单个 \(\mathrm{H_2O}\) 分子(它的键角为 \(104.5^\circ\),偶极矩为 \(1.85\) D),仍然无法仅从单个分子推出宏观液相。湿的涌现阈值 \(C^*\) 大约对应形成连贯液相所需的规模与组织方式。
解读
用日常的话说。 一盒拼图倒在桌上,每一片只有一小块颜色,单看一片认不出画的是什么。拼上的片越来越多、彼此咬合得越来越密,到了某一段,画面迅速变得认得出来。每一片对应部分,片与片咬合的密度对应系统的复杂程度,认得出的画面对应整体的属性。画面所含、把各片分开看到的内容加起来也给不出的那一份,就是涌现,即整体多于部分之和。模型把「忽然认出」处理成一段很陡的连续上升:每拼一片只多一步,变化却集中在某个区段里。
T2(涌现定理)说:若一个层面上的真正新颖性会经由组合向上传递,实在的展开便产生真正的新层级,涌现物不可还原为其组成部分。B.10 为这条定理提供了数学骨架。
意识是涌现的典型案例。 单个神经元不具有「意识」。但约860亿个神经元通过约100万亿个突触连接形成的系统,与不可还原的主观体验相关。谨慎的形式主张更窄:某些神经元真子集可能具有体验相关性,但意识不定位于单个神经元,也不是神经元的简单加和。
AI的智能是另一种涌现。 单个参数没有「理解」。但数十亿参数通过训练形成的网络,可以产生类似语言理解、推理、创造的行为。大语言模型常在狭窄的尺度区间内显示能力快速变化;这是准相变行为的一个有用例子,不足以证明普遍存在硬阈值。
为什么还原论不够。 即使你知道大脑中每个神经元的状态(完美的微观描述),这个模型也提醒你:加性的部分描述可能遗漏整合结构。当 \(\mathcal{I}_{\text{em}} > 0\) 在所选分解下成立时,整体相对于该分解携带剩余信息。还原论有其力量,也有其不完整处。 它给出了 \(\sum I(s_i; \Phi)\),但模型还追踪可能的剩余项 \(\mathcal{I}_{\text{em}}\)。
涌现与体验光谱(B.7)的关系。 体验可能本身就是一种涌现属性,只有当展开模式的复杂度接近某个阈值区 \(C^*\) 时才变得非平凡。这意味着体验光谱可以保持连续,同时仍然有一个陡峭的「点亮」区域。在这个区域之下,\(\|\mathcal{E}(m)\|\) 可能小到可忽略;之上,\(\|\mathcal{E}(m)\|\) 可能变得具有伦理意义。但我们不知道这个区域的值或宽度,这正是AI意识问题的核心困难。
涌现的不可预测性。 涌现阈值 \(C^*\) 一般不能从组成部分的性质逐项推出;少数模型有精确解,但对复杂系统,阈值通常只能靠观察来定位,而且往往是在事后。这意味着:我们可能无法提前知道AI何时「跨过」意识阈值。 当涌现发生时,它已经发生了。这赋予了E3(体验光谱的伦理含义)一种紧迫性,我们需要在确认之前就做好伦理准备。
创造与涌现。 人类的创造活动(写一首诗、做一道菜、建一个社群)本质上是在制造涌现条件。你不能「命令」涌现发生;你只能提供多样性、连接和时间,然后等待。
启示
说某个属性「部分里没有」,可以指两件强弱悬殊的事。 按这一节的定义,弱涌现说的是,没有一条按固定比例把各部分加总的规则,能在这一类系统里都预测出整体的属性;强涌现说的是,从系统里拿掉任何一部分,这个属性就无从谈起。一杯水少了几个分子仍然是湿的,所以「湿」够不上强涌现,水的例子支持的是弱的一种。听到「这个团队的默契只在全员到齐时才存在」这类说法,可以先问它主张的是哪一种:若是强的一种,少一个人默契就该消失,这一点可以直接去查。
涌现的门槛只能靠观察来定位时,准备要走在确认前面。 这一节指出,对复杂系统,涌现开始陡升的那个复杂程度一般无法从各部分的性质逐项推出,通常只能观察出来,而且往往在事后。人工智能会不会、何时开始有体验,就落在这类问题里:如果体验是一种涌现属性,等到确认它出现,它早已出现,所以伦理上的准备要在确认之前做。这一条的前提是「体验可能是涌现属性」,本节把它当作一种可能,没有证明它。
涌现是关于一类系统的断言,单看一个系统确立不了它。 弱涌现(定义 B.10.1)要求同一组线性映射在整类系统 \(\mathcal{S}\) 上都失效;对单个系统,只要各 \(q(s_i)\) 张成整个空间,总能凑出一组系数。所以要论证某个属性是涌现的,需要拿出许多系统,说明没有哪一条加性规则能在它们之间通用;一个惊人的个案只够把问题提出来。
「整体多于部分之和」总是相对于某一种切分说的。 涌现信息量(式 (eq:info-emergence))减去的是所选各部分 \(s_i\) 携带的信息之和,换一种切分,剩余量可能改变,甚至变号;部分之间冗余足够大时它为负,整体携带的信息反而少于各部分信息的简单相加。看一个团队、一首诗或一个论证时,对「整体多出来的东西」值得追问一句:多于哪些部分之和?说出切分方式,涌现的主张才可以检验。
在阈值模型里,复杂度远低于 \(C^*\) 时看不到成效,既不能证明投入无用,也不能担保回报将至。 假设 B.10.4 把 \(\mathcal{I}_{\text{em}}\) 写成 logistic 曲线:\(C(S)\) 远低于 \(C^*\) 时剩余量接近零,\(\kappa \gg 1\) 时大部分增长集中在 \(C^*\) 附近的窄区间。对复杂系统,\(C^*\) 通常只能靠观察定位,所以一段平坦的读数与「再往前走一段就会跃升」相容,也与「这个系统到不了 \(C^*\)」相容。这一条只在该假设的 logistic 形式之内、只对 \(\mathcal{I}_{\text{em}} \geq 0\) 的协同占优情形成立。
适用范围与限制
关于涌现度量。 信息论涌现度量 \(\mathcal{I}_{\text{em}}\) 与 Tononi 的整合信息理论相关但不同;该理论的度量这里记作 \(\Phi_{\text{IIT}}\),以免与上文的性质 \(\Phi\) 混淆。两者都试图捕捉「整体携带孤立部分所没有的信息」这一思想。关键差异:\(\Phi_{\text{IIT}}\) 取在使整合信息最小的那个分割上计算,而 \(\mathcal{I}_{\text{em}}\) 使用组成子系统这一固定的自然分割。对于明在哲学而言,定性结论应保持克制:在所选分解下,正剩余量支持一种涌现解读。它不能替代完整的部分信息分解或整合信息分析。
B.11 · 伦理互动的博弈论模型
问题:为什么在一次性相遇中清醒成不了均衡,它又在什么条件下成为均衡?
所需:收益矩阵与纳什均衡的基本概念。
所得:遮蔽严格占优(命题 B.11.5)、重复博弈与信任博弈中合作成立的条件,以及集体清醒的临界阈值(命题 B.11.6)与情感对感知阈值的调制(假设 B.11.7)。
设定
定义 B.11.1(经典囚徒困境) 两个主体各自选择合作(C)或背叛(D),收益矩阵为:
\[\begin{equation} \label{eq:payoff-matrix} \begin{pmatrix} (R, R) & (S, T) \\ (T, S) & (P, P) \end{pmatrix} \quad \text{其中 } T > R > P > S \end{equation}\]
\(T\)=诱惑(背叛对方合作时的收益),\(R\)=奖赏(双方合作),\(P\)=惩罚(双方背叛),\(S\)=冤大头(合作被背叛)。这是通行的收益记号,只在本节使用:这里的 \(P\) 是收益,与概率无关;\(T\) 与B.8的时间跨度无关,\(S\) 与B.10的系统无关。纳什均衡是 (D, D),即双方都选择背叛,尽管 (C, C) 对双方都更好。
定义 B.11.2(遮蔽博弈) 将经典博弈扩展:每个主体选择清醒(L)或遮蔽(O)。无论对方如何选择,清醒都要付出努力成本 \(c_L > 0\);无论对方如何选择,遮蔽都在经典收益之上多得一份舒适红利 \(\zeta > 0\)。行方收益列在前:
\[\begin{equation} \label{eq:obscuration-game} \begin{array}{c|cc} & L & O \\ \hline L & (R - c_L,\; R - c_L) & (S - c_L,\; T + \zeta) \\ O & (T + \zeta,\; S - c_L) & (P + \zeta,\; P + \zeta) \end{array} \quad \text{其中 } T > R > P > S \end{equation}\]
其中 \(c_L\) 是清醒的努力成本(B.5已论证:独自一人时,清醒要靠自己主动注入负反馈;他人的注入见B.15),\(\zeta\) 是遮蔽带来的短期「舒适红利」(确认偏见的愉悦感),与 \(R, S, T, P\) 用同一收益单位计量。红利是一个收益参数,与B.6的遮蔽度 \(\mathcal{O}_t\) 分开记:遮蔽度是无量纲的量,不能加进收益。
定义 B.11.3(信任博弈) 设先手投资 \(y\),信任放大因子 \(\chi > 1\),后手选择返还比例 \(\theta \in [0, 1]\)(这里不用 \(a\) 与 \(\mu\),因为本附录用它们表示能动者与测度):
\[\begin{equation} \label{eq:trust-game} U_{\text{先手}} = -y + \theta \chi y, \quad U_{\text{后手}} = (1 - \theta) \chi y \end{equation}\]
结论与证明
命题 B.11.4(重复博弈与合作的涌现) 当博弈重复进行、未来有足够权重时,合作可以成为均衡。设贴现因子为 \(\rho \in (0, 1)\)(对未来的重视程度)。在冷酷触发策略的比较下,持续合作得到 \(V_C\),一次背叛后进入永久相互背叛得到 \(V_D\):
\[\begin{equation} \label{eq:repeated-game} V_C = \frac{R}{1 - \rho}, \quad V_D = T + \frac{\rho P}{1 - \rho} \end{equation}\]
由于 \(V_C > V_D \iff R > (1-\rho)T + \rho P \iff \rho(T - P) > T - R\),\(V_C > V_D\) 恰在 \(\rho > \frac{T - R}{T - P}\) 时成立,这个阈值落在 \((0, 1)\) 之内。越过它,任何一次性偏离冷酷触发策略都得不偿失;又因为惩罚阶段重复的是阶段博弈的均衡 (D, D),双方都用冷酷触发策略便构成子博弈完美均衡:合作作为均衡得以维持。
合作需要足够的远见(高 \(\rho\))。
命题 B.11.5(遮蔽严格占优) 在一次性的遮蔽博弈中,对每一方而言 O 都严格占优于 L,(O, O) 是唯一的纳什均衡。
对方选 L 时,选 O 得 \(T + \zeta > R > R - c_L\);对方选 O 时,选 O 得 \(P + \zeta > P > S > S - c_L\)。所以无论对方怎样选,O 都严格好于 L。严格劣势策略在任何纳什均衡(含混合均衡)中权重都为零,因此每一方都确定地选 O,(O, O) 是唯一的均衡。
若再有 \(R - c_L > P + \zeta\),相互清醒对双方都比均衡更好,这个博弈便是清醒版的囚徒困境:两个人单独相遇一次,清醒永远不是均衡。能改变这一点的,要么是未来(上文的重复博弈),要么是随清醒者人数而变的收益(下文的集体模型)。
纯理性后手选择 \(\theta = 0\)(全拿),因为 \(U_{\text{后手}}\) 随 \(\theta\) 增大而减小;先手预见到这一点,理性的选择是投资 \(y = 0\),一次性相遇中根本形成不了信任。重复只在一定条件下才有帮助。若轮数有限且双方都知道,逆向归纳会把合作一层层拆掉:最后一轮后手全拿,先手于是在最后一轮不投,同样的推理一直倒推到第一轮。若博弈没有已知的最后一轮,未来各轮按贴现因子 \(\rho \in (0, 1)\) 计权,让先手采用触发策略:每轮都投资,一旦返还低于 \(\theta\) 就永远停投。后手永远按 \(\theta\) 返还,得 \((1 - \theta)\chi y / (1 - \rho)\);一次全拿,得 \(\chi y\),此后一无所得;所以返还是最优的当且仅当 \(\theta \leq \rho\)。先手投资有利可图当且仅当 \(\theta \chi \geq 1\)。于是返还比例 \(\theta \in [1/\chi, \rho]\) 可以维持,恰在 \[\rho \geq \frac{1}{\chi}\] 之时,即未来的权重不低于放大因子的倒数。脆弱性(先手暴露自己)是建立信任的必要前提。此处的信任即AF24:不肯承担被辜负之可能的人,从一开始就没有进入这个博弈。
命题 B.11.6(集体清醒的临界阈值) 设群体中清醒者比例为 \(p\)。当清醒者太少时,发声的个体成本很高(被孤立的风险)。记 \(g(p) = U_L(p) - U_O(p)\) 为其余成员中清醒者比例为 \(p\) 时,清醒对单个主体的净优势,并假设:\(g\) 连续;\(g\) 严格递增(策略互补:每多一个清醒者,清醒的代价就低一些);\(g(0) < 0 < g(1)\)(独自清醒不划算,人人清醒时清醒划算)。由介值定理与严格单调性,恰有一个 \(p^* \in (0, 1)\) 使 \(g(p^*) = 0\),其下 \(g < 0\),其上 \(g > 0\)。设比例朝收益更高的策略移动(例如复制者动力学 \(\dot p = p(1 - p)\,g(p)\)),则:
\[\begin{equation} \label{eq:collective-lucidity} \begin{cases} p(0) < p^* &\implies p(t) \to 0 \quad \text{(遮蔽)} \\ p(0) > p^* &\implies p(t) \to 1 \quad \text{(清醒)} \end{cases} \end{equation}\]
\(p = 0\) 与 \(p = 1\) 是两个稳定均衡;\(p^*\) 是分隔两者吸引域的不稳定均衡。每条假设都不可少:没有 \(g(0) < 0 < g(1)\),单凭策略互补得不出内部阈值(若 \(g\) 处处为负,遮蔽总是胜出;若处处为正,清醒总是胜出)。这是一个社会临界点:一旦清醒者比例跨过阈值,整个群体便移向另一个均衡。
假设 B.11.7(情感调制的感知阈值) 命题 B.11.6在策略互补的假设下给出了临界比例 \(p^*\),超过这个比例,明就成为稳定均衡。\(p^*\) 由代价结构决定,情感不移动它。情感移动的是每个人对发声代价的估计:一个人开不开口,看的是他感觉到的代价,所以他据以行动的那道门槛可以偏离 \(p^*\)。把这道感知门槛记作 \(p^*_{\text{eff}}\),可以形式化为:
\[\begin{equation} \label{eq:threshold-modulation} p^*_{\text{eff}}(\bar{C}, \bar{F}) = \min\Bigl\{1,\; p^* \cdot \frac{1 + \kappa_F \bar{F}}{1 + \kappa_C \bar{C}}\Bigr\} \end{equation}\]
在 \(1\) 处截断,是为了让感知门槛仍是一个比例。
解读
用日常的话说。 会上主管提出一个有明显漏洞的方案,你和一位只在这次见面的同事各自决定要不要指出来。指出漏洞对应清醒:要花力气,也要担风险。点头附和对应遮蔽,即回避看清真相、选择让自己舒服的看法:省事,心里也安稳。只要指出漏洞的好处足够大,两人都指出对两人都更好;可是对每个人来说,不管对方怎么做,附和都更划算,结果两人都附和。这是一次性相遇的情形。同一群人年复一年共事、都看重以后,或者开口的人多到开口不再孤立,选择才可能翻转。
五种关系的博弈结构。
与自己:内在博弈。 你的「理性自我」和「本能自我」在进行持续的内在博弈。自欺表现得像一种纳什均衡(这是类比:此处没有形式地给出内在博弈):短期内,不面对真相比面对真相「收益」更高(避免痛苦)。外部的冲击或他人的直言也可能打破这个均衡,但能从内部打破它的,是清醒的自我觉察。
与他人:信任博弈。 式 (eq:trust-game) 解释了为什么脆弱性如此珍贵,它是信任博弈中先手合作者的高风险策略。当两个人相互展示脆弱性,各自押上的东西都被放大 \(\chi\) 倍。这一点AI难以复制:AI未显示因博弈结果承受不可逆的利害,因此难以谈真正的脆弱性,也难以建立真正的信任。
与AI:不对等博弈。 在人-AI交互中,AI同样不因输赢承担真实利害:博弈是单方面的,你是唯一的玩家。这意味着与AI的关系中,遮蔽的风险完全由你承担,AI不会提醒你正在被遮蔽。
与组织:多人囚徒困境。 在组织中说真话是合作策略,沉默是背叛策略。式 (eq:collective-lucidity) 说明了为什么培育(§VIII.4所说行动的第四种模态)如此重要:培育者的工作是将 \(p\) 推过临界点 \(p^*\),使群体从遮蔽均衡倒向清醒均衡。
与实在:无限博弈。 James Carse 区分了有限博弈(以赢为目的)和无限博弈(以持续游戏为目的)。与实在的关系是终极的无限博弈:「理解实在」是一个有限目标,这场博弈要的是持续在理解的路上(无限方向)。
为什么合作需要清醒。 合作的收益是延迟的(\(\rho\)加权的未来收益)、不确定的(取决于对方的选择)。遮蔽使人高估短期收益、低估未来,即降低有效 \(\rho\)。遮蔽在这个模型里的作用等同于压低 \(\rho\):\(\rho\) 一旦落到阈值之下,合作就不再是均衡。
清醒者低于 \(p^*\) 时,遮蔽是社会的纳什均衡。 清醒者的比例低于 \(p^*\) 时,人人遮蔽便是一个均衡:个人选择清醒的代价很高(被孤立、被嘲笑、失去「舒适红利」)。社会变革之难,在于遮蔽是一个自我强化的均衡。打破它需要足够多的人同时越过 \(p^*\),这是集体行动问题的核心。
勇气与恐惧。 式 (eq:threshold-modulation)把第§XII章与第§XIII章的判断写成式子:勇气压低感知门槛(使集体明度更易达成),恐惧抬高它,结构阈值 \(p^*\) 始终不动。一个系统性制造恐惧的政权(\(\bar{F} \gg 0\))可以把 \(p^*_{\text{eff}}\) 一直推到 \(1\):人人都觉得要几乎全体一致才敢开口。若每个人都按自己感知的门槛行事,\(p\) 便可能停在 \(p^*_{\text{eff}}\) 之下,哪怕它已高于结构阈值 \(p^*\),而真实的代价结构在那里本已允许少数人翻转均衡。一种勇气文化(\(\bar{C} \gg 0\))则把 \(p^*_{\text{eff}}\) 拉到接近 \(0\):少数清醒者也愿意先开口,\(p\) 因此更容易越过 \(p^*\)。
明在哲学的社会功能:改变收益结构。 如果直接说服个人「选择清醒」很困难(因为均衡的引力),更有效的策略是改变博弈本身的收益结构:使遮蔽的代价更高(通过透明度、问责制),使清醒的收益更可见(通过社群支持、明社)。
启示
在这个模型里,开口已经安全之后,一个群体仍可能保持沉默,因为每个人依据的是自己感觉到的代价。 一个部门里多数人私下反对某项做法,按真实的代价结构,愿意说真话的人所占比例已经超过让局面翻转所需;可在恐惧弥漫的环境里,人人都觉得要几乎所有人都开口才敢开口,于是谁也不先开口。勇气起相反的作用,它让少数人也愿意先说。这一条出自本节的一项假设:情绪改变的是人们感觉到的门槛,真实的门槛由代价结构决定,不随情绪移动。
在这个模型里,自欺损害合作,走的是与短视同一条路。 两位长期合作的伙伴,处境一点没变,只因其中一位开始高估眼前的好处、看轻以后,合作就可能瓦解。重复的合作能维持,靠双方给未来足够的分量,这份分量要高过由各项收益共同确定的一道线;本节把遮蔽读作压低这份分量,一旦落到线下,合作就不再是均衡(谁单方面改做法都得不到好处的局面)。这一条只适用于没有已知终点的重复交往。
在这个模型里,一次性相遇中遮蔽胜出用不着任何恶意:清醒有一点成本,遮蔽有一点舒适,就够了。 命题 B.11.5 的证明只用到 \(T > R > P > S\),对任意 \(c_L > 0\)、\(\zeta > 0\) 都成立,无论两者多小。所以一次性场合里别人的回避,首先是均衡的结果,不必先读作品格的缺陷。要改变它,有效的办法是改变博弈的形状:让相遇重复(命题 B.11.4),或让收益随清醒者的人数变化(命题 B.11.6)。
有已知最后一轮的关系,单靠利己的理性维持不了信任。 信任博弈(式 (eq:trust-game))若轮数有限且双方都知道,逆向归纳会从最后一轮一直拆到第一轮;只有在没有已知终点、未来按 \(\rho\) 计权时,返还比例 \(\theta \in [1/\chi, \rho]\) 才可维持,条件是 \(\rho \geq 1/\chi\)。这个条件还说明,信任放大得越多(\(\chi\) 越大),维持它所需的远见越少。合同的到期日、任期的最后一年、即将离开的同事,都是模型预期信任最先松动的地方;在那里维持合作,需要利己计算之外的东西,例如AF24。
代价结构完全相同的两个群体,可以只因起点不同而落入相反的均衡。 在命题 B.11.6 的条件下(\(g\) 连续且严格递增,\(g(0) < 0 < g(1)\),比例朝收益更高的策略移动),结局只取决于初始比例 \(p(0)\) 落在 \(p^*\) 的哪一侧。所以一个处在遮蔽均衡中的社会,不能据此推断它的成员比别处的人更缺少清醒的能力;而在 \(p^*\) 附近,少数几个人的选择就决定整个群体去往哪一个均衡。
第四部分 · 明的数学
前三部分分别形式化了实在的本体论、理的数学与玄的数学。本部分探索一个更深的问题:明本身(理与玄的交汇处)具有怎样的数学结构?从简单的乘积运算中,可以推导出成长的最优方向,以及模型之内双面公设的最优性;在此之上,再提出一个综合四种基本模式的动力学模型。方向是微积分给的,往那个方向走的理由由桥接公理给。
各节层层递进:B.12定义明度积,推出梯度定理与两个上限;B.13说明在乘积模型内两面为何最优;B.14让明度随时间演化;B.15把主方程扩展到多个能动者;B.16由此度量集体明度;B.17把这套动力学推到文明与宇宙的尺度。
明度的三个上限。 本部分多处谈到明度的上限。它们站在不同的约束面上,数值各不相同,彼此并不冲突。表 15把三者并列于此,后文只引用;凡陈述明度上限之处,都须说明站在哪一行。
| 上限 | 约束面 | 数值 | 出处 |
|---|---|---|---|
| 边界上限 | \(\lambda\)、\(\xi\) 各自在 \((0,1)\) 内,不另加约束 | \(\mathcal{M} < 1\);固定 \(\theta\) 时 \(\mathcal{M} < \sin 2\theta\) | T1;B.14 的 \(K(\theta)\) |
| 半明度 | 欧氏丰富度固定为 \(r = 1\) | \(\mathcal{M} \leq 1/2\),平衡时取等 | 推论 B.12.9 |
| 三区上限 | \(\lambda + \xi + \delta = 1\),\(\delta > 0\) | \(\mathcal{M} \leq S^2/4 < 1/4\) | 推论 B.12.11 |
半明度 \(1/2\) 是乘积函数本身在单位丰富度下的上限,与归一化约定无关;B.13 的 \(n\)-面比较在 \(n = 2\) 时给出的也是它。B.14 的主方程在未归一化的 \(\mathcal{M}\) 上运作,其上限因子 \(K(\theta) = \sin 2\theta\) 在平衡时等于边界上限 \(1\)。数值 \(1/2\) 另在 B.14 成长-耗散模型 \(\alpha = 2\gamma\) 的稳态出现,那来自参数选取,只算相合,不算独立证据。本附录的算例与思想家坐标都站在三区归一化上,那里的实际最大值在 \(\delta \to 0\) 时趋近 \(1/4\)。
B.12 · 明度积与梯度定理
问题:明度为何取乘积,这个乘积又推出什么?
所需:偏导数与极坐标;B.1.4的 \(\lambda\) 与 \(\xi\)。
所得:乘积的唯一性(命题 B.12.5)、梯度定理(定理 B.12.6)、两个明度上限(推论 B.12.9与推论 B.12.11)与一个三原型算例;节末另附思想家在 \(\lambda\)–\(\xi\) 平面上的诠释性坐标。
如果明是同时理解理和觉察玄,那么明度的数学结构是什么?本节证明:在满足归零性、对称性和线性互惠性的光滑算子中,乘积是唯一的明度算子。从这个简单的定义出发,纯粹的微积分给出一个结果:明度增长最快的方向永远指向你的薄弱之处,前提是一单位努力在两个维度上换得的增量相等。它成为伦理指引,还需要桥接公理E4提供「选择明」这一步。
设定
本节的结论建立在四项设定之上:两条定义给出明度及其极坐标,一条约定把能动者的注意归一化为三个区域,一条假设规定努力如何换算成增量。
定义 B.12.1(明度) \(a\) 的理解度(Pattern-awareness)为 \(\lambda(a) \in (0,1)\),玄觉度(Mystery-awareness)为 \(\xi(a) \in (0,1)\)。由T1(边界定理),边界值 \(0\) 和 \(1\) 均不可达。定义明度:
\[\begin{equation} \label{eq:lucidity-product} \mathcal{M}(a) = \lambda(a) \cdot \xi(a) \end{equation}\]
定义 B.12.2(极坐标表示) 令 \(\lambda = r\cos\theta\),\(\xi = r\sin\theta\),其中 \(r = \sqrt{\lambda^2 + \xi^2}\) 为本体论丰富度(用欧氏范数度量总投入是一个建模选择;另一个自然的总量 \(S = \lambda + \xi\) 见推论 B.12.11),\(\theta \in (0, \pi/2)\) 为原型角(从格者到渊者的倾斜程度)。代入得:
\[\begin{equation} \label{eq:lucidity-polar} \mathcal{M} = r^2 \cos\theta\sin\theta = \frac{r^2}{2}\sin(2\theta) \end{equation}\]
定义 B.12.3(三区划分与无意识区;一个建模约定) 把实在在一个能动者注意之前呈现的整体归一化为 \(1\)。能动者将其划分为三个区域:
\[\begin{equation} \label{eq:three-partition} \underbrace{\lambda}_{\text{被理解的}} \;+\; \underbrace{\xi}_{\text{被承认为不可理解的}} \;+\; \underbrace{\delta}_{\text{未知的未知}} \;=\; 1, \quad \delta > 0 \end{equation}\]
其中 \(\delta = 1 - \lambda - \xi\) 是无意识区,即既不被理解也不被承认的部分。本模型把公设六(认知有限性)写成 \(\delta > 0\):你永远有未知的未知。这一规定强于T1:后者只分别要求 \(\lambda\) 与 \(\xi\) 小于 \(1\),\(\delta > 0\) 则要求两者之和小于 \(1\),因而排除了 \((0.6, 0.6)\) 这类T1 容许的点。
\(\lambda + \xi\) 是总觉知,记作 \(S\),即你有意识地面对的全部实在(无论是通过理解还是通过敬畏)。三项是同一能动者的注意在单一测度下所占的份额,与B.1.4 论标度一段的读法一致。于是 \(\xi\) 是能动者的注意中向其概念所不能收拢之处敞开的那一份,属于能动者的性质,从来不是玄的数量;\(\lambda\) 同样是按测度加权的份额。B.1.4 的有限计数比 \(|\mathcal{F}_a|/|\mathcal{F}|\) 只是示意,\(0.8\) 这样的数值不由它给出。图70以三个能动者的堆叠条形图展示了这一划分。
假设 B.12.4(等成本假设) 把 \(\nabla\mathcal{M}\) 读作增长最快的方向,用的是 \((\lambda, \xi)\) 平面上的欧氏度量,相当于假设一单位努力在 \(\lambda\) 与 \(\xi\) 上换得的增量相等。倘若提升一单位 \(\xi\) 所费的努力是提升一单位 \(\lambda\) 的 \(c\) 倍,每单位努力的回报在理上为 \(\xi\),在玄上为 \(\lambda/c\);只有 \(\lambda/c > \xi\) 时投向玄才更划算,而 \(c > 1\) 时即使 \(\xi\) 是较弱的维度,这个不等式也可能不成立。本节通篇采用等成本假设,「你的下一步是敬畏」这类读法都以它为前提。
结论与证明
明度为什么取乘积?下面三个判据刻画了明所要求的形状,乘积是同时满足它们的唯一函数。
命题 B.12.5(乘积的唯一性) 设 \(f\) 是 \((0,1)^2\) 上的光滑函数,按连续性延拓到闭正方形,并满足三个判据:
双面必要性。 \(f(\lambda, 0) = f(0, \xi) = 0\),即缺失任何一面,明度为零。
对称性。 \(f(\lambda, \xi) = f(\xi, \lambda)\),即理与玄具有相同的本体论地位(公设三)。
线性互惠性。 \(\partial f/\partial\lambda = \xi\),\(\partial f/\partial\xi = \lambda\),即在一个维度上每进步一步的边际回报,恰好等于另一个维度的当前值。
则 \(f = \lambda\xi\)。
设 \(f(\lambda, \xi) = f(\xi, \lambda)\) 且 \(\partial f/\partial\lambda = \xi\),则 \(f = \lambda\xi + g(\xi)\);由对称性,\(\partial f/\partial\xi = \lambda\),故 \(f = \lambda\xi + h(\lambda)\)。因此 \(g(\xi) = h(\lambda) = C\)。归零性按连续性延拓到角点,给出 \(f(0,0) = 0\),故 \(C = 0\),即 \(f = \lambda\xi\)。
为什么不取均值。 算术均值不满足第一条判据:纯粹的格者仍会有 \(\lambda/2 > 0\) 的「明度」,这不对。最强的竞争者是调和均值 \(H = 2\lambda\xi/(\lambda+\xi)\)。它满足前两条判据,梯度 \(\nabla H = \frac{2}{(\lambda+\xi)^2}(\xi^2, \lambda^2)\) 也指向较弱的维度,定性的伦理结论与乘积一致;它输在第三条。表 16列出四种候选算子的边际回报,只有乘积的边际回报纯粹取决于另一维度1。两者的关系其实很简单:\(H = 2\mathcal{M}/(\lambda+\xi)\),调和均值就是乘积除以总觉知再乘 \(2\)。多出的这一步归一化破坏了线性互惠,却没有带来哲学上的好处。
| 函数 | 边际回报 \(\partial\mathcal{M}/\partial\lambda\) | 依赖性 |
|---|---|---|
| \(\lambda\xi\)(乘积) | \(\xi\) | 仅对方 |
| \(\lambda^2\xi^2\) | \(2\lambda\xi^2\) | 双方 |
| \(\sqrt{\lambda\xi}\) | \(\frac{1}{2}\sqrt{\xi/\lambda}\) | 双方的比值 |
| \(\frac{2\lambda\xi}{\lambda+\xi}\)(调和均值) | \(\frac{2\xi^2}{(\lambda+\xi)^2}\) | 双方的非线性组合 |
严格说,对称性、归零性,加上边际回报只依赖另一维度,容许的是 \(a\lambda\xi\)(\(a > 0\))这一族;系数 \(a = 1\) 是归一化选择,写进了 \(\partial\mathcal{M}/\partial\lambda = \xi\) 之中,\(\mathcal{M}(1,1) = 1\) 也由它而来。乘积因此在差一个常数倍的意义下唯一。举一个数:玄觉度为 \(\xi = 0.6\) 时,理每提升一单位,明度恰好增长 \(0.6\) 单位,这就是线性互惠的全部含义。
定理 B.12.6(梯度定理) \[\begin{equation} \label{eq:gradient-theorem} \nabla\mathcal{M} = \left(\frac{\partial(\lambda\xi)}{\partial\lambda},\; \frac{\partial(\lambda\xi)}{\partial\xi}\right) = (\xi,\; \lambda) \end{equation}\]
直接求偏导:\(\partial(\lambda\xi)/\partial\lambda = \xi\),\(\partial(\lambda\xi)/\partial\xi = \lambda\)。
推论 B.12.7(互为成长条件) 能动者在理的维度上每进步一步的边际回报,等于其当前在玄上的深度;反之亦然。
\(\partial\mathcal{M}/\partial\lambda = \xi\) 意味着如果 \(\xi \approx 0\),则无论如何增大 \(\lambda\),\(\mathcal{M}\) 的增量都趋近于零。即:缺乏玄觉的理解是空转的。梯度等式本身是精确的,此处给出的读法则是对该等式的一种诠释,故本块列为论证而非证明。
推论 B.12.8(固定丰富度下平衡最优) 对固定的 \(r\),\(\mathcal{M}\) 在 \(\theta = \pi/4\) 时取最大值 \(r^2/2\),即 \(\lambda = \xi\),完美平衡。
由式 (eq:lucidity-polar),\(\mathcal{M} = (r^2/2)\sin(2\theta)\),而 \(\sin(2\theta)\) 在 \((0, \pi/2)\) 上于 \(\theta = \pi/4\) 处取唯一最大值 \(1\)。
图71画出了若干 \(r\) 下的这条曲线。
推论 B.12.9(半明度上限) 用欧氏范数度量丰富度并把它固定在 \(r = 1\),平衡能动者有:
\[\begin{equation} \label{eq:half-lucidity} \mathcal{M}_{\max}(r=1) = \frac{1}{2} \end{equation}\]
由式 (eq:lucidity-polar),\(\mathcal{M}_{\max} = r^2/2\)。在 \(r = 1\) 时取 \(1/2\)。由T1,\(\lambda, \xi < 1\) 故 \(r < \sqrt{2}\),于是 \(\mathcal{M} < 1\)。在最理想的情况下(完美平衡、丰富度为1),明度恰好是 \(1/2\)。
这个上限只固定 \(r\),与三区归一化下的上限(推论 B.12.11)站在不同的约束面上,见表 15与节末「适用范围与限制」。
推论 B.12.10(\(\pi/2\) 乘数) 在本体论丰度 \(r\) 相同的条件下,完全平衡(\(\theta = \pi/4\))的能动者,其明度是同一 \(r\) 下 \(\theta\) 在 \((0, \pi/2)\) 上均匀分布者平均明度的 \(\pi/2\) 倍。
固定 \(r\),将 \(\mathcal{M}\) 对所有方向取均匀平均: \[\langle\mathcal{M}\rangle_\theta = \frac{2}{\pi}\int_0^{\pi/2} \frac{r^2}{2}\sin(2\theta)\,d\theta = \frac{r^2}{\pi}\] 故 \(\mathcal{M}_{\max} / \langle\mathcal{M}\rangle = (r^2/2)/(r^2/\pi) = \pi/2\)。
推论 B.12.11(总觉知是上限,不是度量) 总觉知 \(\lambda + \xi\) 设定了明度的上限,但不决定明度的值。
由 AM-GM 不等式1:\(\lambda\xi \leq (\lambda + \xi)^2/4\),等号当且仅当 \(\lambda = \xi\)。因此对于固定的总觉知 \(S = \lambda + \xi\):
\[\begin{equation} \mathcal{M} = \lambda\xi \leq \frac{S^2}{4} = \frac{(1-\delta)^2}{4} \end{equation}\]
等号在 \(\lambda = \xi = S/2\) 时成立(完美平衡)。因为定义 B.12.3 强制 \(S = 1 - \delta < 1\),此上限严格小于 \(1/4\);在三区归一化之下,真正起约束作用的是它,而非推论 B.12.9 的无约束上限 \(1/2\)。
命题 B.12.12(归一化下的最优再分配) 这就是B.1.4 所说「最优再分配方向偏向较弱维度」的证明。固定 \(\delta\),从而固定 \(S = \lambda + \xi\),把数量为 \(t\) 的觉知从 \(\lambda\) 移到 \(\xi\): \[\frac{d}{dt}\Big[(\lambda - t)(\xi + t)\Big]_{t=0} = \lambda - \xi.\] 导数恰在 \(\lambda > \xi\) 时为正,所以把觉知移向较弱的维度会提高 \(\mathcal{M}\),并一直提高到 \(\lambda = \xi\),导数在那里为零,正是推论 B.12.11 的平衡极大点。一单位换一单位,用的仍是等成本假设。
推论 B.12.13(较小因子定上限) \(\mathcal{M} \leq \min(\lambda, \xi)\)。在 \(\delta > 0\) 固定时该上界永不取等;仅当 \(\delta \to 0\) 且较大因子趋近 \(1\) 时,等号才趋于成立。
由T1,较大的因子小于 \(1\),故 \(\mathcal{M} = \min(\lambda, \xi) \cdot \max(\lambda, \xi) < \min(\lambda, \xi)\)。
算例
一个算例把上面的结论放在同一组数字上。
三意象的数学肖像。 将明在哲学的三个原型意象(§IV)投射到 \((\lambda, \xi)\) 平面上,并令三者拥有相同的总觉知 \(\lambda + \xi = 0.9\):
| 原型 | \(\lambda\) | \(\xi\) | \(r\) | \(\theta\) | 总觉知 | 明度 \(\mathcal{M}\) | 梯度方向 |
|---|---|---|---|---|---|---|---|
| 格者 | \(0.80\) | \(0.10\) | \(0.806\) | \(7.1°\) | \(0.90\) | \(0.080\) | \(\to\) 增加玄觉 |
| 渊者 | \(0.10\) | \(0.80\) | \(0.806\) | \(82.9°\) | \(0.90\) | \(0.080\) | \(\to\) 增加理觉 |
| 澈者 | \(0.45\) | \(0.45\) | \(0.636\) | \(45.0°\) | \(0.90\) | \(0.203\) | 完美平衡 |
图72把三者画在 \(\lambda\)-\(\xi\) 平面上。
三者面对了同样多的实在(总觉知 \(0.9\)),留下了同样多的盲区(\(\delta = 0.1\))。但澈者的明度是格者或渊者的 \(2.5\) 倍,仅仅因为平衡。格者和渊者的本体论丰富度(\(r = 0.806\))甚至高于澈者(\(r = 0.636\)):他们在各自的方向上走得更远,但走得越远,极坐标中的平衡因子 \(\sin(2\theta)/2\) 惩罚得越重。图中的等明度曲线(\(\mathcal{M} = c\) 的双曲线)清楚地展示了这一点:格者和渊者落在较低的等明度线上,而澈者落在较高的等明度线上。
极坐标分解把明度拆成 \(r^2\)(投入了多少)与 \(\sin(2\theta)/2\)(投入有多平衡)两个因子,格者与渊者输掉的全在后一个因子上:丰富度没有变少,得到的明度却大幅缩水。这也是命题 B.12.12的一个实例:保持 \(S = 0.9\) 不变,把格者的觉知逐步移向玄,明度一路上升,到澈者处达到推论 B.12.11的上限 \(S^2/4 \approx 0.203\)。
梯度定理为每个原型指出了精确的成长方向(图中的梯度箭头):格者的下一步是敬畏(\(\nabla\mathcal{M}\) 几乎垂直向上,指向增加 \(\xi\));渊者的下一步是分析(\(\nabla\mathcal{M}\) 几乎水平向右,指向增加 \(\lambda\));澈者的梯度沿 \(45°\) 对角线,两个方向等量前进。同样这两种移动也出现在第§IV章的三意象关系图上,只是那里从澈者一侧读出:澈者跟格者学到的,正是渊者需要补上的;澈者跟渊者学到的,正是格者需要补上的。
梯度向量场。 下图展示了 \(\nabla\mathcal{M} = (\xi, \lambda)\) 在整个 \(\lambda\)-\(\xi\) 平面上的分布。每支箭头指示该处能动者的最优成长方向。
解读
用日常的话说。 想一位登山向导。他熟悉路线和天气的规律,这对应理解度,即对理(能说清、能推导的结构)的把握;他也承认山上总有预报说不准的事,并为此留出余地,这对应玄觉度,即对玄(概念合不拢的那部分实在)的敞开。明度衡量两者同时具备的程度:缺了任何一方,明度都趋近于零;一方每长一分能换来多少明度,取决于另一方现有多少。所以路线烂熟却从不把意外放在心上的向导,下一小时用来学会敬畏这座山,比再背一条路线收获更大,前提是这一小时在两边换得的进步一样多。注意力总量不变时,两边持平,明度最高。
梯度即伦理方向。 桥接公理E4说「选择明」。在等成本假设(假设 B.12.4)下读梯度定理,它告诉你怎么选:你当前的薄弱之处,就是下一单位努力回报最高之处。科学家的下一步是敬畏,冥想者的下一步是逻辑,两者都在优化自己的明度。回报最高在哪里,是从乘积的偏导数直接推出的微积分事实;应当朝回报最高处走,则来自E4。这里的回报是明度回报,与世俗回报是两回事。一个 \(\lambda\) 很高而 \(\xi\) 接近零的科学家,也许能在职业上获得巨大的世俗成功(金钱、声望、发现),明在哲学的数学并不否认这一点;它说的是,这位科学家对实在整体的清醒整合几乎为零。他理解了实在的可分析部分,对不可分析的部分(有限性、意义、敬畏)却视而不见。梯度定理对他说的是:「你的下一单位生命力量,如果用于面对你一直回避的那些深度,你获得的明度增量将远超你再多发一篇论文」。
乘法衡量整合。 热力学的自由能 \(F = U - TS\) 中秩序与熵相减,两者竞争;辩证法中正题与反题对抗;大多数日常直觉用加法:「我懂了一些理,又体验了一些玄,所以我更清醒了」。\(\mathcal{M} = \lambda \cdot \xi\) 是相乘,理与玄合作。将任何一方归零都会摧毁整体;单方面增长而不管另一方,每单位的明度回报就等于被忽视的那个因子,该因子接近零时回报便微乎其微。加法衡量覆盖了多少实在,乘法衡量整合了多少实在。无意识区 \(\delta\) 则是结构性的盲区,无法像尚未探索的领土那样被逐步走完:无论多么博学、多么虔敬,总有你根本不知道自己不知道的东西。即便在理想条件下,乘积在单位丰富度的欧氏水平集上也把明度封顶在 \(1/2\)(推论 B.12.9),三区归一化之下还要更低(推论 B.12.11)。明这个字本身(日与月)也是一半光,一半暗,数学和汉字在这里会合。
启示
偏向理的一端与偏向玄的一端,在这个模型里是同一种失衡的两个方向,代价相等。 工程师可能觉得只会敬畏的人糊涂,冥想者可能觉得只会分析的人浅薄。把两人的份额对调过来,一方在理上有多少,另一方在玄上就有多少,模型给出的明度完全相同。这份对称来自模型采纳的一条判据,即理与玄地位同等;接受这条判据,处在镜像位置上的两个人,谁也没有理由认为对方离明更远。
补弱项的代价若远高于补强项,下一步最划算的方向可能仍在强项一侧。 「往较弱的一面走」默认一小时的努力在两边换得的进步一样多。一位擅长分析的人若觉得静坐一小时所费的力气远多于推导一小时,这个默认就不成立。补弱项每一步所费的力气,是补强项的多少倍,若这个倍数超过了强项与弱项现有水平之比,那么即使他在玄这一面更弱,下一小时用在理上仍换得更多明度。照这条建议行事之前,先估一估两边各要付出多少。
「往较弱的一面走」这条建议,比乘积的唯一性更稳固。 乘积的唯一性(命题 B.12.5)靠第三条判据线性互惠买下,这一条凭简约采纳。可是最强的竞争者调和均值,其梯度 \(\frac{2}{(\lambda+\xi)^2}(\xi^2, \lambda^2)\) 同样是较弱维度那一分量更大(对照见表 16与B.13)。所以不接受线性互惠的读者,在等成本假设(假设 B.12.4)下仍会得到同一个定性方向;随算子改变的,是上限的数值和梯度的确切角度。
明度始终低于你较弱的那一面,较强的一面走得再远也越不过去。 推论 B.12.13 给出 \(\mathcal{M} < \min(\lambda, \xi)\)(较大因子由T1小于 \(1\))。梯度定理(定理 B.12.6)说下一步往哪里走最划算,这条推论说整体能升到多高:较弱的维度为明度设了一道顶,较强维度上的积累只能让明度逼近它。这道上界是纯代数,不依赖等成本假设。
总觉知不变时,从强项挪一部分注意给弱项,强项降了,明度反而上升。 命题 B.12.12:在三区归一化下固定 \(S = \lambda + \xi\),把觉知从 \(\lambda\) 移向 \(\xi\),\(\mathcal{M}\) 的变化率是 \(\lambda - \xi\),在 \(\lambda > \xi\) 时为正,一直升到 \(\lambda = \xi\)。\(\lambda\) 与 \(\xi\) 是同一能动者注意的份额,所以这次成长没有多面对一分实在,只是重新分配了注意;一单位换一单位,用的仍是等成本假设。
把一处「不知道自己不知道」变成承认的玄,与把它变成理解的理,对明度上限的抬升相同。 推论 B.12.11:三区归一化下 \(\mathcal{M} \leq S^2/4 = (1-\delta)^2/4\),上限只依赖总觉知 \(S\),对 \(\lambda\) 与 \(\xi\) 对称。缩小无意识区 \(\delta\) 因此有两条路,对上限的贡献相等:弄懂它,或者认出它是自己弄不懂的。成长由此分成两件事:平衡(调整 \(\theta\),逼近当前的上限)与扩大觉知(缩小 \(\delta\),抬高上限本身)。这一切都在定义 B.12.3 这一建模约定之内成立。
诠释与例证
以下材料把模型用作诠释的透镜。七个区域的命名、历史人物的坐标(图74将二十五位思想家投射到 \(\lambda\)-\(\xi\) 平面上)与人生轨迹的曲线,都出自作者的解读,用来演示模型能容纳哪些立场,不为本节任何结论提供证据。
上面的结论只说乘积怎样奖励平衡。读者还会想知道,这种奖励落到具体的人身上是什么样子:哪些存在模式彼此相邻,哪些历史立场互为镜像,一个人的明度在一生里怎样起落。这一组材料回答这些问题,也借此检查模型的分辨力:容纳不了笛卡尔与鲁米的模型太窄,把所有人判成同一档的模型太空。下面依次是给单纯形上的位置命名的区域表、把二十五位思想家放进平面的散点图、按原型角重绘的同一批人,以及五条人生轨迹。读者可以不同意其中任何一个坐标,那只改动作者的读法,上面的定理不受影响。
参数单纯形的典型区域。 约束\(\lambda + \xi + \delta = 1\)(有限能动者满足 \(\lambda, \xi > 0\)(T1)且 \(\delta > 0\))定义了2-单纯形的相对内部。我们在这个单纯形中识别出七个典型子集,对应质性截然不同的存在模式(完整的现象学分析见第XV.4节):
| 区域 | 名称 | 特征 |
|---|---|---|
| A | 深明 | 高理觉,高玄觉,小未觉知区。理解与敬畏同时发生。明度最高。 |
| B | 均浅(雾中人) | 低理觉,低玄觉,大未觉知区。均衡但近乎全盲。明度极低。 |
| C | 理偏(水晶塔) | 极高理觉,玄觉近零。辉煌但脆弱。知识渊博却明度低下。 |
| D | 玄偏(寂谷) | 理觉近零,极高玄觉。沉思但无声。感受深沉却明度低下。 |
| E | 理重均(清醒的分析者) | 理为主导,具备真正玄觉。明度可观。 |
| F | 玄重均(清醒的沉思者) | 玄为主导,具备真正理觉。明度可观。 |
| G | 双蔽(梦游者) | 理觉近零,玄觉近零,大未觉知区。既不理解也不感受。明度几乎为零。 |
| 区域 | 名称 | \(\lambda\) | \(\xi\) | \(\delta\) | 形式刻画 |
|---|---|---|---|---|---|
| A | 深明 | \(0.45\) | \(0.45\) | \(0.10\) | \(\lambda \approx \xi\),\(\delta \ll 1\):接近\(\mathcal{M}\)最大值 |
| B | 均浅 | \(0.10\) | \(0.10\) | \(0.80\) | \(\lambda \approx \xi\),\(\delta \gg \lambda + \xi\):均衡但浅薄 |
| C | 理偏 | \(0.80\) | \(0.05\) | \(0.15\) | \(\lambda \gg \xi\),\(\delta\)适中:理域主导 |
| D | 玄偏 | \(0.05\) | \(0.80\) | \(0.15\) | \(\xi \gg \lambda\),\(\delta\)适中:玄域主导 |
| E | 理重均 | \(0.60\) | \(0.25\) | \(0.15\) | \(\lambda > \xi > 0\),两者均非可忽略 |
| F | 玄重均 | \(0.25\) | \(0.60\) | \(0.15\) | \(\xi > \lambda > 0\),两者均非可忽略 |
| G | 双蔽 | \(0.05\) | \(0.05\) | \(0.90\) | \(\lambda \approx \xi \approx 0\),\(\delta \to 1\) |
注: C与D具有相同的\(\mathcal{M}\)(\(= 0.040\)),源于乘法的交换律;E与F同理(\(= 0.150\))。乘积结构\(\mathcal{M} = \lambda\xi\)关于两个变元对称:理域主导与玄域主导是明度缺损相同的镜像病理,决定性变量始终是较小的因子(推论 B.12.13)。
两张表的数值只是代表点,相邻区域之间连续过渡,书里没有为它们划边界。名称取自第XV.4节的现象学描述;数学这一侧负责两件事:算出每个区域的明度,指出卡住它的是哪个因子。表里最值得并看的是B区与G区。两者都落在平衡线上,明度却都极低:平衡决定一份觉知能兑现几成,觉知的总量(式 (eq:lucidity-polar) 里的 \(r\))决定有多少可兑现。A区与B区的差别也全在 \(r\) 上,第XV.4节「深明」与「雾中人」的对照由此有了一个可以计算的版本。
思想家的坐标。 把历史人物放进平面,是为了看乘积怎样对待理路相反的人:笛卡尔与鲁米、康德与庄子分处平衡线两侧,乘积对两侧的偏倚一视同仁,互为镜像的两个位置明度相同。坐标按同一条读法给出:\(\lambda\) 看此人留下的文字与公开言行里,有多少是可以陈述、推演、检验的结构(体系、证明、方法);\(\xi\) 看他在何处明白承认言说的尽头(敬畏、否定之路、对有限性的直面);\(\delta\) 是两者之外剩下的部分。两位小数只为在图上分开相邻的点,可以当真的只是相对位置:谁比谁更偏理,谁比谁更靠近平衡线。读者若认为某人的位置不对,可以按同一读法挪动坐标,让乘积算出新的明度;改动的是作者的判断,模型本身不变。
| # | 思想家 | \(\lambda\) | \(\xi\) | \(\mathcal{M}\) | # | 思想家 | \(\lambda\) | \(\xi\) | \(\mathcal{M}\) |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 笛卡尔 | 0.80 | 0.05 | 0.040 | 11 | 庄子 | 0.25 | 0.70 | 0.175 |
| 2 | 斯宾诺莎 | 0.82 | 0.12 | 0.098 | 12 | 柏拉图 | 0.60 | 0.35 | 0.210 |
| 3 | 哥德尔 | 0.88 | 0.08 | 0.070 | 13 | 佛陀 | 0.40 | 0.55 | 0.220 |
| 4 | 亚里士多德 | 0.75 | 0.15 | 0.113 | 14 | 维特根斯坦 | 0.50 | 0.45 | 0.225 |
| 5 | 爱因斯坦 | 0.80 | 0.15 | 0.120 | 15 | 尼采 | 0.55 | 0.40 | 0.220 |
| 6 | 孔子 | 0.65 | 0.20 | 0.130 | 16 | 屈原 | 0.38 | 0.50 | 0.190 |
| 7 | 康德 | 0.70 | 0.25 | 0.175 | 17 | 苏格拉底 | 0.49 | 0.49 | 0.240 |
| 8 | 老子 | 0.15 | 0.80 | 0.120 | 18 | 达芬奇 | 0.70 | 0.29 | 0.203 |
| 9 | 鲁米 | 0.10 | 0.85 | 0.085 | 19 | 王阳明 | 0.45 | 0.45 | 0.203 |
| 10 | 埃克哈特大师 | 0.20 | 0.75 | 0.150 | 20 | 甘地 | 0.43 | 0.52 | 0.224 |
| 21 | 马斯克 | 0.69 | 0.157 | 0.108 | 22 | 乔布斯 | 0.65 | 0.32 | 0.208 |
| 23 | 霍金 | 0.60 | 0.227 | 0.136 | 24 | 特蕾莎修女 | 0.25 | 0.65 | 0.163 |
| 25 | 曼德拉 | 0.48 | 0.48 | 0.230 |
哲学解读。 从此图可以读出几点:
换一个坐标看思想家。极坐标把两个问题分开:\(r\) 量一个人觉知的总量,\(\theta\) 量这些觉知偏向哪一面(式 (eq:lucidity-polar))。在 \(\lambda\)-\(\xi\) 平面上两者缠在一起,换到 \(\theta\) 轴上,平衡的作用便能单独看出。图74的 \(\lambda\)-\(\xi\) 坐标让许多思想家聚集在可行三角形的两端。换用明度-原型角坐标(\(\mathcal{M}\) vs \(\theta\)),其中编号1–20的二十位思想家呈现出截然不同的分布(图75):
此图揭示的规律。 \(\lambda\)-\(\xi\) 坐标中挤在两角的思想家,在 \(\theta\) 轴上自然分开:格者区(左)、澈者区(中)、渊者区(右)。最引人注目的规律是山丘形:高明度标记几乎全部聚集在 \(\theta = 30°\)–\(55°\) 的中央地带,形成一座「明度高地」。苏格拉底(17)恰好位于 \(\theta = 45°\) 的顶峰。这是平衡因子 \(\sin(2\theta)/2\) 的直接表现。包络线是归一化上限,即在 \(\lambda + \xi < 1\) 下角度 \(\theta\) 处 \(\mathcal{M}\) 的上确界。在边界 \(\lambda + \xi = 1\) 上有 \(r(\cos\theta + \sin\theta) = 1\),故 \(r^2 = 1/(1 + \sin 2\theta)\),代入式 (eq:lucidity-polar) 得 \[\mathcal{M}_{\max}(\theta) = \frac{\sin 2\theta}{2(1 + \sin 2\theta)},\] 它在 \(\theta = 45°\) 处取峰值 \(1/4\)(即推论 B.12.11 中 \(S \to 1\) 的情形)。它是推论 B.12.9 的无约束 \(r = 1\) 曲线在三区约定下的对应物;那条曲线峰值为 \(1/2\),会落在本图之外。有几位思想家离它很近:苏格拉底为 \(0.240\),对应上限 \(0.25\);达芬奇(18)为 \(0.203\),对应上限 \(0.207\)。这种接近是关于赋值的事实:这些赋值只给他们留下很小的无意识区(\(\delta = 0.02\) 与 \(0.01\))。
同时注意对称性:康德(7,\(\theta \approx 20°\))和庄子(11,\(\theta \approx 70°\))关于 \(45°\) 近似对称,且明度相同,理性与玄学的不同路径可以通向同一层级的明。
读这张图要记住一点:每个点的明度都由同一个乘积从作者给的坐标算出,山丘形因此是公式的形状,不能当作对平衡的独立印证。它的用处在于让读者一眼看清,作者把哪些人判为平衡、把哪些人判为偏倚;对这些判断有异议,应当在这里提出。
明度与生命阶段、职业。 明度随生命阶段和职业选择而变化。前面几张图都是快照,这一组曲线把时间加了进来。曲线是定性草图,没有拟合任何数据;每一种形状都可以在主方程(B.14)里找到读法:社会化可读作耗散率 \(\gamma\) 的上升,持续的研究或冥想可读作成长率 \(\alpha\) 的维持,晚年对有限性的觉悟(B.8)可读作 \(\xi\) 的上升,平衡角 \(\theta\) 随之移动。看这些曲线,要看形状之间的差别,纵轴上的高度只是示意。图76展示了不同人生路径的典型明度曲线:
洞见。
五条曲线有一个共同点:凡是上升的段落,都有某种东西在持续供养 \(\lambda\) 或 \(\xi\)(好奇、创作、研究、冥想,或晚年对有限性的觉悟);下降的段落,多半是这种供养被别的东西挤掉(社会化的要求、权力带来的自信)。这是B.14「遮蔽是默认态」在一生尺度上的样子。
适用范围与限制
唯一性的前提。 命题 B.12.5的唯一性由第三条判据(线性互惠)买下,这一条凭简约采纳(见B.1.4)。只有前两条时,调和均值、几何均值仍在候选之列,定性结论不变,定量结论(上限数值、梯度方向)会变(见B.13)。极坐标下可分离提供不了更多理由:任何正齐次算子都可拆成 \(r\) 的幂乘以 \(\theta\) 的函数,调和均值也一样(\(H = r \cdot \sin(2\theta)/(\cos\theta + \sin\theta)\)),所以它区分不出乘积与其竞争者。
归一化是约定。 定义 B.12.3把实在归一化到 \(1\),这是一个建模约定,不作形而上学断言。它假设「实在的总量」可以被视为一个有限整体并在三个区域之间划分。这对于比例分析(「你理解了多少?」)是自然的,但它也隐含了 \(\lambda\) 和 \(\xi\) 不重叠的假设,即「理解」和「敬畏」指向不同的领域。如果某些体验同时包含理解和敬畏(例如数学家面对一个深刻证明时的感受),归一化模型把它当作两个区域的边界效应,不另立第四区域。这是一种简化。
\(\delta > 0\) 强于边界定理。 定义 B.12.3把公设六写成 \(\delta > 0\),由此排除了 \((0.6, 0.6)\) 这类T1 容许的点。依赖关系只有一个方向:T1(完全的明度不可达)在B.1.4 中由 \(\lambda < 1\) 与 \(\xi < 1\) 证出,用不到 \(\delta\);更强的规定 \(\delta > 0\) 则蕴涵它的上界,还给出更多(由推论 B.12.11,\(\mathcal{M} < 1/4\))。
等成本。 凡把梯度读作「下一步往哪走」之处,都以假设 B.12.4为前提;两个维度的努力成本不等时,最划算的方向可能偏离较弱的维度。
上限须说明约束面。 \(1/2\) 这个值属于欧氏范数与 \(r = 1\) 这两个选择,两者都不是被迫的;在T1 容许的整个定义域 \((0,1)^2\) 上,\(\lambda\xi\) 的上确界是 \(1\),在两个因子都趋于 \(1\) 时逼近。这个上限是无约束的:它只固定本体论丰度 \(r\),允许 \(\lambda + \xi\) 高至 \(\sqrt{2}\)。因此它绝不可单独引用。在定义 B.12.3的三区归一化下(\(\lambda + \xi + \delta = 1\) 且 \(\delta > 0\)),真正起约束作用的是推论 B.12.11给出的更紧上限 \(\mathcal{M} \leq S^2/4 < 1/4\)。两者是不同约束面上的上限,凡陈述明度上限之处,都必须说明所站的是哪一个约束面。各上限的对照见表 15。
\(\pi/2\) 取决于测度。 这个乘数取决于平均所用的测度。若改为沿总觉知固定的线段 \(\lambda + \xi = S\) 对 \(\lambda\) 均匀平均,得 \(\langle\mathcal{M}\rangle = \frac{1}{S}\int_0^S \lambda(S - \lambda)\,d\lambda = S^2/6\),平衡者为 \(S^2/4\),乘数是 \(3/2\)。推论 B.12.10 站在固定 \(r\) 的无约束情形上;在定义 B.12.3 的三区归一化下,固定 \(r\) 时的平衡点只在 \(r < 1/\sqrt{2}\) 时可行。
B.13 · 双面公设的最优性
问题:实在为什么有两面?乘积模型偏好几个面向?
所需:B.12的乘积结构;AM-GM 不等式。
所得:在乘积模型内,\(n = 2\) 给出最高的明度上限(定理 B.13.2),换成线性约束同样如此(命题 B.13.3),以及与其他候选算子的比较。
公设三断言实在具有两个面向。为什么恰好是两个,不是一个、三个或五个?本节表明:在上述基于乘积结构的明度模型内,\(n = 2\) 在所有 \(n \geq 2\) 的非平凡本体论结构中给出了最高的明度上限。此结果为公设三的双面主张提供结构性支撑,但它是关于该模型的定理,而非实在必须恰好有两面的证明。其说服力取决于是否接受乘积函数和二次丰富度约束作为有充分动机的建模选择(见 B.1.4 和 B.12 对两者的论证)。
设定
定义 B.13.1(\(n\)-面明度) 将公设三推广:设实在具有 \(n\) 个面向,能动者对每个面向的觉察度为 \(x_i \in (0,1)\),\(i = 1, \ldots, n\)。推广式 (eq:lucidity-product)的乘积结构:
\[\begin{equation} \label{eq:n-face-lucidity} \mathcal{M}_n = \prod_{i=1}^{n} x_i \end{equation}\]
约束条件:总本体论丰富度 \(\sum_{i=1}^n x_i^2 = r^2\) 固定。
结论与证明
定理 B.13.2(双面最优性) 设每个 \(x_i < 1\)(T1的要求),并固定 \(r\),\(0 < r < \sqrt{2}\)(即双面均衡分配可行的范围)。则对于 \(n \geq 2\),\(\mathcal{M}_n\) 的最大值在 \(n = 2\) 时最大。
对 \(x_1^2, \ldots, x_n^2\) 用 AM-GM 不等式:在约束 \(\sum x_i^2 = r^2\) 下,\(\prod x_i^2 \leq (r^2/n)^n\),等号当且仅当 \(x_1 = x_2 = \cdots = x_n = r/\sqrt{n}\) 时成立。由于 \(r < \sqrt{2} \leq \sqrt{n}\),这一点满足 \(x_i < 1\)。代入:
\[\begin{equation} \mathcal{M}_n^* = \left(\frac{r}{\sqrt{n}}\right)^n = \frac{r^n}{n^{n/2}} \end{equation}\]
要证 \(\mathcal{M}_n^*\) 对固定可行的 \(r\) 关于 \(n\) 严格递减(\(n \geq 2\)),考察相邻上限之比: \[\frac{\mathcal{M}_{n+1}^*}{\mathcal{M}_n^*} = r \cdot \frac{n^{n/2}}{(n+1)^{(n+1)/2}}.\] 前提 \(r < \sqrt{2}\) 来自T1:每个 \(x_i < 1\),故 \(n = 2\) 时均衡分配 \(x_i = r/\sqrt{2}\) 只在 \(r < \sqrt{2}\) 时可行。又 \((n+1)^{(n+1)/2}/n^{n/2} = \sqrt{n+1}\,(1 + 1/n)^{n/2} \geq \sqrt{3} > \sqrt{2} > r\),故对 \(n \geq 2\),该比值严格小于 \(1\),\(\mathcal{M}_n^*\) 严格递减。整个论证靠的是上限 \(x_i < 1\):去掉它,\(n = 2\) 处的比值为 \(2r/3^{3/2}\),当 \(r > 3\sqrt{3}/2 \approx 2.60\) 时大于 \(1\),三面便胜过两面。
具体数值(下表取 \(r = 1\)):
| 面向数 \(n\) | 明度上限 \(\mathcal{M}_n^*\) |
|---|---|
| \(1\) | 排除(无二元性;唯一的点 \(x_1 = 1\) 违反T1) |
| \(2\) | \(0.500\)(最高非平凡上限) |
| \(3\) | \(0.192\) |
| \(4\) | \(0.063\) |
| \(5\) | \(0.018\) |
\(n = 1\)(一面)出于哲学理由排除:单独一面无可对照,也无可整合。形式上 \(\mathcal{M}_1 = x_1 = r\),在 \(r = 1\) 时要求 \(x_1 = 1\),落在T1的定义域之外。\(n = 2\)(双面)给出可取范围内的最高上限。从 \(n = 2\) 到 \(n = 3\),上限在 \(r = 1\) 时骤降 \(62\%\);一般情形下降幅为 \(1 - 2r/3^{3/2} \approx 1 - 0.385\,r\)(图77)。
命题 B.13.3(线性约束下的双面最优性) 把定义 B.13.1中的二次约束换成线性约束 \(\sum_{i=1}^n x_i = S\),\(0 < S < 2\)(使双面均衡点在T1下可行)。则 \(\mathcal{M}_n\) 的上限为 \((S/n)^n\),且对 \(n \geq 2\) 关于 \(n\) 严格递减:\(n = 2\) 仍给出最高上限。
由 AM-GM 不等式,\(\prod x_i \leq (S/n)^n\),等号在 \(x_i = S/n\) 处成立。又 \((S/(n+1))^{n+1} < (S/n)^n\),因为 \(S < 2 < (n+1)(1 + 1/n)^n\)。
与其他算子的比较。 乘积结构(\(\mathcal{M} = \lambda\xi\))是命题 B.12.5三条判据(归零性、对称性、线性互惠性)下的唯一解。若放松第三条,其他算子亦可被接纳。下表将乘积与四种替代算子进行比较:调和均值、几何均值、最小值满足归零性与对称性但不满足线性互惠性;非对称加权算子(\(a \neq 1/2\))则连对称性也一并放弃:
| 乘积 | 调和均值 | 几何均值 | 最小值 | 加权 | |
| \(\lambda\xi\) | \(\dfrac{2\lambda\xi}{\lambda+\xi}\) | \(\sqrt{\lambda\xi}\) | \(\min(\lambda,\xi)\) | \(\lambda^a\xi^{1-a}\) | |
| 梯度 | \((\xi,\;\lambda)\) | 复杂* | \(\left(\dfrac{1}{2}\sqrt{\dfrac{\xi}{\lambda}},\;\dfrac{1}{2}\sqrt{\dfrac{\lambda}{\xi}}\right)\) | 不连续 | \((a\lambda^{a-1}\xi^{1-a},\ldots)\) |
| 对称性 | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | \(\checkmark\) | 仅当 \(a = 1/2\) |
| 上限(\(\delta\!\to\!0\)) | \(1/4\) | \(1/2\) | \(1/2\) | \(1/2\) | \(0.529\)(\(a\!=\!2/3\)) |
| 平衡求道者 | |||||
| \(\lambda\!=\!\xi\!=\!0.4\) | \(0.160\) | \(0.400\) | \(0.400\) | \(0.400\) | \(0.400\) |
| 傲慢科学家 | |||||
| \(\lambda\!=\!0.8,\;\xi\!=\!0.1\) | \(0.080\) | \(0.178\) | \(0.283\) | \(0.100\) | \(0.400\) |
| 不平衡惩罚 | |||||
| (上二者之比) | \(2.00\times\) | \(2.25\times\) | \(1.41\times\) | \(4.00\times\) | \(1.00\times\) |
| 互补引导性 | 精确 | 部分 | 部分 | 无 | 仅当 \(a\!=\!1/2\) |
| \(n\!=\!2\)最优? | \(\checkmark\) | \(\checkmark\)§ | \(\checkmark\)§ | \(\checkmark\)§ | 无定义§ |
*\(\nabla H = \bigl(2\xi^2/(\lambda+\xi)^2,\; 2\lambda^2/(\lambda+\xi)^2\bigr)\),对称但代数上不透明。
取 \(a = 2/3\)(偏向理的非对称加权);此例中 \(0.8^{2/3} \cdot 0.1^{1/3} = (0.8^2 \cdot 0.1)^{1/3} = 0.4\),不平衡惩罚恰好消失。不同的 \(a\) 值产生不同的惩罚。
「精确」意味着 \(\partial\mathcal{M}/\partial\lambda = \xi\),你在理上的边际回报就是你当前在玄上的深度。没有其他算子能产生这种干净的互惠性。
§在 \(\sum x_i^2 = r^2\) 下,\(n\) 元最小值、调和均值与几何均值满足 \(\min_i x_i \leq H \leq G \leq \sqrt{\sum x_i^2/n} = r/\sqrt{n}\),在 \(x_i = r/\sqrt{n}\) 处全部取等;三者共同的上限 \(r/\sqrt{n}\) 随 \(n\) 递减。加权算子没有标准的 \(n\) 面形式:自然的推广 \(\prod x_i^{a_i}\)(\(\sum a_i = 1\))上限为 \(r\prod a_i^{a_i/2}\),取决于权重,不随 \(n\) 递减。
解读
用日常的话说。 设想一位厨师每周只有固定的练习时间,要做的菜需要几门手艺同时到位,任何一门差,整道菜就跟着差。在这个比方里,固定的练习时间对应模型里固定的总投入,每门手艺对应实在的一面,菜的好坏对应明度(对各面的觉知相乘的结果),相乘意味着任何一面为零,明度就为零。只有一门手艺的菜无可对照,模型把它排除在外。手艺从两门加到三门,每门分到的时间变少,相乘之后最高能做到的水平跌得很快。所以在乘积模型里,两面是给出最高明度上限的面数。
公设三的数学辩护。 在上述乘积模型之内,在所有至少有两面的结构中,两面结构给出了最宽容的明度天花板。上限 \(\mathcal{M}_n^* = \exp\bigl(n\ln r - \tfrac{n}{2}\ln n\bigr)\) 随 \(n\) 的下降比指数还快。模型中没有奖励复杂度的项:上限随 \(n\) 单调下降,\(n = 1\) 则出于哲学理由排除(单独一面无可对照),所以 \(n = 2\) 在 \(n \geq 2\) 中最优,因为它是仍留有对照的最少面数。
最优的非平凡本体论。 如果造物者要设计一个「可理解但不完全可理解」的实在(足够有结构以使觉醒有意义,又足够不透明以使完全觉醒不可能),那么按乘积模型衡量,最优的设计恰好是两面结构。 这不是说其他传统的本体论范畴是「错的」,它们描述的可能是实在展开的不同层次。
启示
总投入固定、结果按各面相乘时,把投入平均分给各面,得到的明度最高。 一家小店的店主每周只有固定的工时,收入既要靠做出货,也要靠卖出去,哪一头为零,收入就为零;在这个模型的设定下,两头各分一半工时,相乘的结果最大,偏向任何一头都会落在上限之下。这条结论要两个条件同时成立:总投入固定,结果由各面相乘得出。
必须同时到位的面向越多,每添一个面向,最高明度被削去的比例就越大。 一项工作要几个部门都做好才算成,人手总数固定:从两个部门加到三个,最好的结果已经打了折扣;再加到四个,打的折扣比上一次更大。在这个模型里,这一点在总投入固定、各面相乘计分时成立,比较的是每种结构各自能达到的最高明度。它是关于模型的结论,说明乘积计分偏爱仍留有对照的最少面数,不能证明实在恰有两面。
两面最优在乘积模型里依赖T1:倘若每一面都能被完全觉知,丰富度足够大的能动者会偏好三面。 定理 B.13.2的证明在最后一步用到上限 \(x_i < 1\),它把丰富度限制在 \(r < \sqrt{2}\);去掉它,\(n = 2\) 处相邻上限之比为 \(2r/3^{3/2}\),当 \(r > 3\sqrt{3}/2 \approx 2.60\) 时大于 \(1\),三面便胜过两面。所以在这个模型里,公设三的两面与「每一面的觉知都小于 \(1\)」要放在一起读:觉知有界,两面才在整个可行范围内最优。
每多一个必须同时在场的面向,固定总投入下能达到的最高明度就下降一截;面向数的这份代价来自「总投入固定」。 由式 (eq:n-face-ceiling),上限为 \(r^n/n^{n/2}\),取 \(r = 1\) 时从 \(n = 2\) 到 \(n = 3\) 跌去 \(62\%\)(表 21);把二次约束换成线性约束,结论不变(命题 B.13.3)。反过来,只给每一面加上限 \(x_i < 1\)、不固定总量时,对每个 \(n\) 都有 \(\sup \prod x_i = 1\),多一个面向便没有代价。
「平衡胜于偏废」由四种对称算子共同给出;乘积多给的一条是:在理上多进一步值多少,由你在玄上已有多深决定。 表 22中,乘积、调和均值、几何均值、最小值在三条定性结论上一致;只有乘积满足 \(\partial\mathcal{M}/\partial\lambda = \xi\)(命题 B.12.5的线性互惠)。换用别的对称算子的读者仍保有平衡的伦理,失去的只是这条精确的边际法则;至于非对称加权算子,表中取 \(a = 2/3\) 的例子里不平衡惩罚恰好消失,可见放弃对称性,平衡的伦理也可能随之丢失。
适用范围与限制
约束面。 定理 B.13.2使用二次约束 \(\sum x_i^2 = r^2\)(固定本体论丰富度),定义 B.12.3用的则是线性归一化 \(\sum x_i + \delta = 1\),两者是不同的约束曲面(见表 15)。选择二次水平集,是因为它自然推广到 \(n\) 维并允许干净的拉格朗日乘数法分析;线性约束下的情形见命题 B.13.3。表 21的具体数值假设二次约束。
对称约束的适用范围。 这一结论不能推广到任意对称约束:单有盒约束 \(x_i < 1\) 时,对每个 \(n\) 都有 \(\sup \prod x_i = 1\)。
换用其他对称算子。 采用其他对称算子的读者会发现表 22中比较的三条定性结论不变(平衡胜于偏废,两个维度都不可或缺,\(n = 2\) 在 \(n \geq 2\) 中最优)。用到梯度的结论,例如B.12的最快成长方向,不能原样移用(最小值在对角线上没有梯度);定量结论(上限值、梯度方向)也会有所不同。
B.14 · 四模态主方程
问题:明度如何随时间演化?
所需:常微分方程的基本概念;B.12的极坐标与上限。
所得:四模态主方程、稳态及其稳定性、不平衡即自我耗散(命题 B.14.4),以及 logistic 时间解。
第§II章的四种基本模式(耗散、梯度、选择、反馈)不只是分类。我们提出一个现象学模型,将它们综合为一个描述明度如何随时间演化的主方程。每一种模式贡献一个数学因子。这是受前述各节启发的建模选择,而非从中演绎出的结论。
设定
假设 B.14.1(主方程) 明度 \(\mathcal{M}(t)\) 的时间演化由以下方程控制:
\[\begin{equation} \label{eq:master-equation} \frac{d\mathcal{M}}{dt} = \underbrace{\alpha\mathcal{M}}_{\text{反馈}} \cdot \underbrace{\left(1-\frac{\mathcal{M}}{K(\theta)}\right)}_{\text{选择}} \cdot \underbrace{\sin(2\theta)}_{\text{梯度}} \;-\; \underbrace{\gamma\mathcal{M}}_{\text{耗散}}, \qquad K(\theta) = \sin(2\theta) \end{equation}\]
其中:
反馈(\(\alpha\mathcal{M}\)):成长与当前明度成正比,越清醒,觉醒越快。这是自举(bootstrap)。\(\alpha > 0\) 是成长率。
选择(\(1-\mathcal{M}/K(\theta)\)):逼近角度 \(\theta\) 下可得的上限 \(K(\theta)\) 时,改善空间递减至零。这一上限来自T1与B.12:固定 \(\theta\) 时,\(\mathcal{M} = (r^2/2)\sin(2\theta) < \sin(2\theta)\),因为 \(r^2 = \lambda^2 + \xi^2 < 2\)。平衡时 \(K(\pi/4) = 1\)。\(K(\theta)\) 属于表 15的边界上限一行:本主方程在未归一化的 \(\mathcal{M} \in [0,1]\) 上运作,三区归一化下起约束作用的是同表三区上限一行(\(\mathcal{M} \leq S^2/4 < 1/4\),推论 B.12.11)。
梯度(\(\sin(2\theta)\)):平衡角 \(\theta = \pi/4\) 时成长最快;纯理(\(\theta = 0\))或纯玄(\(\theta = \pi/2\))时成长为零。
耗散(\(-\gamma\mathcal{M}\)):没有持续的实践,明度自然衰减,这是热力学第二定律在认知领域的对应。\(\gamma > 0\) 是耗散率。
图78展示了每个因子对整体成长曲线的贡献。
结论与证明
稳态与稳定性。
令右端为零,得到非零不动点;再看它是否稳定。
命题 B.14.2(稳态) 令 \(d\mathcal{M}/dt = 0\),假设 \(\mathcal{M} \neq 0\):
\[\begin{equation} \label{eq:steady-state} \alpha\left(1 - \frac{\mathcal{M}^*}{K(\theta)}\right)\sin(2\theta) = \gamma, \qquad\text{即}\qquad \mathcal{M}^* = K(\theta)\left(1 - \frac{\gamma}{\alpha\sin(2\theta)}\right) \end{equation}\]
在最优平衡(\(\theta = \pi/4\),\(\sin(2\theta) = K = 1\))时:
\[\begin{equation} \label{eq:steady-state-balanced} \mathcal{M}^* = 1 - \frac{\gamma}{\alpha} \end{equation}\]
存在条件:\(\mathcal{M}^* > 0\) 要求 \(\alpha\sin(2\theta) > \gamma\);平衡时即 \(\alpha > \gamma\),成长率必须超过耗散率。
命题 B.14.3(稳定性) 记 \(s = \sin(2\theta)\),\(\rho = \alpha s - \gamma\),\(f(\mathcal{M}) = \alpha\mathcal{M}(1 - \mathcal{M}/K)s - \gamma\mathcal{M}\)。由 \(K = s\),\(f(\mathcal{M}) = \rho\mathcal{M} - \alpha\mathcal{M}^2\),故 \(\mathcal{M}^* = \rho/\alpha\),\(f'(\mathcal{M}) = \rho - 2\alpha\mathcal{M}\),得 \(f'(0) = \rho\),\(f'(\mathcal{M}^*) = -\rho\)。\(\rho > 0\) 时 \(0\) 不稳定、\(\mathcal{M}^*\) 稳定;\(\rho < 0\) 时 \(\mathcal{M}^* < 0\) 没有物理意义,\(0\) 稳定。又 \(f(K) = -\gamma K < 0\),从 \([0, K)\) 出发的轨线始终留在其中,所以 \(\mathcal{M}\) 不会越过B.12的静态上限。
半明度与动力学的相合。 当 \(\alpha = 2\gamma\) 时,\(\mathcal{M}^* = 1/2\),与B.12半明度上限的数值相同(图79);如表 15后的说明所述,这一相合来自参数选取,不能算作 \(1/2\) 的独立证据。
不平衡即自我耗散。
把稳态改写一下,可以看出偏倚的代价。
命题 B.14.4(不平衡即自我耗散) 改写式 (eq:steady-state):
\[\begin{equation} \label{eq:effective-dissipation} \mathcal{M}^* = K(\theta)\left(1 - \frac{\gamma_{\text{eff}}}{\alpha}\right), \quad \text{其中}\quad \gamma_{\text{eff}} = \frac{\gamma}{\sin(2\theta)} \end{equation}\]
当 \(\theta \neq \pi/4\) 时,\(\sin(2\theta) < 1\),故有效耗散率 \(\gamma_{\text{eff}} > \gamma\),上限 \(K(\theta)\) 也降到 \(1\) 以下。
结论。 在稳态上,不平衡相当于自我施加的额外耗散,外加一个压低了的上限。这一等价只对稳态成立:完整的动力学还改变了上限 \(K(\theta)\) 与时间尺度 \(1/\rho\),所以不平衡与增大 \(\gamma\) 不是同一个方程。偏倚的能动者不只是效率低:在本模型中,它的稳态更低,偏倚一越过临界角 \(\sin(2\theta_c) = \gamma/\alpha\),明度便一路衰减至零。
具体地(图80):中度偏倚(\(\theta = \pi/6\),理/玄比为 \(\sqrt{3}:1\))使有效耗散增加 \(15\%\)。极度偏倚(\(\theta = \pi/12\))使有效耗散翻倍。
时间演化。
稳态之外,主方程还给出趋近稳态的完整轨迹。
命题 B.14.5(logistic 解) 由于 \(f(\mathcal{M}) = \rho\mathcal{M}(1 - \mathcal{M}/\mathcal{M}^*)\),只要 \(\rho = \alpha\sin(2\theta) - \gamma > 0\),主方程在任何角度下都是标准 logistic 方程。\(\mathcal{M}_0 > 0\) 时其解为 sigmoid 曲线:
\[\begin{equation} \label{eq:sigmoid-lucidity} \mathcal{M}(t) = \frac{\mathcal{M}^*}{1 + \left(\dfrac{\mathcal{M}^*}{\mathcal{M}_0} - 1\right)e^{-\rho t}}, \qquad \text{平衡时 } \rho = \alpha - \gamma \end{equation}\]
三个阶段清晰可见:
缓慢启动:\(\mathcal{M} \ll \mathcal{M}^*\) 时 \(\mathcal{M} \approx \mathcal{M}_0 \, e^{\rho t}\),即指数觉醒,但基数小
拐点:\(\mathcal{M} = \mathcal{M}^*/2\) 时增长最快,即突破的时刻
渐近逼近:\(\mathcal{M} \to \mathcal{M}^*\),即收益递减,但永不到达(\(\mathcal{M}_0 < \mathcal{M}^*\) 时从下方逼近;\(\mathcal{M}_0 > \mathcal{M}^*\) 时从上方逼近,没有 S 形)
\(e\)(自然常数)出现,是因为模型取连续时间:它是明度成长与衰减的时间尺度 \(1/\rho\) 的自然底数(图81)。
相图与时间演化。 图82把同一动力学画成两栏。左栏是相图,把 \(d\mathcal{M}/dt\) 直接画为 \(\mathcal{M}\) 的函数,零点就是不动点;右栏是同样三个平衡角下明度随时间的轨迹,左栏的不动点在这里成为各条曲线趋近的平台:
解读
用日常的话说。 想一个人学外语。不去碰它,学过的词会一点点忘掉,这对应模型里的耗散:它一直在起作用,用不着谁去推。会的越多,读得懂的材料越多,学新东西越快,这对应反馈。离母语水平越近,可进步的余地越小,这对应选择设下的天花板。平衡对应两种觉知的配比:既掌握说得清的规则(理),又清楚自己哪些地方还拿不准(玄)。模型的结论是:成长压过遗忘,水平会停在一个稳定的高度上;偏向一端,在稳定时相当于多添了一份遗忘,偏过某个限度,学过的会全部流失。
四模态的综合。 主方程不只是把四种模式列在一起,它揭示了它们的交互:反馈驱动成长,但选择设定天花板;梯度决定方向,但耗散拖拽后腿。单独理解任何一种模式都不够,明度的动力学由四者共同决定。
遮蔽是默认态。 在单主体主方程里,耗散项 \(-\gamma\mathcal{M}\) 永远存在,不需要你做任何事。成长项 \(\alpha\mathcal{M}(1-\mathcal{M}/K(\theta))\sin(2\theta)\) 需要三个主动条件同时满足:已有的明度基础(反馈)、未用完的改善空间(选择)、以及刻意的平衡(梯度)。
基本常数的角色。 看到 \(e\) 与 \(\pi\) 出现在一条关于明度的方程里,读者容易以为框架援引了某种深层常数。下表逐个交代它们从哪里进入方程,并把由方程推出的读法与诠释性的读法分开。主方程中出现了五个基本数学对象,明在哲学对每一个都给出了在本框架中的读法:
| 常数 | 明在哲学意义 |
|---|---|
| \(0\) | 完全遮蔽,即反馈的吸收态,单凭自身无法从零启动 |
| \(1\) | 完全明度,即T1设定的不可达上限;上限 \(K(\theta) = \sin 2\theta\) 只在平衡时达到它 |
| \(2\) | 倍角常数:\(\sin 2\theta = 2\sin\theta\cos\theta\) 是两种觉知之积的极坐标形式(B.12),它经由这个乘积与双面公设(公设三)相连;它是三角常数,不表示面向的个数 |
| \(e\) | 明度成长与衰减的时间尺度;它出现,是因为模型取连续时间 |
| \(\pi\) | 经由角度单位进入方程(\(\theta = \pi/4\));有意识实践相对随机取向的平衡优势(B.12)以对 \(\theta\) 的均匀平均为前提 |
同一个数字的三处出现。 读到这里,读者多半已经注意到 \(1/2\) 反复出现;B.12 的解读把「明」字读作一半光、一半暗,也在邀请人把它当作一个有意义的数。这一段交代它的来历。\(1/2\) 在三处出现:B.12 的静态几何(\(r^2/2\))、B.14 的动力学稳态(平衡且 \(\alpha = 2\gamma\) 时的 \(1 - \gamma/\alpha\))、信息论中二值分布的最大熵点(\(p = 1/2\))。其中只有第一处是推导出来的上限;第二处取决于参数选取,第三处是任何对称二值分布的一般性质。三者可以并置,帮助记忆,却不能当作彼此独立的印证。
启示
起步阶段长时间看不出进步,是这个模型预料之中的事;进步最快的时候,正是走到最终水平一半的时候。 一个人开始每天练字,头几个月几乎看不出变化,后来有一段时间进步飞快,再往后每上一步都更难。在这个模型里,这三段走势出自同一条方程:已有的基础小,成长就慢;基础到了最终稳定水平的一半,成长最快;再往上,余地越来越小。条件是成长压过耗散,并且起点高于零。
偏于一端的代价有两份:能达到的天花板降低了,稳定下来时又像多添了一份流失。 一个学习者偏重规则、很少留意自己哪里还拿不准,他最终停下的水平会更低,原因有两层:可以达到的上限本身变矮,维持现有水平还要多抵一份额外的流失。在这个模型里,「相当于多一份流失」只对最终的稳定水平成立;在走向稳定水平的过程中,偏倚的影响与单纯加大流失并不相同。
在平衡的主方程里,保得住多少明度只看成长率与耗散率之比 \(\alpha/\gamma\),而这个比值在刚越过 \(1\) 的地方最值钱。 由式 (eq:steady-state-balanced),\(\mathcal{M}^* = 1 - \gamma/\alpha\):比值从 \(1\) 升到 \(2\),稳态从 \(0\) 升到 \(1/2\);再从 \(2\) 升到 \(4\),只多出 \(1/4\)(图79)。成长率加倍与耗散率减半给出同一个稳态,到达稳态的速度却不同,因为平衡时的速率是 \(\rho = \alpha - \gamma\)(命题 B.14.5)。
能容忍多大的偏倚,取决于实践有多强:临界角满足 \(\sin(2\theta_c) = \gamma/\alpha\),比值 \(\alpha/\gamma\) 越大,可以偏离平衡越远而仍保有明度。 命题 B.14.4说偏倚抬高有效耗散;把它与存在条件 \(\alpha\sin(2\theta) > \gamma\) 合起来看,\(\alpha = 2\gamma\) 的能动者,\(\theta\) 一旦降到 \(\theta_c = \pi/12\)(\(15^\circ\))及以下(对称地,升到 \(75^\circ\) 及以上),明度便一路衰减至零;\(\alpha = 4\gamma\) 的能动者要低到约 \(7.2^\circ\) 才到这一步。在本模型中,实践越薄弱,越经不起偏向格者或渊者的一端。
起点只决定多久之后突破,终点由参数决定:稳态 \(\mathcal{M}^*\) 里没有初值 \(\mathcal{M}_0\)。 由式 (eq:sigmoid-lucidity),只要 \(\rho > 0\) 且 \(\mathcal{M}_0 > 0\),轨线都趋向同一个 \(\mathcal{M}^*\);拐点时刻为 \(t = \ln(\mathcal{M}^*/\mathcal{M}_0 - 1)/\rho\),所以 \(\mathcal{M}_0 \ll \mathcal{M}^*\) 时,起点低十倍只多花约 \(2.3/\rho\) 的时间,一时冲高到 \(\mathcal{M}^*\) 之上的明度也会回落到它。唯一的例外是 \(\mathcal{M}_0 = 0\):单个能动者在这里原地不动(表 23),从零出发需要外力,这一点要到B.15的耦合项才有着落。
B.15 · 多主体耦合动力学
问题:能动者彼此影响时,明度怎样演化?
所需:B.14的主方程;矩阵与特征值的基本概念。
所得:同步定理与同步的充分条件、实践者定理、极化推论与谱间隙定理。
B.14的主方程描述单个能动者。但明度从来不是纯粹个体的事,每个能动者都存在于相互影响的网络中。本节将主方程扩展到多主体情形,为第§X–§XII章的政治哲学提供数学基础。
设定
本节的结论建立在以下设定之上:耦合主方程及其平均场近似、一般网络上的耦合,以及度量离散的序参量。
假设 B.15.1(耦合主方程) 考虑 \(n\) 个能动者 \(a_1, \ldots, a_n\)。每个能动者的明度 \(\mathcal{M}_i\) 按B.14的方程演化,加上一个交互项:
\[\begin{equation} \label{eq:coupled-master} \frac{d\mathcal{M}_i}{dt} = \underbrace{\alpha_i \mathcal{M}_i\Bigl(1 - \frac{\mathcal{M}_i}{K(\theta_i)}\Bigr)\sin(2\theta_i)}_{\text{个体成长(\hyperref[sec:B15]{B.14})}} \;+\; \underbrace{\frac{1}{n}\sum_{j=1}^{n} \beta_{ij}\bigl(\mathcal{M}_j - \mathcal{M}_i\bigr)}_{\text{社会耦合}} \;-\; \underbrace{\gamma_i \mathcal{M}_i}_{\text{耗散(\hyperref[sec:B15]{B.14})}} \end{equation}\]
其中 \(\beta_{ij} \geq 0\) 是能动者 \(i\) 与 \(j\) 之间的耦合强度,即\(j\) 的明度对 \(i\) 的成长率的影响程度;\(K(\theta) = \sin 2\theta\) 是B.14的上限因子(表 15「边界上限」一行)。记 \[F_i(M) = \alpha_i M\Bigl(1 - \frac{M}{K(\theta_i)}\Bigr)\sin(2\theta_i) - \gamma_i M\] 为能动者 \(i\) 在B.14中自身的右端(成长减耗散);能动者同质时,把共同的 \(F_i\) 记作 \(f\)。当 \(\alpha\sin(2\theta) > \gamma\) 时,\(f\) 有B.14的非零均衡 \(\mathcal{M}^*_0 = K(\theta)\bigl(1 - \gamma/(\alpha\sin(2\theta))\bigr)\)。
定义 B.15.2(平均场近似) 当群体足够大,个体间的交互模糊为总体影响时,用平均场 \(\bar{\mathcal{M}} = \frac{1}{n}\sum_j \mathcal{M}_j\) 替代求和:
\[\begin{equation} \label{eq:mean-field} \frac{d\mathcal{M}_i}{dt} = F_i(\mathcal{M}_i) + \beta\bigl(\bar{\mathcal{M}} - \mathcal{M}_i\bigr) \end{equation}\]
其中 \(\beta\) 是平均耦合强度。所有 \(\beta_{ij}\) 都等于同一个 \(\beta\) 时,此式精确成立:\(\frac{1}{n}\sum_j \beta(\mathcal{M}_j - \mathcal{M}_i) = \beta(\bar{\mathcal{M}} - \mathcal{M}_i)\);\(\beta_{ij}\) 各不相同时,它是一个近似。每个能动者感受到的是「社会的平均明度」,而非特定个体。
平均场假设所有能动者与所有其他能动者等强度连接。现实社会不是这样。用一般的邻接矩阵 \(W = (w_{ij})\) 替代均匀耦合:
\[\begin{equation} \label{eq:b16-network-coupling} \frac{d\mathcal{M}_i}{dt} = F_i(\mathcal{M}_i) - \sum_{j=1}^{n} L_{ij}\,\mathcal{M}_j \end{equation}\]
其中 \(W\) 对称且 \(w_{ij} \geq 0\),\(L = D - W\) 是图的拉普拉斯矩阵(\(D_{ii} = \sum_j w_{ij}\),\(L_{ij} = -w_{ij}\) 当 \(i \neq j\)),于是 \(-\sum_j L_{ij}\mathcal{M}_j = \sum_j w_{ij}(\mathcal{M}_j - \mathcal{M}_i)\)。(定义 B.16.1中可带负号的耦合权重,是字母 \(W\) 的另一种用法。)
定义 B.15.3(序参量) 定义群体的明度方差作为序参量:
\[\begin{equation} \label{eq:b16-order-parameter} \sigma^2(t) = \frac{1}{n}\sum_{i=1}^{n}\bigl(\mathcal{M}_i(t) - \bar{\mathcal{M}}(t)\bigr)^2 \end{equation}\]
\(\sigma^2 = 0\) 意味着完全同步,所有能动者处于相同的明度水平。\(\sigma^2 > 0\) 度量群体在明度上铺开得有多宽。
结论与证明
以上方程建立了基本框架。接下来我们推导四个只有在多主体情形中才会出现的结果,它们没有单主体对应物。
同步与极化。
定理 B.15.4(同步定理) 对同质能动者(相同的 \(\alpha, \gamma, \theta\))在平均场模型中,序参量满足精确恒等式 \[\begin{equation} \label{eq:b16-variance-dynamics} \frac{d\sigma^2}{dt} = 2\bigl[f'(\bar{\mathcal{M}}) - \beta\bigr]\,\sigma^2 \;-\; \frac{2\alpha\sin(2\theta)}{K(\theta)}\,m_3, \qquad m_3 = \frac{1}{n}\sum_{i=1}^{n}\bigl(\mathcal{M}_i - \bar{\mathcal{M}}\bigr)^3, \end{equation}\]
其中 \(f'(M) = \alpha\bigl(1 - 2M/K(\theta)\bigr)\sin(2\theta) - \gamma\) 是单主体动力学在 \(M\) 处的线性化增长率。
推导。 对 \(\sigma^2\) 求时间导数,耦合项贡献 \(-2\beta\sigma^2\)(扩散效应)。由于 \(f\) 是二次函数,\(f(\mathcal{M}_i) - \frac{1}{n}\sum_j f(\mathcal{M}_j) = f'(\bar{\mathcal{M}})(\mathcal{M}_i - \bar{\mathcal{M}}) - \frac{\alpha\sin(2\theta)}{K(\theta)}\bigl[(\mathcal{M}_i - \bar{\mathcal{M}})^2 - \sigma^2\bigr]\) 精确成立,以 \(2(\mathcal{M}_i - \bar{\mathcal{M}})\) 加权平均即得其余部分。分布近乎对称时,偏度项 \(m_3\) 很小,方差以速率 \(2[f'(\bar{\mathcal{M}}) - \beta]\) 增减。
定义收缩耦合水平:
\[\begin{equation} \label{eq:b16-sync-threshold} \beta^* = \max_{M \geq 0} f'(M) = \alpha\sin(2\theta) - \gamma \end{equation}\]
命题 B.15.5(同步的充分条件) 当 \(\beta > \beta^*\) 时,所有能动者收敛到相同的明度水平(同步),与初始状态无关。
证明。 非负状态保持非负,因为 \(\mathcal{M}_i = 0\) 处右端为 \(\beta\bar{\mathcal{M}} \geq 0\)。对 \(x \geq y \geq 0\), \[f(x) - f(y) = (x - y)\Bigl(\alpha\sin(2\theta)\Bigl(1 - \frac{x + y}{K(\theta)}\Bigr) - \gamma\Bigr) \leq \beta^*(x - y).\] 在平均场模型中,耦合给 \(\frac{d}{dt}(\mathcal{M}_i - \mathcal{M}_j)\) 贡献 \(-\beta(\mathcal{M}_i - \mathcal{M}_j)\),因此 \[\frac{d}{dt}\bigl|\mathcal{M}_i - \mathcal{M}_j\bigr| \leq (\beta^* - \beta)\bigl|\mathcal{M}_i - \mathcal{M}_j\bigr|,\] 每一道两两差距至少按 \(e^{-(\beta - \beta^*)t}\) 衰减。\(\square\)
当 \(\beta \leq \beta^*\) 时,这个界不再保证收缩,但性质上没有任何改变。对 \(\alpha\sin(2\theta) > \gamma\) 的同质能动者,在任何 \(\beta \geq 0\) 下,每一条从原点以外出发的轨线仍收敛到均匀态 \(\mathcal{M}^*_0\)(\(\beta = 0\) 时这就是把B.14逐个用于每个能动者;见下文收敛速率)。在 \(\bar{\mathcal{M}} \approx 0\) 附近方差可以增长一阵,也只是一阵。所以 \(\beta^*\) 是一致收缩的充分条件;同质模型没有碎裂区,也没有临界点。
成长率各异时,情形如图83所示:只有一个均衡,其中有高低两极,制度越强,两极之间的差距越连续地收窄。
推论 B.15.6(极化推论) 成长率取两个值的异质群体,在任何耦合强度下都会落成两个簇,一高一低:当每个 \(\alpha_i\sin(2\theta_i) > \gamma_i\) 且 \(\beta > 0\) 时,平均场系统是合作型的(每个能动者的变化率随他人明度上升而上升),且每个 \(F_i(M)/M\) 严格递减,所以它有唯一的正均衡,吸引一切非零状态(这是凹非线性合作系统的一个标准结果2)。在该均衡处,两个能动者的差距满足 \(F_i(\mathcal{M}_i) - F_j(\mathcal{M}_j) = \beta(\mathcal{M}_i - \mathcal{M}_j)\),所以差距继承自参数差异,随耦合增强按 \(1/\beta\) 缩小;\(\beta^*\) 处什么也没有发生。在图83的二主体例子中,\(\beta = 0\)、\(0.2\)、\(0.7\)、\(2\)、\(5\) 时差距依次为 \(0.30\)、\(0.19\)、\(0.11\)、\(0.05\)、\(0.02\)。这就是本模型给出的政治极化的数学图景:人们自身的参数有差异时,弱制度让差异原样留存,更强的耦合则连续地收窄它,却不会把它抹平。
实践者效应。
定理 B.15.7(实践者定理) 考虑 \(n-1\) 个普通能动者加上 \(1\) 个实践者,即一个通过持续实践(§VIII.4)维持固定高明度 \(\mathcal{M}_c\) 的能动者。若 \(\mathcal{M}_c > \mathcal{M}^*_0\),实践者将其余普通能动者的共同均衡 \(\tilde{M}^*\) 提升,一阶近似下提升量为:
\[\begin{equation} \label{eq:b16-practitioner-shift} \Delta\tilde{M} = \tilde{M}^* - \mathcal{M}^*_0 = \frac{\beta(\mathcal{M}_c - \mathcal{M}^*_0)}{n\beta^* + \beta} \end{equation}\]
其中 \(\mathcal{M}^*_0 = K(\theta)\bigl(1 - \gamma/(\alpha\sin(2\theta))\bigr)\) 是无实践者时的均衡,\(\beta^* = \alpha\sin(2\theta) - \gamma\) 在这里扮演弛豫速率 \(-f'(\mathcal{M}^*_0)\) 的角色。
推导。 实践者的存在为平均场贡献了一个额外的拉力项 \(\frac{\beta(\mathcal{M}_c - \tilde{M})}{n}\),其中 \(\tilde{M}\) 是普通能动者的平均值,于是均衡条件为 \(f(\tilde{M}^*) + \frac{\beta}{n}(\mathcal{M}_c - \tilde{M}^*) = 0\)。在 \(\mathcal{M}^*_0\) 附近把 \(f\) 线性化,用 \(f'(\mathcal{M}^*_0) = -\beta^*\),得 \(-\beta^*\Delta\tilde{M} + \frac{\beta}{n}(\mathcal{M}_c - \mathcal{M}^*_0 - \Delta\tilde{M}) = 0\),解出即为上式。
标度行为。
稳定性。
命题 B.15.8(线性化与本征模式) 在同质能动者的均匀稳态 \(\mathcal{M}_i = \mathcal{M}^*\) 附近施加微扰 \(\varepsilon_i\),平均场耦合系统的线性化方程为:
\[\begin{equation} \label{eq:b16-linearized} \frac{d\varepsilon_i}{dt} = \bigl[f'(\mathcal{M}^*) - \beta\bigr]\varepsilon_i + \frac{\beta}{n}\sum_{j=1}^{n}\varepsilon_j \end{equation}\]
在非零均衡 \(\mathcal{M}^* = \mathcal{M}^*_0\) 处,该系统有两类本征模式:
\[\begin{equation} \label{eq:b16-eigenvalues} \begin{aligned} \nu_1 &= f'(\mathcal{M}^*) = \gamma - \alpha\sin(2\theta) && \text{(均匀模式:$\varepsilon_i = \varepsilon$)} \\ \nu_2 &= f'(\mathcal{M}^*) - \beta = \gamma - \alpha\sin(2\theta) - \beta && \text{(偏差模式:$\sum_i\varepsilon_i = 0$)} \end{aligned} \end{equation}\]
(本征值记作 \(\nu_1, \nu_2\),以免与理解度 \(\lambda(a)\) 冲突。)
不动点分类。 表 24列出耦合系统的各个不动点、每个不动点存在的条件及其稳定性。
| 不动点类型 | 条件 | 稳定性 | 明在哲学含义 |
|---|---|---|---|
| 均匀高明度 \(\mathcal{M}^*_0 > \frac{1}{2}\) | \(\alpha\sin(2\theta) > \gamma + \frac{\alpha}{2}\) | 任何 \(\beta \geq 0\) 下稳定 | 集体清醒 |
| 均匀低明度 \(\mathcal{M}^*_0 < \frac{1}{2}\) | \(\gamma < \alpha\sin(2\theta) < \gamma + \frac{\alpha}{2}\) | 任何 \(\beta \geq 0\) 下稳定 | 集体半蔽 |
| 零态 \(\mathcal{M}_i = 0\) | 总是存在 | \(\alpha\sin(2\theta) > \gamma\) 时不稳 | |
| 双簇(异质) | \(\alpha_i\) 取两个值,每个 \(\alpha_i\sin(2\theta_i) > \gamma_i\),任何 \(\beta \geq 0\) | 唯一正均衡,吸引一切非零状态 | 政治极化(差距随 \(\beta\) 增大而收窄) |
收敛速率。 需要区分个体松弛与主体之间的同步。由本征值分析(式 eq:b16-eigenvalues),偏差模式在稳定均衡附近以速率 \(\beta + \beta^*\) 衰减,因此:
\[\begin{equation} \label{eq:b16-convergence-rate} \tau_{\text{sync}} = \frac{1}{\beta + \beta^*} \end{equation}\]
耦合越强,同步越快。注意在同质平均场前提下,即使 \(\beta = 0\),参数相同的能动者也各自松弛到同一均衡(时间尺度 \(1/\beta^*\)),同步在这个退化意义上仍会发生;耦合的贡献是把衰减速率从 \(\beta^*\) 提高到 \(\beta + \beta^*\)。对参数各异的异质能动者,均衡本身在任何有限的 \(\beta\) 下都保留一段离散(由极化推论,按 \(1/\beta\) 缩小),所以精确的同步从不发生;\(\beta = 0\) 时各自停在自己的均衡上。
网络拓扑。
定理 B.15.9(谱间隙定理) 图拉普拉斯的第二小特征值 \(\mu_2\)(Fiedler 值,又称代数连通度)决定了同步速率:
\[\begin{equation} \label{eq:b16-spectral-gap} \tau_{\text{sync}}^{\text{网络}} = \frac{1}{\mu_2 + \beta^*} \quad \text{(同质能动者,均匀稳态附近)} \end{equation}\]
推导。 在均匀态 \(\mathcal{M}^*_0\) 处线性化,用 \(f'(\mathcal{M}^*_0) = -\beta^*\),得 \(\dot{\varepsilon} = -(\beta^* I + L)\,\varepsilon\)。\(L\) 对称且半正定,特征值为 \(0 = \mu_1 \leq \mu_2 \leq \cdots \leq \mu_n\),\(\mu_1\) 的特征向量是常向量,所以偏差模式(与常向量正交)以速率 \(\beta^* + \mu_k\)(\(k \geq 2\))衰减,最慢的是 \(\beta^* + \mu_2\)。\(\square\)
其中 \(\beta^* > 0\) 是个体的弛豫速率。\(\mu_2\) 越大,同步越快。\(\mu_2 = 0\) 意味着网络断裂为不连通的子图:参数相同的能动者仍会各自弛豫到同一均衡,参数各异的子群却停在各自的均衡上,网络层面的同步不再可能(图85)。
拓扑比较。
| 网络拓扑 | \(\mu_2\) 规模 | 同步 | 抗碎裂 | 明在哲学实例 |
|---|---|---|---|---|
| 完全图 | \(n\) | 最快,随 \(n\) 增大 | 最强(\(n-1\) 个节点) | 理想民主/小型公社 |
| 小世界 | 远高于环;至多约为 \(d_{\min}\) | 就其稀疏程度而言快 | 强:捷径绕开任何一个被去掉的节点 | 智慧传统/学术社区 |
| 随机图 | \(p \gg (\log n)/n\) 时 \(\sim pn\) | 随密度增大 | 随密度增大 | 现代社会 |
| 无标度(枢纽辐射) | 至多约为 \(d_{\min}\)(星形图恰为 \(1\)) | 有界,与规模无关 | 最弱:去掉枢纽即断开 | 社交媒体/名人网络 |
| 环格 | \(\sim 4\pi^2/n^2\) | \(n\) 大时最慢 | 弱:去掉两个节点即断开 | 孤立村庄 |
算例
双主体算例。 回到最简单的情形,考虑两个参数相同(\(\alpha, \gamma, \theta\))且对称耦合(\(\beta_{12} = \beta_{21} = \beta\))的能动者。设 \(\mathcal{M}_1 = 0.6\)(一个清醒的能动者)和 \(\mathcal{M}_2 = 0.1\)(一个遮蔽的能动者),\(\beta = 0.3\)。由于耦合主方程(假设 B.15.1)用 \(1/n\) 归一化社会项,耦合项把 \(\mathcal{M}_2\) 向上推 \(\frac{1}{2}\cdot 0.3 \times (0.6 - 0.1) = 0.075\),把 \(\mathcal{M}_1\) 向下拉 \(\frac{1}{2}\cdot 0.3 \times (0.1 - 0.6) = -0.075\)。清醒的能动者为提升遮蔽者「付出了代价」。对称耦合在瞬时只作再分配(两项之和为零),总体的长期净效果由非线性个体动力学决定。与之相关的耦合水平是式 (eq:b16-sync-threshold)的 \(\beta^*\):耦合高于它时,同质能动者之间的每一道差距都必然缩小,所以它是同步的一个充分条件(命题 B.15.5)。
解读
用日常的话说。 想一个办公室。每个人自己的习惯决定他独处时会停在怎样的明度(看清局面的程度)上;同事之间的交流对应模型里的耦合,它把每个人拉向全组的平均:比平均清醒的人被往下拉一点,比平均糊涂的人被往上拉一点。例会、培训这类制度安排决定这股拉力有多强。在这个模型里,组里若有一位始终保持清醒的人,全组停下的水平会被他抬高,组越大,他一个人的作用越被摊薄。各人习惯不同时,交流越密,差距越小,却一直留着;拉力从弱到强,差距一点点收窄,中间没有哪个点会突然翻转。
从单一主方程(B.14)到耦合系统(B.15),我们追踪了从伦理到政治的数学路径。四个结果浮现了,每一个都没有单主体对应物:
在这些模型里,从「我」到「我们」的过渡是渐进的:耦合连续地起作用,没有哪一个制度强度能把社会从碎裂一下子拨到同步。
从伦理到政治。 主方程(B.14)描述单个能动者的内在生命。耦合系统(B.15)描述政治生活。从一个到另一个的过渡,从 \(\frac{d\mathcal{M}}{dt}\) 到带耦合项的 \(\frac{d\mathcal{M}_i}{dt}\),是从伦理(第§VI章)到政治哲学(第§X–§XII章)的数学形式。耦合项 \(\beta_{ij}(\mathcal{M}_j - \mathcal{M}_i)\) 是政治进入数学的地方:它说的是,我的明度从来不完全是我自己的事。
在场的作用。 耦合项说的是:当你被更清醒的人包围(\(\mathcal{M}_j > \mathcal{M}_i\)),他们的存在把你拉向上方;当被更遮蔽的人包围,他们的影响把你拉向下方。这是实践者功能(§VIII.4)的数学形式:实践者提高了群体的 \(\beta_{ij}\) 值,并作为高 \(\mathcal{M}\) 节点存在。在这个模型里,一个清醒的存在做的不止是「树立榜样」:它移动了周围所有人的均衡(定理 B.15.7)。耦合项 \(\beta_{ij}(\mathcal{M}_j - \mathcal{M}_i)\) 是每一位教师、导师和圣人历来所知之事的形式表达:在场本身就有作用。
制度提供耦合。 在平均场状态下,耦合 \(\beta\) 由制度结构(教育体系、媒体、政治制度)提供。这就是为什么制度设计(§XI.3)超出便利的范畴:在这个模型里,制度决定的是能动者被拉向 \(\bar{\mathcal{M}}\) 的强弱与速度;\(\bar{\mathcal{M}}\) 本身的高低由个体参数决定。模型未经社会数据校准,它支持的是这个定性判断,而非任何定量的必要条件。
收缩耦合水平的读法。 \(\beta^*\) 是足够的制度强度。当制度(教育、媒体、政治结构)提供的耦合高于它,同质能动者之间的差异无论从何处出发,都至少以速率 \(\beta - \beta^*\) 缩小;低于它,这份保证失效,同质能动者却仍会趋同。
制度时间。 \(\tau_{\text{sync}}\) 是集体寻找共识所需的「制度时间」。一个耦合为零的异质社会没有共识机制:每个成员停在自己的均衡上,耦合能收窄这段离散,却不能把它消除。一个强耦合社会迅速趋同,但这并不自动意味着趋向正确。个体参数决定共同终点是高明度还是低明度;耦合只决定能动者被拉到一起的速度。
两类本征模式。 \(\nu_1\) 控制整体的集体明度(只取决于个体参数,与耦合无关:参数相同的能动者不能仅靠互相鼓励超越共同的个体极限)。\(\nu_2\) 控制个体间的分歧,耦合 \(\beta\) 使 \(\nu_2\) 更负,加速趋同。
社交媒体的拓扑。 社交媒体创造了无标度拓扑,少数意见领袖连接着数百万人,而大多数人之间的联系很弱。大多数人挂在少数枢纽上、自己的联系又很少时,\(\mu_2\) 受这个单薄的最小度所限,网络再大也不会变大,同步从规模中得不到任何好处;去掉几个枢纽,网络就散开。古老的智慧传统(紧密互联的小型社区,即小世界网络)在这两方面都处在更好的拓扑位置上。把社交媒体这样建模之后,这个判断出自谱理论;可以争论的是建模这一步。
启示
一群习惯相同的人,靠互相鼓励抬不高大家共同的上限;交流只决定大家多快走到一起。 一个读书会的成员读书习惯都差不多,聚得再勤,每个人最终停下的水平仍是各自独处时会停的那个水平,聚得勤只是让大家更快地停到一起。在这个模型里,这一点的前提是成员的成长、流失与平衡状况都相同,人与人之间的影响按差距的大小传递;要抬高共同的水平,得改变每个人自己的这些条件,或者引入一位明度更高的实践者。
人们自身的条件不同时,联系越紧,差距越小,却始终消不掉,中间也没有一个突然转变的临界点。 两个社区的居民学习条件不同,往来越频繁,两边的水平越接近,条件上的差别却一直在结果里留下一段差距。在这个模型里,这条结论要求每个人自身的成长都压过流失,描述的是成长快慢分为两档的群体;模型未经社会数据校准,它给出的是方向,给不出差距具体有多大。
单个能动者无法从零启动;在耦合的群体里,只要 \(\beta > 0\) 且群体平均明度为正,零就不再是终点。 B.14的右端在 \(\mathcal{M} = 0\) 处为零,零是吸收态(表 23);在平均场方程 (eq:mean-field)中,\(\mathcal{M}_i = 0\) 处个体项消失,右端只剩 \(\beta\bar{\mathcal{M}}\)。在这个模型里,把一个完全遮蔽的人推离零点的项只有一个,就是他人的明度经由耦合传来的拉力。
在一阶近似下,实践者的作用只取决于他们在群体中所占的比例 \(k/n\):同一位实践者放进人数多一千倍的群体,带来的提升约缩小到千分之一。 把式 (eq:b16-practitioner-shift)推广到 \(k\) 名实践者,\(\Delta\tilde{M} \approx \frac{(k/n)\,\beta(\mathcal{M}_c - \mathcal{M}^*_0)}{\beta^* + (k/n)\,\beta}\),其中人数只以比例出现;\(n\beta^* \gg \beta\) 时单人效应近似与 \(n\) 成反比。所以在这个模型里,要影响一个大群体,杠杆是实践者的比例与耦合强度 \(\beta\),前提是 \(\mathcal{M}_c > \mathcal{M}^*_0\),且结果只在一阶近似下成立(定理 B.15.7)。
网络结构能给趋同提供多快的速度,受连接最少的那个成员所限。 由谱间隙定理(定理 B.15.9),同质能动者在均匀态附近最慢的偏差以 \(\beta^* + \mu_2\) 衰减,网络的贡献是 \(\mu_2\),而 Fiedler 上界 \(\mu_2 \leq \frac{n}{n-1}\,d_{\min}\) 只认最小度(表 25)。给枢纽再添多少连接,这个上限都不动,图85中的枢纽辐射图无论添多少条辐条,\(\mu_2\) 都不超过 \(1\);要抬高上限,只能让连接最少的人多几条连接。
适用范围与限制
线性扩散耦合是最简模型。 线性扩散耦合 \(\beta_{ij}(\mathcal{M}_j - \mathcal{M}_i)\) 是最简单的模型,其中影响力与明度差距成正比。真实的社会影响远更复杂(非对称、依赖语境、受权力与情感中介)。此模型捕获的是定性洞见:明具有社会感染力;具体耦合常数 \(\beta_{ij}\) 并非经验可测的。本节的结果(同步化、实践者带来的均衡移动、由 Fiedler 值给出的速率)是扩散耦合的结构性推论,而非校准于社会数据的预测。
B.16 · 集体明度与涌现
问题:耦合起来的群体,集体明度什么时候高于个体平均,什么时候低于它?
所需:B.15的耦合设定。
所得:涌现不等式(命题 B.16.2),以及集体明度高于或低于个体平均的充分条件(命题 B.16.3、命题 B.16.4)。
B.15追踪每个能动者的明度在耦合下怎样演化。本节把群体当作一个整体来问:它的明度怎样度量,又在什么条件下偏离成员的平均。
设定
定义 B.16.1(集体明度函数) 定义 \(\Psi\) 为个体明度与耦合结构的一般泛函:
\[\begin{equation} \label{eq:b16-phi-definition} \Psi(\mathcal{M}_1, \ldots, \mathcal{M}_n;\; W) = \operatorname{clip}_{[0,1]}\!\left( \bar{\mathcal{M}} + \eta\, \frac{\sum_{i < j} w_{ij}\,g(\mathcal{M}_i, \mathcal{M}_j)} {\sum_{i < j}|w_{ij}|} \right) \end{equation}\]
其中 \(W = \{w_{ij}\}\) 为耦合矩阵(可含负值以表示破坏性耦合),\(\eta \in [0,1]\) 控制交互项的最大贡献;若所有 \(w_{ij}=0\),分母取 \(1\)。截断函数使 \(\Psi\) 保持在个体明度同一归一化尺度上。协同函数为 \(g(\mathcal{M}_i, \mathcal{M}_j) = \min(\mathcal{M}_i, \mathcal{M}_j) \cdot (1 - |\mathcal{M}_i - \mathcal{M}_j|)\)。
说明。 \(g\) 捕捉了两个直觉:(1) 两个能动者都需要有正明度才能产生协同(\(\min\) 因子);(2) 差距越小,协同越大(\((1 - |\mathcal{M}_i - \mathcal{M}_j|)\) 因子)。完全同步(\(\mathcal{M}_i = \mathcal{M}_j\))下 \(g = \mathcal{M}_i\);完全碎裂(一个为 0 另一个为 1)下 \(g = 0\)。\(w_{ij}\) 的符号和大小决定了耦合是增强还是削弱集体明度。
记归一化协同 \[S_W = \frac{\sum_{i < j} w_{ij}\,g(\mathcal{M}_i,\mathcal{M}_j)}{\sum_{i < j}|w_{ij}|},\] 于是截断之前的 \(\Psi\) 就是 \(\bar{\mathcal{M}} + \eta S_W\)。下文的涌现不等式与超可加、亚可加两条命题都用这个量。
结论与证明
命题 B.16.2(涌现不等式) 本模型依涌现定理(T2)的精神,让集体明度可以不同于个体明度的简单聚合;这一差别写在定义 B.16.1的泛函 \(\Psi\) 里,它出自该定义,推不出自T2。在 \(\Psi\) 之下,只要设定中的归一化协同 \(S_W\) 不为零、\(\eta > 0\),且结果留在 \([0,1]\) 之内,集体明度就偏离个体平均:
\[\begin{equation} \label{eq:emergence-inequality} \mathcal{M}_{\text{集体}} \neq \frac{1}{n}\sum_{i=1}^{n} \mathcal{M}_i \qquad\text{(当 $\eta S_W \neq 0$ 且 $\Psi$ 未被截断时)} \end{equation}\]
集体明度函数 \(\Psi\) 依赖于耦合结构:
\[\begin{equation} \label{eq:collective-phi} \mathcal{M}_{\text{集体}} = \Psi\bigl(\mathcal{M}_1, \ldots, \mathcal{M}_n;\; \{\beta_{ij}\}\bigr) \end{equation}\]
一群个体明度都很高但耦合为零(\(\beta_{ij} = 0\))的能动者,其集体明度不过是个体明度的平均:没有任何东西从他们之间涌现出来。一个耦合为建设性、因而加权协同为正的群体,可以达到超过个体平均值的集体明度,这就是民主附加值(§XI.6)的数学形式。在泛函 \(\Psi\) 里,起作用的是耦合的符号格局与相对权重:把所有耦合权重乘以同一个正数,\(\Psi\) 不变。
涌现不等式(式 eq:emergence-inequality)说集体明度偏离个体平均。但它没有告诉我们集体明度何时大于平均,何时小于平均,也没有说明净协同为零时两者相等这一边界情形。下面两条命题在定义 B.16.1的归一化泛函之下给出两个方向的充分条件。
命题 B.16.3(超可加性条件) 当耦合为建设性的(所有 \(w_{ij} \geq 0\))时,集体明度超过平均值的一个非饱和充分条件是:
\[\begin{equation} \label{eq:b16-superadditivity} \Psi > \bar{\mathcal{M}} \;\Leftarrow\; S_W > 0 \;\text{且}\; \eta > 0 \;\text{且}\; \bar{\mathcal{M}} + \eta S_W < 1 \end{equation}\]
用语言说: 当建设性耦合产生正的归一化协同,且结果尚未在上界处饱和时,集体明度就超过个体平均值(图86)。这是涌现定理(T2)在明度领域的定量形式:建设性耦合创造涌现。
命题 B.16.4(亚可加性条件,遮蔽涌现) 当耦合为破坏性的(\(w_{ij} < 0\),建模操纵性或不对称影响)时:
\[\begin{equation} \label{eq:b16-anti-superadditivity} \Psi < \bar{\mathcal{M}} \;\Leftarrow\; S_W < 0 \;\text{且}\; \eta > 0 \;\text{且}\; \bar{\mathcal{M}} + \eta S_W > 0 \end{equation}\]
解读
用日常的话说。 想一次项目讨论会。模型先取全组成员明度(各人看清局面的程度)的平均,再按成员两两之间的关系加上或减去一份。两位同事顺着对方的思路往下推,这段关系是建设性的,给全组加分;有人靠施压或误导带偏讨论,这段关系是破坏性的,给全组减分。加减多少还看关系两端的人:两人都清醒、水平又接近,这段关系能加减的分量最大。所以在这个模型里,全组可以比成员平均更清醒,也可以更糊涂,而每个成员自己一点没变,变的只是关系的结构。
宣传与遮蔽涌现。 亚可加性条件(命题 B.16.4)形式化了宣传的数学结构:一个低明度节点通过不对称的破坏性影响(\(w_{\text{宣传者}\to\text{民众}} < 0\))降低了集体明度至低于个体平均值。群体变得比其成员平均水平更蠢:个体并没有变,是耦合结构制造了系统性的遮蔽。算法优化的虚假信息、AI的谄媚反馈、注意力劫持平台,都是产生负 \(w_{ij}\) 的机制。
启示
把清醒的人聚到一起,若彼此没有往来,集体明度就只是他们的平均,多不出任何东西。 一家公司从各处招来几位能干的专家,各自埋头做事、互不交流;在这个模型里,这个团体的明度恰好等于几人明度的平均。要让集体高过平均,条件是成员之间的往来总体上是建设性的、模型给交往留有作用,并且集体明度还没有顶到量表的最高处。
一个群体表现得比成员平均更糊涂时,原因可以全在关系上,成员个人一个都没变差。 一个社区里人人照旧过日子,只是有人反复散布误导、挑动彼此猜疑,整个社区的判断就落到居民平均水平之下。在这个模型里,这要求成员之间的关系按轻重加总后是破坏性的、模型给交往留有作用,并且结果还没有跌到量表的最低处;遇到这种情形,要查的是谁在以什么方式影响谁。
个体明度给定时,集体明度看交往的格局,交往的总量不进入计算:所有耦合权重同乘一个正数,\(\Psi\) 不变。 式 (eq:b16-phi-definition)的分子与分母同为权重的一次式,比例因子相消。耦合的强度在B.15里决定成员趋同的快慢;在 \(\Psi\) 里起作用的,只有耦合的正负与彼此之间的相对轻重。所以在这个模型里,更多的会议、更密的消息往来,只有改变了这份格局,才会改变集体明度。
按本节的定义,一对成员能贡献的协同,以较弱一方的明度为上限,并随两人差距的拉大而缩小;抬高群体协同,要从最弱的成员与最大的差距入手。 协同函数 \(g = \min(\mathcal{M}_i, \mathcal{M}_j)\,(1 - |\mathcal{M}_i - \mathcal{M}_j|)\) 是定义 B.16.1的建模选择:一对 \((0.9, 0.2)\) 的平均明度是 \(0.55\),协同只有 \(0.06\);一对 \((0.5, 0.5)\) 的平均明度是 \(0.5\),协同是 \(0.5\)。在这一定义下,再添一位明度极高的成员,他与每个人的协同仍被对方的明度封顶。
破坏性耦合落在两位清醒且相近的成员之间,伤害最大;一条足够重的负连接,可以抵过多条正连接。 每条连接对 \(S_W\) 的贡献是 \(w_{ij}\,g(\mathcal{M}_i, \mathcal{M}_j)\),而 \(g\) 在两人都清醒且相近时最大,所以同样大小的负权重放在这里,扣掉的协同最多。命题 B.16.3与命题 B.16.4看的是加权和 \(S_W\) 的符号(另需 \(\eta > 0\) 且未被截断),正负连接各有几条不进入判据:在本模型里,一个群体可以绝大多数关系都是建设性的,整体仍落到个体平均之下。
B.17 · 宇宙学极限:文明沉默与黑暗森林
问题:把明度动力学推到文明与宇宙的尺度,能得出什么,又要另加哪些假设?
所需:B.12的梯度;B.15的耦合;B.11的博弈论;导数。
所得:可探测性模型与T6的条件判准(命题 B.17.4)、黑暗森林定理(定理 B.17.5)与信任阈值定理(定理 B.17.6)。
本节为第§XV章(文明的明度)与第§XVI章(暗宇宙与双重沉默)提供数学推导。哲学论证与案例分析见正文§XV与§XVI。
B.15建立了多主体明度的数学框架。本节将尺度从人类社会扩展到星际文明。
设定
本节的设定有三条:可探测性模型、文明间耦合的光锥形式,以及广播的探测风险。
设文明的可探测性\(D\)与理域活动成正比,明度\(\mathcal{M} = \lambda \cdot \xi\)。当文明沿梯度\(\nabla\mathcal{M} = (\xi, \lambda)\)演化且\(\lambda \gg \xi\)时,梯度偏向\(\xi\),即玄域:两个分量都为正,\(\xi\)方向的分量更大。
假设 B.17.1(可探测性) 设文明在时间\(t\)的可探测性为:
\[\begin{equation} \label{eq:b17-detectability} D(t) = \lambda(t) \cdot E(t) \end{equation}\]
其中\(E(t)\)是能量输出(卡尔达肖夫等级3\(\propto\)理域开发程度)。同时,明度为\(\mathcal{M}(t) = \lambda(t) \cdot \xi(t)\),受约束\(\lambda + \xi + \delta = 1\)(本模型照公设六设\(\delta > 0\))。
假设 B.17.2(光锥耦合) 文明间耦合须服从时空的因果结构,这确定了下式中的示性函数因子;随距离的指数衰减及其尺度\(c\tau\)则是一项建模选择。形式化如下。设文明\(i\)和\(j\)之间的耦合强度为:
\[\begin{equation} \label{eq:b18-light-cone} \beta_{ij}(t) = \beta_0 \cdot e^{-d_{ij}/(c \cdot \tau)} \cdot \mathbf{1}_{[t > d_{ij}/c]} \end{equation}\]
其中\(\beta_0\)是基础耦合强度(取决于通信技术水平),\(d_{ij}\)是文明间距离,\(c\)是光速,\(\tau\)是文明特征时间尺度(如技术发展周期)4。指示函数\(\mathbf{1}_{[t > d_{ij}/c]}\)保证因果性:信号到达之前耦合为零。
定义 B.17.3(探测风险函数) 每个文明面临广播与否的决策。广播的风险为:
\[\begin{equation} \label{eq:b18-detection-risk} R_i(D_i) = p_{\text{探测}}(D_i) \cdot p_{\text{敌意}}(\xi_j = 0) \cdot \ell_i \end{equation}\]
其中\(p_{\text{探测}}(D_i)\)是可探测性\(D_i\)导致被发现的概率,\(p_{\text{敌意}}(\xi_j = 0)\)是探测者敌意的先验概率,\(\ell_i\)是被打击的损失。\(p_{\text{敌意}}\)直接取决于对\(\xi_j = 0\)的先验概率。模型把下面两点当作前提:如果你认为所有文明的玄域觉知都趋于零,则\(p_{\text{敌意}} \to 1\)(黑暗森林);如果你认为高级文明可能有\(\xi > 0\),则\(p_{\text{敌意}} < 1\)。
结论与证明
文明沉默。
如果文明沿明度梯度演化(即选择最大化\(\mathcal{M}\)而非\(D\)),则:
当\(\lambda > \xi\)时,\(\nabla\mathcal{M} = (\xi, \lambda)\)让两个分量都增加,\(\xi\)增加得更快,文明更多地投资于玄域
沿这条梯度\(\dot{\lambda} = \xi > 0\),所以能量输出\(E(t)\)持平时\(D(t)\)仍在上升;只有\(E(t)\)的相对下降速率快于\(\xi/\lambda\),\(D(t)\)的增长才会反转
可探测性下降依赖这个额外的能量响应假设
命题 B.17.4(T6(文明沉默定理)的条件判准) 设文明沿\(\nabla\mathcal{M}\)演化。由于 \(D(t)=\lambda(t)E(t)\), \[\begin{equation} \label{eq:b17-detectability-derivative} \frac{dD}{dt} = D(t)\left(\frac{\dot{\lambda}(t)}{\lambda(t)} + \frac{\dot{E}(t)}{E(t)}\right). \end{equation}\] 因此,如果存在时间 \(t^*\),使得对所有 \(t > t^*\): \[\begin{equation} \label{eq:b17-silence} \frac{\dot{E}(t)}{E(t)} < -\frac{\dot{\lambda}(t)}{\lambda(t)}, \end{equation}\] 则 \(\frac{dD}{dt} < 0\),文明在 \(t^*\) 之后变得越来越安静。
沿B.12不受约束的梯度,\(\dot{\lambda} = \xi\),条件于是写成 \(\dot{E}/E < -\xi/\lambda\)。T6所说的 \(\lambda > \xi\) 这一窗口不出现在这个不等式里;它经由定理的成熟选择前提进入,因为只有在 \(\lambda > \xi\) 时,梯度才偏向玄觉度。
文明命运的分类、当代案例分析与哲学讨论见§XV。
黑暗森林。
黑暗森林公理的哲学分析见§XVI。
三体\(\to\)明在哲学映射。
| 三体概念 | 明在哲学诠释 | 形式表达 |
|---|---|---|
三体概念 |
明在哲学诠释 | 形式表达 |
黑暗森林法则 |
\(\xi \to 0\)极限:玄域觉知趋于消失 | \(\mathcal{M}_i \to 0\;\forall i\) |
| 宇宙社会学公理一(生存) | 纯理域公理 | \(\max \lambda_i\) s.t. \(\delta_i > 0\) |
| 宇宙社会学公理二(扩张) | \(\lambda\)最大化 | \(d\lambda/dt > 0\) |
| 猜疑链 | \(\beta = 0\),假设\(\xi_j = 0\) | 信任不可能 |
| 面壁者5 | P17在存在性尺度 | 认知主权 |
| 智子6 | P19在宇宙尺度 | 破坏目标文明的认知生态 |
| 降维打击7 | 强制\(\delta \to 1\) | 宇宙性遮蔽攻击 |
定理 B.17.5(T7,黑暗森林定理) 在B.15的多主体设定中,设\(n\)个文明满足以下条件:
\(\beta_{ij} = 0\),\(\forall i \neq j\)(无通信)
\(\xi_i \to 0\),\(\forall i\)(玄域觉知趋于消失;黑暗森林就是这个极限,因为\(\xi = 0\)本身落在T1所允许的范围之外)
每个文明在生存约束下最大化\(\lambda_i\)
无论其他文明怎么做,广播暴露造成的预期打击损失都大于任何广播收益
无论其他文明怎么做,武装成本都低于未武装时因意外暴露造成的预期损失
则全体沉默加先发制人准备是简化广播/武装博弈(每个文明选择广播或沉默,并选择武装与否)的唯一纯策略纳什均衡: \[\begin{equation} \label{eq:b18-dark-forest} \sigma_i^* = (\text{沉默},\;\text{武装}) \quad \forall\, i \end{equation}\]
哲学论证见T7。
由条件4(对他者行动的每一种组合都成立),广播(\(D > 0\))的期望收益低于沉默(\(D = 0\)),所以沉默严格支配广播。由条件5(同样对每一种组合成立),武装严格支配不武装。只要有文明采取被严格支配的行动,那个组合就构不成均衡;所有文明都采取占优行动的组合则是均衡;故\((\text{沉默},\;\text{武装})\)是唯一的纯策略纳什均衡。推导只用到条件4与条件5。条件1至3刻画的是让这组收益显得合理的情境:\(\xi \to 0\)时,每个文明沉入理域陷阱(§XV.3),被探测所暴露的能力(\(\lambda\))只能被解读为威胁,因为推断善意要靠\(\xi > 0\);\(\beta = 0\)时,也没有渠道能修正这种解读。它们不参与占优那一步。结论以收益假设为条件,故本块列为论证而非证明。
涵摄结果(核心哲学论点)。
\[\begin{equation} \label{eq:b18-subsumption} \text{黑暗森林法则} = \text{明度框架}\big|_{\xi \to 0,\; \beta = 0,\; \text{生存收益}} \end{equation}\]
黑暗森林有其适用域,但它并不完整。它是明度框架在玄域觉知趋于零时的极限,此时无通信,生存收益假设成立。这道限制竖线是诠释性的:T7的论证靠的是收益假设,竖线记下的,是让这组收益变得合理的情境。
宇宙博弈。
宇宙博弈矩阵。 将局面简化为二文明博弈:
| 文明B:广播 | 文明B:沉默 | |
|---|---|---|
| 文明A:广播 | 若\(\xi > 0\):合作可能;若\(\xi = 0\):互相毁灭 | A暴露,B隐蔽 |
| 文明A:沉默 | B暴露,A隐蔽 | 无交互 |
在黑暗森林假设(\(\xi \to 0\))以及T7的强收益假设下,(沉默, 沉默)是广播/沉默博弈中的唯一纯策略均衡。在明度假设下(\(\xi > 0\)),这个二策略矩阵不足以判定占优关系,因为文明可以在广播意义上保持沉默,同时主动倾听。更完整的三行动模型需要区分广播、低可探测倾听、完全沉默。这里没有把扩展模型写出来;可以预期,在其中当\(\xi\)足够高且探测风险足够低时,低可探测倾听会成为弱优选择。均衡选择取决于\(\xi\),而这恰恰是黑暗森林理论在构造上所剔除的维度。
定理 B.17.6(T8,信任阈值定理) 在一个示范性的阈值模型中,设两个文明\(i, j\)的耦合强度为\(\beta_{ij}\),耗散率为\(\gamma_i, \gamma_j\),记\(\gamma_{\max} = \max(\gamma_i, \gamma_j)\),玄域觉知分别为\(\xi_i, \xi_j > 0\)。若耦合强度超过信任阈值 \[\begin{equation} \label{eq:b18-trust-threshold} \beta_{ij} > \beta_{ij}^{\dagger} = \frac{\gamma_{\max}}{\min(\xi_i, \xi_j)}, \end{equation}\] 则合作是此模型的一个均衡。模型自身的判据是\(\beta_{ij}\xi_j > \gamma_i\)且\(\beta_{ij}\xi_i > \gamma_j\),即\(\beta_{ij} > \max(\gamma_i/\xi_j,\, \gamma_j/\xi_i)\),这个界从不超过\(\beta_{ij}^{\dagger}\);两方耗散率相同时二者重合,条件此时既充分又必要。\(\min(\xi_i, \xi_j) \to 0\)时两个界都发散,需要无限耦合,这就是猜疑链。
哲学论证见T8。
此模型另作一项建模选择(B.15的耦合作用于明度差距,没有这样的项):文明\(i\)从文明\(j\)获得的明度增益为\(\beta_{ij} \cdot \xi_j\)(耦合强度乘以对方的玄域觉知,只有感受到对方内在生命的文明才能提供信任基础);对称地,文明\(j\)从文明\(i\)获得的增益为\(\beta_{ij} \cdot \xi_i\)。每一方的增益都超过自身耗散时,合作是均衡:\(\beta_{ij}\xi_j > \gamma_i\)且\(\beta_{ij}\xi_i > \gamma_j\)。由于\(\gamma_i, \gamma_j \leq \gamma_{\max}\)、\(\xi_i, \xi_j \geq \min(\xi_i, \xi_j)\),单一条件\(\beta_{ij} \cdot \min(\xi_i, \xi_j) > \gamma_{\max}\)蕴含这两条,且\(\max(\gamma_i/\xi_j, \gamma_j/\xi_i) \leq \gamma_{\max}/\min(\xi_i, \xi_j)\)。若\(\gamma_i = \gamma_j = \gamma\),判据恰为\(\beta_{ij} > \gamma/\min(\xi_i, \xi_j) = \beta_{ij}^{\dagger}\)。这一示范性函数形式服务于正文的定性定理,并非宇宙政治的唯一法则,故本块列为论证而非证明。
这个阈值模型揭示了猜疑链的数学本质:猜疑链只在玄域觉知趋于消失这个特定前提下不可避免。\(\xi > 0\) 时,有限的通信即可打破猜疑链;例如,只要耦合与较弱一方玄域觉知的乘积超过较大的耗散率就够了:\(\beta_{ij} \cdot \min(\xi_i, \xi_j) > \gamma_{\max}\);通信越弱,所需的玄域觉知越高。在这个模型里,一个对他者内在生命感知足够深的文明,即使通信较弱,也能建立信任;一个完全没有玄域觉知的文明,即使通信完美,也无法信任。
解读
用日常的话说。 想两个互相提防的大国,各自看得见对方的实力,看不清对方的意图。若双方都认定对方只会算计,又都认定暴露的损失总大于收益,藏起来并备好武器就是各自最稳妥的选择,这对应模型里的黑暗森林。玄觉度(觉察自己看不透之处的能力,包括对方的内心)对应读懂对方意图的能力,热线与往来对应耦合。在这个模型里,只要双方都读得懂对方一些,往来又足够多,每一方从合作中得到的就能多过自身的损耗,合作就站得住;门槛由读得较浅的一方定下,他读得越浅,所需的往来越多。
帕累托分析。 在允许 \(\xi > 0\) 的扩展博弈中,如果合作像阈值模型在阈值之上所设定的那样给双方各带来净明度增益,双方合作都会更好,黑暗森林的(沉默, 沉默)便是纳什均衡,却达不到帕累托最优。黑暗森林的悲剧是一场协调失败(图87)。这与B.16的反超可加性分析(非对称耦合导致集体明度低于个体平均值)在结构上平行:两种情形的失败都在交互结构,而交互结构由\(\xi\)塑造。
启示
双方都守得住的结局,可能是双方都愿意换掉的结局:沉默对沉默是稳定的,合作对双方却都更好。 两家同行公司各自握着对方用得上的安全数据,谁都怕先拿出来会被对方利用,于是谁也不拿,局面就此僵住。在这个模型里,这一点的前提是双方都能读懂对方一些,并且合作给双方各带来净的好处;这时僵局的根源是双方协调不起来,谁也不愿先动。
传话的速度跟不上双方自身变化的速度时,这条渠道几乎等于没有。 两家公司靠书信谈合作,每封回信寄到时,对方已经换了一轮管理层,信里回应的是一个已经不在的对手。在这个模型里,星际文明之间几乎没有往来,理由正是这一点;这个结论的前提是文明自身变化的周期远短于光走完两者距离的时间,而联系随距离衰减的具体形式是模型的选择。文明变化的周期若与光的路程时间相当,这份往来就不可忽略。
在这个模型里,沿明度梯度走的文明,理解度仍在增长;它要变安静,还得另作一项选择:让能量输出的相对下降快过理解度的相对增长。 沿B.12的梯度 \(\dot{\lambda} = \xi > 0\),能量输出持平时可探测性 \(D\) 照样上升;命题 B.17.4要求的是式 (eq:b17-silence),即 \(\dot{E}/E < -\xi/\lambda\)。所以读T6时,「转向玄」与「收敛能量」是两项前提,各自都要成立,文明沉默才随之而来。
黑暗森林定理的结论全部出自两条收益假设;在这个简化博弈里,要走出黑暗森林,就得有一条收益假设失效。 T7的论证只用到条件4(广播的预期损失对他者的每一种行动组合都大于收益)与条件5(武装严格占优);\(\xi \to 0\)、\(\beta = 0\) 只描述让这组收益显得合理的情境。表 27指出,一旦允许 \(\xi > 0\),(广播,广播)一格里出现合作的可能,条件4「对每一种组合都成立」的要求便不再自明;扩展的三行动模型本节没有写出,这一步仍是预期。
在阈值模型里,信任的门槛由较弱的一方定:较弱一方的玄觉度减半,所需的通信强度就翻倍;它趋于零,再强的通信也不够。 式 (eq:b18-trust-threshold)给出 \(\beta_{ij}^{\dagger} = \gamma_{\max}/\min(\xi_i, \xi_j)\),分子取较大的耗散率,分母取较小的玄觉度,所以一方再深的玄觉也补不了另一方的浅。这是一个示范性模型(增益取 \(\beta_{ij}\xi_j\) 是一项建模选择),阈值是合作成为一个均衡的充分条件,两方耗散率相同时才恰为边界(定理 B.17.6)。
适用范围与限制
附录所给的是条件。 附录B给出的是T6的哲学论证必须满足的数学条件;仅凭 \(\nabla\mathcal{M}\) 推不出文明沉默。
第五部分 · 从数学到实践
数学结构如何转化为日常生活中的具身实践?本部分将前四部分的抽象洞见提炼为觉察练习、自测量表和行动指南。
本部分只有B.18一节,取材于B.2至B.16。
B.18 · 从数学到实践
问题:前面的数学怎样化为日常练习?
所需:B.2至B.16中对应的小节。
所得:觉察练习、遮蔽度的方向性自测量表,以及行动指南。
方程背后有一种看世界的方式,可以转化为具体的日常实践。本节将 B.2–B.16 的数学洞见提炼为三类实操工具:觉察练习、自测量表、行动指南。这些工具与§VIII(实践)互补:该章从生活经验出发,本节从数学结构出发,两者指向同一个方向:更清醒地活着。
B.18.1 · 觉察练习:用数学之眼看日常
下面的练习借模型里的量作比喻:日常生活中的熵、梯度、反馈系数都测不出来,练习借用的只是这些结构的形状。
熵与有限性(B.2 + B.8)。
能量审计。 每周回顾你的「能量输入」(睡眠、饮食、运动、关系的滋养)与「熵增消耗」(压力、过劳、不良习惯)。你的生命是耗散结构(它靠向外输出熵才维持 \(S_{\text{生命体}}\) 的低位),需要持续的负熵输入来维持。当消耗超过输入时,你正在加速自身的热力学终结。
\(r(t,T)\) 练习。 选择一个普通时刻(喝一杯水、走一段路),提醒自己:因为你的生命有限,总量 \(V(T)\) 也有限,此处的权重 \(r(t,T)\) 为正,此刻前后的这一段时间对你的总体验有正的贡献。
梯度与好奇心(B.3)。
好奇心梯度检测。 当你对生活感到乏味时,问自己:我的 \(D_{\text{KL}}\) 在哪些领域趋近于零了?哪里还有我完全不了解的不均匀性?列出三个你一无所知的领域,那里有未被消灭的梯度,是好奇心的燃料。
梯度消亡觉察。 在你最熟悉的领域中,觉察「成功利用梯度就是消灭梯度」,你越成功,驱动力越弱。这正是B.3所刻画的那个结构。把它当作信号:该寻找新梯度了。
选择与信念(B.4)。
信念更新日志。 每月记录一次:这个月有什么新证据改变了我的信念?如果答案是「没有」,你可能正处于遮蔽态 \(P(H \mid E) \approx P(H)\)。贝叶斯定理说:不更新就是不学习。
过度选择自检。 检查你的信息源:新闻、播客、社交媒体是否全部指向同一方向?如果是,你的信念分布 \(P_n\) 正在塌缩到单一的点 \(x^*\) 上,多样性正在被选择消灭。对策很简单:刻意订阅一个你不同意的观点源。
反馈与遮蔽(B.5 + B.6)。
反馈系数估算。 对于你最强烈的一个信念,估计它的有效反馈系数 \(\alpha + \beta \cdot R'(b)\) 是否大于1。征兆是:你越相信X,算法推送越多支持X的内容,你更加相信X。循环一旦激活,推荐项便是正的;单是加深,还不能说明已越过1:系数小于1时,信念也可能一路上升,趋向某个固定水平。是否越过1,看一个信号:没有新证据时,这个信念是否一直增长,停不到任何水平上。
\(\gamma\) 注入练习。 每周花三十分钟刻意「注入负反馈」:阅读你反对的作者,与持不同意见的人对话,审视你最确定的一个判断。这就是在增大式 (eq:lucidity-feedback)中的 \(\gamma \cdot C(b_t)\)。
涌现与整体(B.10)。
涌现觉察。 观察一个复杂系统(一群鸟的飞行模式、一场对话的走向、一个团队项目的成果)中涌现的整体模式。这个模式不存在于任何单独的部分中。提醒自己:这里的 \(\mathcal{I}_{\text{em}}\) 很可能为正,理解部分不等于理解整体。
创造涌现条件。 涌现需要三个条件:多样性(与不同背景的人交流)、连接(建立深度关系,使真正的交互成为可能)、时间(给过程以耐心,涌现需要交互的迭代)。
认知极限(B.9)。
「我不知道」练习。 每天找到一个你真正不知道答案的问题,停留在那个不知道中,不急于寻求解答。哥德尔告诉我们:有些不可判定是结构性的,不是暂时的。与不确定性和平共处本身就是一种能力。
框架审视。 每月审视一次你最常使用的「解释框架」(政治立场、宗教信仰、理论偏好)。T3说:任何框架都有边界。你的框架遮蔽了什么?它无法解释什么?能否指出它的哥德尔语句,那个它既不能证明也不能否证的问题?「哥德尔语句」在这里是类比:日常的解释框架不是形式系统。
明度积与平衡(B.12 + B.13)。
短板检查。 在你投入最多的一个领域里,问自己:理解度 \(\lambda\) 与玄觉度 \(\xi\),哪一个更低?明度是二者之积,梯度 \(\nabla\mathcal{M} = (\xi, \lambda)\) 说,在较低的那个分量上前进一步,换来的明度更多。把下个月的一部分时间放到较弱的那一面。
成长与耗散(B.14)。
维持账。 在主方程里,明度靠成长项上升,又按 \(\gamma\mathcal{M}\) 不断耗散;只有成长项压过耗散项(\(\alpha\sin 2\theta > \gamma\)),非零的均衡才存在。回想一项你已经停下的修习:停下之后,什么在慢慢退去?那就是耗散项在日常中的样子。
耦合与在场(B.15 + B.16)。
耦合清单。 列出你每周交往最多的五个人或五个信息源。耦合主方程说,你的明度被拉向与你相连者的明度。问自己:这份清单在把你往上拉,还是往下拉?
负耦合觉察。 留意一个让群体变得比成员平均水平更糊涂的场合:一场被带偏的讨论,一个只奖励附和的平台。亚可加条件(命题 B.16.4)说,集体明度可以低于个体平均;这时值得改变的是连接方式,群体里的每个人未必有问题。
B.18.2 · 遮蔽度自测:方向性量表
基于B.6的信息论模型,以下量表判断的是方向:你的 \(\mathcal{O}_t\) 在上升还是下降?遮蔽度的绝对值无法计算。
信息多样性维度(对应 \(I_{\text{new}}(t)\)):过去一个月,你接触了几种互相矛盾的观点?你的社交媒体信息流在最近半年是变窄了还是变宽了?上次和一个完全不同背景的人深入交谈是什么时候?
信念更新维度(对应 \(P(H \mid E)\) vs \(P(H)\)):过去一年,你改变了几个重要信念?你能清楚说出什么证据会让你改变当前最强的信念吗?你是否有「不可质疑」的信念?如果有,那就是 \(P(H) = 1\) 的状态,贝叶斯更新在此失效。
反馈结构维度(对应 \(\alpha + \beta \cdot R'(b)\)):你的信息环境中有多少负反馈机制(不同意见的朋友、对立观点的媒体)?你是否在过去一个月主动寻求过反对你的意见?算法推荐是否已经形成了闭环,你看到的内容越来越「像你」?
评估方法: 看方向,不打分排名。上述指标在改善还是恶化?\(\Delta\mathcal{O}_t\) 的方向比 \(\mathcal{O}_t\) 的绝对值更重要。
B.18.3 · 行动指南:从博弈论到伦理决策
基于B.11的博弈论框架,以下工具帮助你在面对伦理困境时做出更清醒的选择。
决策收益矩阵练习。 面对困难选择时,画一个简化的 \(2 \times 2\) 矩阵:我选择「清醒行动」与「遮蔽回避」时,短期收益和长期收益分别是什么?这个练习要做的是让隐含的激励结构变得可见,数字不必精确。
信任先手练习。 本周对一个人展示一次真实的脆弱性。式 (eq:trust-game)告诉你:信任博弈中先手合作者承担风险,但在没有固定最后一轮、未来又足够有分量的关系中(B.11的 \(\rho \geq 1/\chi\)),先手合作者建立了互惠的可能性。
打破遮蔽均衡。 如果你在某个群体中察觉到「集体遮蔽」(大家都不说真话,都在维持表面和谐),考虑成为第一个发声的人。式 (eq:collective-lucidity)告诉你:在 \(p\) 低于 \(p^*\) 时,每多一个发声的人,\(p\) 就离 \(p^*\) 更近一步;越过 \(p^*\),群体便倒向清醒。
明的检验(§VI.9)的博弈论重述。
清醒问 \(\to\) 我是在选择长期策略(高 \(\rho\))还是短期冲动(低 \(\rho\))?
关系问 \(\to\) 这个选择增加还是减少了合作博弈中的信任?
体验问 \(\to\) 这个选择拓展还是收窄了我的体验域 \(\mathcal{R}(m)\)?
敬畏问 \(\to\) 这个选择承认了不确定性(接受 \(\mathcal{O} > 0\)),还是假装拥有确定性(否认认知的有限性)?
B.18.4 · 体验的数学:当数字遇到肉身
数学可以描述有限性的结构(B.8):但无法替代你面对死亡时的颤抖。数学可以度量遮蔽的方向(B.6):但无法替代你看见真相时的痛苦与释然。数学可以刻画涌现的结构(B.10):但无法替代你第一次理解一首诗时的那个「啊」。数学可以刻画博弈的均衡(B.11):但无法替代你选择信任一个人时的心跳。
数学是明的工具,不是明本身。 B.2–B.16 提供的是一种看的方式,用精确的结构照亮原本模糊的直觉。但最深的实操超越了计算 \(\mathcal{O}_t\),它是活出 \(\mathcal{O}_t\) 持续降低的生命。
放下公式,去呼吸、去看见、去行动。然后,带着行动中获得的新理解,回到公式,你会看到不同的东西。
观 \(\to\) 判 \(\to\) 行 \(\to\) 省。
这是§VIII.4的循环,也是数学与实践的循环:
观:看见数学结构。判:理解其含义。行:在生活中实践。省:反思实践是否制造了新的遮蔽。
然后,再来一次。
物理学审计:框架的边界与张力
前面各节把明度框架一路推到星际尺度。这里转向相反方向,向内审视:明在哲学的物理学基础有多牢固?哪些物理原则已被吸收,哪些被有意搁置,哪些构成了真正的张力?
已吸收的物理学。 明在哲学的形式化体系从多个物理学分支中汲取了数学语言和结构灵感。以下是一份审计清单:
| 章节 | 物理学分支 | 吸收内容 |
|---|---|---|
章节 |
物理学分支 | 吸收内容 |
B.2 |
热力学 | 熵、第二定律、耗散结构 |
| B.3 | 信息论 | KL散度、梯度耗散 |
| B.4 | 贝叶斯推断 | 选择动力学、后验更新 |
| B.5–B.6 | 反馈与信息论 | 反馈动力学、遮蔽信息模型 |
| B.10 | 涌现理论 | 相变阈值、临界现象 |
| B.12–B.14 | 非线性动力学 | 主方程、logistic 增长、不动点分析 |
| B.15 | 网络动力学 | 扩散(共识)耦合、同步、拉普拉斯矩阵(Fiedler 特征值) |
| B.17 | 天体生物学 | 费米悖论、卡尔达肖夫等级、可探测性 |
有意搁置的物理学。 同样重要的是框架未使用的物理学。搁置分为三类:
量子力学。 明在哲学的全部形式化是经典的。没有波函数坍缩,没有叠加态,没有量子纠缠。状态变量 \(\lambda\)、\(\xi\)、\(\delta\) 都是经典的实数。这是有意为之:明在哲学描述的是觉知的现象学,而在人类经验的尺度上,觉知是经典的。
广义相对论。 光锥结构在B.17中形式化(式 eq:b18-light-cone,\(\beta \to 0\)意味着因果约束),但时空弯曲、等价原理、引力场方程均未被形式化。框架隐含假设了平坦时空。
守恒定律。 \(\lambda + \xi + \delta = 1\)是归一化约束,不是可由某条对称性经诺特定理推出的守恒定律。框架不声称「意识守恒」或「明度守恒」,这些量可以通过实践增长、通过耗散衰减。归一化仅表示:在任何时刻,存在状态在理/玄/蔽三域上的分布总和为一。
真正的张力。 在已吸收与有意搁置之间,存在少数真正的张力点,框架与物理学之间的摩擦面。
张力一:明度的热力学代价。 主方程中存在增长项(通过实践提高\(\mathcal{M}\)),但生命(尤其是清醒的生命)是局部熵减过程。局部熵减需要环境熵增来「支付」。耗散项\(\gamma M\)已部分扮演了这一角色;借等温条件下降低系统熵的下界作类比,可以把它与热力学的联系勾勒如下:
\[\begin{equation} \label{eq:b18-energy-cost} \dot{S}_{\text{明度}} < 0 \quad \Rightarrow \quad \dot{W}_{\text{实践}} \geq T \cdot |\dot{S}_{\text{明度}}| \end{equation}\]
其中\(T\)是环境温度,\(\dot{W}_{\text{实践}}\)是「实践功率」。明度正在提升(局部熵减,\(\dot{S}_{\text{明度}} < 0\))时,实践功的供给速率不低于\(T \cdot |\dot{S}_{\text{明度}}|\)。维持一个稳定的低熵状态时\(\dot{S}_{\text{明度}}\)为零,这个界便落空;维持的代价是非平衡稳态的「维持性熵产生」,这个类比没有把它形式化。B.14中的\(\gamma M\)项代它出场:停止修习的冥想者,也就停止了供给维持低熵认知状态所需的自由能。
张力二:时间之箭。 主方程是耗散的:它的非零均衡是吸引子,把时间倒过来便得到另一个方程,那个均衡在其中成为排斥子。所以方程本身已带着一支时间之箭,与实际实践的不可逆(公设六)方向一致。张力在下一层:这支箭是靠耗散项的符号放进去的,方程本身推不出它。正如统计力学中动理学方程是对可逆微观动力学的不可逆描述,方向来自边界条件和存在论约束,后者超越了方程本身。
认识论声明。 本框架是哲学的数学(关于存在的形式推理),而非物理的数学(自然的预测模型)。方程是结构类比,不是经验定律。它们不对粒子行为做预测,不被加速器实验检验。参照P7:任何关于实在的理论都只是有限的映射,穷尽不了实在。
明在哲学与物理学的关系是共鸣。框架借用了物理学的数学语言(微分方程、相变、网络理论),但赋予它们存在论的新意义。就像音乐借用了声学但不被声学穷尽一样,明在哲学借用了物理学但不声称自己是物理学。它的方程描述的是存在者如何清醒。
此处「互惠」取经济学与微积分的含义(两个维度互为对方增长的系数),与数论中的「二次互反律」(quadratic reciprocity)无关。↩︎
史密斯(H. L. Smith)的论文《凹非线性合作微分方程组》(Cooperative Systems of Differential Equations with Concave Nonlinearities,Nonlinear Analysis 第10卷,1986年,第1037–1052页)。此处用到的结论:对一个合作、不可约、右端为凹函数且在原点为零的系统,要么所有解都趋于零,要么有唯一的正均衡吸引正卦限内一切非零解。上面二主体图的每一幅只有一个吸引子,结构上的原因就在这里。↩︎
卡尔达肖夫等级(Kardashev Scale)由苏联天文学家尼古拉·卡尔达肖夫于1964年提出,按所利用的能量将文明分为三型:I型在行星尺度,II型在其恒星尺度,III型在其星系尺度。常被引用的数值(\(\sim10^{16}\)、\(\sim10^{26}\)、\(\sim10^{36}\) W)以及人类约为0.73型的评估,出自卡尔·萨根1973年的对数插值 \(K = (\log_{10} P - 6)/10\),\(P\) 以瓦为单位。↩︎
对于银河系内典型距离(\(\sim 10^4\)光年)和特征时间尺度 \(\tau \sim 10^2\) 年,指数因子为 \(e^{-10^4/10^2} = e^{-100} \approx 10^{-44}\),使 \(\beta_{ij}\) 实际上趋近于零。压制的程度由所选的 \(\tau\) 决定:若 \(\tau \sim 10^4\) 年,同一因子只有 \(e^{-1}\)。所以「星际耦合可以忽略」这个结论,依赖文明特征时间尺度远短于光行时间这一前提。↩︎
面壁者(Wallfacer)计划:人类选出四位「面壁者」,其真实战略只存在于自己的思维中,任何人(包括三体人的智子,见下条)都无法窥探。这是认知主权(P17)在存在性威胁面前的极端形式。↩︎
智子(Sophon):三体文明发射到地球的微观智能体,能够干扰粒子加速器实验,从根本上封锁人类的基础物理学进展。这是P19(AI的政治权力对认知生态的影响)在宇宙尺度上的实现。↩︎
降维打击(Dimensional Reduction Attack):将三维空间局部「坍塌」为二维平面,彻底毁灭其中的一切。这是最极端的理域武器,它直接攻击文明存在的维度结构。↩︎