
1. 引子一个被忽视的数学不等式“AI 一旦把世界变成向量就同时接受了向量空间的边界。”本书的故事从这句断言开始。1.1 无物不向量这句话听着像哲学口号实则是一句精确的数学陈述。今天的 AI 几乎“无物不向量”在检索增强生成RAG系统里用户问题与文档段落各自被压缩成高维向量再按余弦相似度排定名次决定哪一段喂给模型在推荐系统里用户与商品被放进同一个向量空间靠夹角的余弦度量“像不像”在语言模型内部每一个词都以向量形式存储与运算图像与语音同样先被翻译成向量。从早上的搜索框到深夜的短视频推荐每一次“猜你喜欢”背后都是一次向量夹角的计算。我们搜索、点击、浏览的一切最终都成了带长度与方向的点。向量是当代 AI 的通用货币。1.2 一条两百岁的不等式而“余弦相似度”这一无处不在的量的合法性建立在一条约两百岁的不等式上——柯西-施瓦茨不等式∣⟨u,v⟩∣≤∥u∥⋅∥v∥|\langle u,v\rangle| \le \|u\|\cdot\|v\|∣⟨u,v⟩∣≤∥u∥⋅∥v∥它断言两个向量的内积其绝对值永不超过两条长度的乘积。于是余弦相似度cosθ⟨u,v⟩/(∥u∥⋅∥v∥)\cos\theta\langle u,v\rangle/(\|u\|\cdot\|v\|)cosθ⟨u,v⟩/(∥u∥⋅∥v∥)被锁死在[−1,1][-1,1][−1,1]之间最像为 1最不像为 -1永远有界、永远可比。严格地说余弦相似度是两个向量夹角的余弦而“夹角”只有在不等式成立时才有定义。RAG 检索里问题与段落的夹角余弦趋近 1段落便近似“同义”趋近 0便近似无关——这个刻度之所以可靠正因为它被不等式锁死。为什么用夹角而不用距离因为文本长短不一长度会干扰比较夹角只看方向、不看长短这正是余弦相似度的妙处。你输入一个问题系统拿它与成千上万段文字逐一比夹角夹角最小者胜出——整个过程不过是在比较一堆数。没有这条不等式“相似度”根本无从谈起。1.3 全书悬念把语义装进向量是一桩交易我们换来可计算的相似度也默认语义服从向量几何。向量空间是一个线性世界擅长平行、加总与缩放却不擅长曲折、因果与例外。本书的核心命题由此展开——柯西-施瓦茨不等式揭示内积的有界性AI 把世界嵌入向量空间的同时也接受了向量空间的线性边界语义中非线性、非对称、组合爆炸的部分将逃逸向量表示。换一个说法几何给了语义可计算性也收取了“必须线性”的租金——边界不是缺陷而是能力的代价。一条看似无害的数学不等式如何悄悄划定 AI 的能力边界这是全书的悬念。第 2 章先看这条不等式的数学本质第 3 章再看文字如何被压成高维点边界的具体形态留待后续章节展开。2. 数学本质内积 ≤ 长度乘积2.1 不等式的准确表述设VVV是一个内积空间u,vu,vu,v是其中两个向量⟨u,v⟩\langle u,v\rangle⟨u,v⟩记二者的内积∥u∥⟨u,u⟩\|u\|\sqrt{\langle u,u\rangle}∥u∥⟨u,u⟩记向量uuu的长度范数。柯西-施瓦茨不等式断言∣⟨u,v⟩∣≤∥u∥⋅∥v∥|\langle u,v\rangle| \le \|u\|\cdot\|v\|∣⟨u,v⟩∣≤∥u∥⋅∥v∥内积的绝对值永远不超过两条长度的乘积。等号成立的充要条件是uuu与vvv线性相关——两条向量共线一个恰好是另一个的常数倍。直观地说只有两个向量指向完全相同或完全相反时内积的绝对值才顶到长度乘积方向稍有偏离内积立刻严格变小。当两个向量垂直内积为零相似度归零当它们同向内积达到最大相似度为 1——介于其间的所有夹角都被这条不等式换算成 -1 到 1 之间的一个数。反过来共线意味着两个向量携带的“方向信息”完全相同只是长短不同。内积度量的是“同向程度”uuu在vvv方向上的投影乘以vvv的长度而投影永不长于原长——这正是不等式的几何直觉。特别地当uuu与vvv正交时内积为 0与“垂直方向毫无重叠”的直觉一致。等号条件在语义世界里同样有味道两个词向量共线意味着二者方向完全一致只是“份量”不同。这条不等式为“相似”设定了上限也为整个向量几何铺平了道路。2.2 一条不等式三个名字近七十年这条不等式的命名史本身就是一部数学简史Cauchy1821证明有限和形式Bunyakovsky1859给出积分形式Schwarz1888推广到一般内积空间。Cauchy 的版本处理离散求和Bunyakovsky 把它搬到连续积分Schwarz 则抽掉了数列与函数的具体形态只留下内积公理。三人接力近七十年才让这条不等式适用于任意维度的向量空间。值得一提的是Cauchy 写下有限和版本时抽象向量空间的概念还要再过几十年才成形——一条不等式的三个版本恰好对应数学抽象化的三级台阶。它先后横跨数列、积分与抽象空间从傅里叶分析到词向量处处都有它的影子。### 2.3 它支撑起整个向量几何柯西-施瓦茨不等式绝不是孤立的技巧。三角不等式∥uv∥≤∥u∥∥v∥\|uv\| \le \|u\|\|v\|∥uv∥≤∥u∥∥v∥——“两边之和大于第三边”的向量版——正是它的直接推论。更重要的是只有先有它“夹角”cosθ⟨u,v⟩∥u∥⋅∥v∥\cos\theta\frac{\langle u,v\rangle}{\|u\|\cdot\|v\|}cosθ∥u∥⋅∥v∥⟨u,v⟩才永远落在[−1,1][-1,1][−1,1]让“夹角”概念在任意内积空间哪怕一千维的语义空间都严格合法。任一向量都能唯一分解为“沿另一方向的分量”与“垂直分量”靠的也是内积与范数的配合。长度、夹角、正交、投影——向量空间的整套几何骨架都悬在这一条不等式上。AI 天天使用的余弦相似度正是它最直接的受益者。因此AI 的“相似度”从来不是随意规定的它的每一步计算都踩在这条两百岁不等式的边界之内。3. 世界变向量Embedding 如何把文字压成高维点3.1 理论基石观其伴知其义把文字变成向量需要一个语言学假设撑腰。Firth1957提出分布假说“观其伴知其义”——一个词的含义由它身边经常出现的词决定。若“猫”与“狗”总是出现在相似的上下文里它们的向量就应当彼此靠近反之几乎不同框的词向量自然远离。试想“医生”与“护士”共享着医院、病房、患者这些上下文于是分布假说判定二者语义相近向量理应靠近。分布假说把“意义”问题转化成了“统计”问题不再追问词是什么意思而问它总和谁在一起。这一假说朴素得惊人却成了此后一切词嵌入的理论基石。3.2 三十年的脉络从假设到工业级工具词嵌入走过一条清晰的路线LSA对词-文档共现矩阵做低维分解最早把语料压进语义空间Bengio2003训练神经网络语言模型预测下一个词词向量只是“副产品”却是最早证明词向量能捕捉语义特征的代表性工作Mikolov2013Word2Vec 以 CBOW 与 Skip-gram 两种结构在海量语料上训练词向量由此工业化GloVe2014直接对全局共现统计建模与局部窗口法互补fastText2017以子词为单位拼词缓解生僻词与形态变化问题Transformer2017Vaswani et al.自注意力让词的表示随上下文流动此后 BERT、ELMo、GPT-2 输出“上下文向量”一词多义得到缓解——同一个“苹果”在不同句子里终于可以占据不同位置。三十年间从矩阵分解到神经网络再到注意力机制技术几经更替唯一不变的是那个基本设定把词表示成向量。值得注意的是这条线并非只有胜利向量从“静态”走向“上下文相关”正是为了修补固定坐标的失真——而修补本身已经暗示了线性的局限。3.3 语义似乎可以线性运算词向量最迷人的性质是 Mikolov2013发现的向量算术king⃗−man⃗woman⃗≈queen⃗\vec{king}-\vec{man}\vec{woman}\approx\vec{queen}king−manwoman≈queen“国王”减去“男人”加上“女人”约等于“女王”。这里的加减发生在向量层面先取词向量再对坐标做算术。在 8869 对语义类比测试中这类线性操作约 76% 命中正确答案。性别、单复数、首都与国家的对应仿佛都成了向量空间里的一次平移。语义似乎真的可以线性运算——这是向量表示的高光时刻。这一关系并非人为预设的规则而是从大规模语料的统计中自然浮现——分布假说的又一次胜利。3.4 伏笔还有四分之一呢但请盯着那个数字约 76%意味着约四分之一的类比失败了。线性是向量空间与生俱来的语法失败的四分之一则提示我们语义也许并不总是线性。线性近似是一个强假设它要求“意义”可以沿着直线平移而许多语义关系恰恰拒绝这种平移。如果语义真是线性的为什么会有四分之一逃逸答案或许正藏在柯西-施瓦茨不等式划定的边界里——我们将在后续章节回到这个问题。4. 余弦相似度的几何真相内积的化身及其必然边界4.1 从内积到余弦长度归一化之后余弦就是内积第 2 章证明了柯西-施瓦茨不等式∣⟨u,v⟩∣≤∥u∥⋅∥v∥|\langle u,v\rangle|\le\|u\|\cdot\|v\|∣⟨u,v⟩∣≤∥u∥⋅∥v∥内积的绝对值永远不超过两条长度的乘积。余弦相似度正是这个比值本身。对两个非零向量AAA、BBBcosθA⋅B∥A∥ ∥B∥∑iaibi∑iai2 ∑ibi2\cos\theta\frac{A\cdot B}{\|A\|\,\|B\|}\frac{\sum_i a_i b_i}{\sqrt{\sum_i a_i^2}\,\sqrt{\sum_i b_i^2}}cosθ∥A∥∥B∥A⋅B∑iai2∑ibi2∑iaibi分子是内积分母是两个长度。柯西-施瓦茨恰好保证这个比值永远落在[−1,1][-1,1][−1,1]内因此把它解释成“两个向量夹角的余弦”是合法的111同向000正交−1-1−1反向。若两个向量都非负如词频向量余弦落在[0,1][0,1][0,1]——最不像也只能是 0。再看一个特例当AAA、BBB都是单位向量长度为 1时分母为 1余弦就等于内积本身。换言之余弦相似度就是“长度归一化后的内积”——先各自除以长度再算内积。这句话是本章的钥匙AI 检索里形形色色的“相似度”剥开外壳几乎都是内积的变体。4.2 尺度不变性只看方向不看长度除以长度换来一个关键性质——尺度不变性对任意正数aaa向量VVV与aVaVaV的相似度恒为 1无论放大多少倍余弦纹丝不动。余弦只比较方向完全忽略长度。这正是它成为检索与推荐主流度量的原因。方向编码语义长度却常被无关因素污染文档的长短、词的频次、嵌入模型的任意缩放都会改变向量的模长却与语义无关。抹掉长度就抹掉了这些噪声剩下的“方向像不像”正是我们想要的话题相关性。推荐系统里用户与商品的历史向量稀疏且幅度不一只比方向才让“口味是否一致”成为唯一的比较基准。再进一步把向量先减均值再算余弦得到的正是统计学里的 Pearson 相关系数——几何与统计在这里合流。但代价是明摆着的长度携带的信息被一起丢掉了。一篇把某个主题重复一百次的文档与只提一次的文档方向可以完全相同。4.3 隐藏的代价1−cos 不是一个度量工程上常把相似度改造成“距离”1−cosθ1-\cos\theta1−cosθ夹角为零时距离为零越不相似距离越大。但数学上1−cosθ1-\cos\theta1−cosθ并不是一个度量metric它可能违反三角不等式d(A,C)≤d(A,B)d(B,C)d(A,C)\le d(A,B)d(B,C)d(A,C)≤d(A,B)d(B,C)。三角不等式是距离的底线——“绕路不会更近”它一旦失效“近”就失去传递性最近邻索引、聚类这类依赖距离几何的算法便失去了理论保证。已有研究者专门为余弦相似度构造三角不等式的变体这恰恰说明它原生并不满足——那是补救不是天性。真正合法的度量是角度距离θ/π\theta/\piθ/π先取夹角θ∈[0,π]\theta\in[0,\pi]θ∈[0,π]再除以π\piπ归一化到[0,1][0,1][0,1]它满足度量的全部条件代价只是要多算一次反余弦。这是全书命题的一个技术锚点AI 把语义相似度强制放进了一个“连三角不等式都不满足”的尺度里。它被广泛使用正因为它出生自内积——一个被柯西-施瓦茨死死约束、压进[−1,1][-1,1][−1,1]的线性量。好用与危险同源。边界的代价如何逐一兑现第 5 章展开。5. 边界的代价语义的线性化假设5.1 类比算术的 76% 精度第 3 章展示了向量表示的高光时刻“国王−男人女人≈女王”在 8869 对语义类比上约 76% 命中Mikolov 2013数值随测试集不同而变化——语义关系仿佛只是向量空间里的一次平移。但这句“仿佛”经不起细看。76% 意味着约四分之一的类比在向量空间里不成立。线性假设要求“意义”能沿直线平移规则性关系近似平移于是成功拒绝平移的关系成批失败。76% 不是工程 bug而是线性假设的精度上限语义只有一部分活在向量的语法里。5.2 多义性被压缩一词一向量义项取平均词向量一词一向量而一个词常有多个义项“苹果”是水果也是公司“银行”是机构也是河岸。Arora2018给出定理级结论多义词的向量近似等于各义项向量的频率加权平均。向量被迫把多个意义压进一个点且按使用频率加权高频义项主导方向低频义项被稀释成噪声。对“苹果发布了新手机”这样的句子模型若不靠上下文区分义项单一向量注定顾此失彼。上下文向量第 3 章部分缓解了这一问题但只要最终还是一个点压缩就不可避免。5.3 反义词的幽灵越对立越靠近人类语义里“好”与“坏”强烈对立在向量空间里反义词却往往拿到中等到较高的余弦相似度而人类给它们的评分很低IWCS 2023。原因在分布假说反义词几乎出现在完全相同的上下文位置“好”与“坏”的邻居高度重合向量被拉近。模型眼中极相似的一对词人眼中截然相反。余弦是对称的、只比方向而“对立”恰恰是一种方向之外的关系。学界对此仍在争论有研究者主张反义词的相似度本应接近 −1也有研究认为这是评估方法问题而非嵌入缺陷经 IWCS 2023 转引。本书记为“学界争论中”但“对立逃出向量”是双方都承认的事实。5.4 语义锥体所有词挤进一条窄锥Ethayarajh2019测量了 BERT、ELMo、GPT-2 的向量分布远非均匀铺满空间而是高度非各向同性——几乎全部词挤在语义空间的一个狭窄锥体内任意两个词向量的平均余弦相似度可高达 0.99。Gao2019把这一现象命名为“表征退化问题”representation degeneration。回想第 4 章余弦相似度就是长度归一化后的内积。所有词两两“几乎平行”时相似度有效区间只剩小数点后几位。柯西-施瓦茨给出的[−1,1][-1,1][−1,1]实际只用上极窄一角模型被迫在噪声级别上区分语义。更精细的研究表明全局锥体内仍存在局部各向同性的低维结构### 5.5 维度灾难高维空间里人人都是近邻还有一重边界来自维度。随着维度升高高维几何出现反直觉的收缩MIT 与 DeepMind 的研究者指出在高维度量空间中点与点之间的距离趋于任意接近最近邻检索因此失效arXiv:2512.12458。现代嵌入动辄上千维余弦区分力同样随维度上升而衰减。低维直觉“每个点只有少数近邻”在高维里失效人人都挤向同一个球面。### 5.6 收束不是 bug是数学宿命五段记录指向同一个结论。类比只有 76%因为线性只是近似多义词被压成一个点因为一词一向量反义词彼此靠近因为共现不分敌我词全挤进窄锥因为各向同性没有保证高维点距趋于相等因为几何在收缩。这些都不是工程失误而是把语义装进向量空间必须支付的代价——柯西-施瓦茨保证了内积有界、余弦合法但“合法”不等于“充分”。线性空间只能线性地承载语义语义中非线性、非对称、组合爆炸的部分注定从边界逃逸——第 6 章将看到它们如何兑现。6. 逃逸的语义哪些关系困不住向量6.1 上下位与蕴含的失败词向量最拿手的是回答这两个词像不像但语义远不止像不像。一篇系统综述给出了清晰结论词向量善于捕捉相关性/相似性coherence对关系型语义relational meaning则力不从心PMC 综述。所谓关系型语义指的是上下位hyponymy与蕴含entailment这类有方向的关系——狗是动物成立动物是狗不成立。有研究进一步指出嵌入模型虽能捕捉词的分类信息恰恰在上下位与蕴含关系上失败Dialnet, IJIMAI 2022。原因藏在余弦相似度的公式里。余弦是对称的cos(u,v)cos(v,u)\cos(u,v)\cos(v,u)cos(u,v)cos(v,u)uuu像vvv的同时vvv必然同样像uuu。但蕴含是单向的狗蕴含动物为真动物蕴含狗为假。向量按常出现在相似上下文把词拉近狗与动物频繁同框于是两者对称地靠近——相似度很高方向信息却丢了。同样的错位还发生在反义词上嵌入模型常给反义词中等到较高的余弦相似度而人类认为它们极不相似IWCS 2023。向量空间只有近/远一把尺子没有上/下与蕴含/被蕴含的箭头。追根溯源词向量的地基是第 3 章的分布假说意义来自共现。而共现统计给出的是相关性信号不是逻辑箭头——狗与动物总在一起于是被拉近但谁包含谁这件事语料里没有向量里也没有。### 6.2 组合性的幽灵比词与词的关系更早被质疑的是句子意义能否由向量拼出来。1988 年Fodor 与 Pylyshyn 在《Connectionism and cognitive architecture: A critical analysis》中提出著名思想实验一个能理解 “John loves Mary” 的系统理应自动能理解 “Mary loves John”——两者由同样的部件按不同方式组合而成理解必须具有系统性与组合性。他们的批评是分布式向量把意义摊在一堆数值里哪里找得到主语、谓语、宾语的结构向量相加得不到句法两种语序的差别可能被平滑掉。Smolensky1988回应 Fodor Pylyshyn以《Connectionist Mental States: A Reply to Fodor and Pylyshyn》回应用张量积把角色与填充物绑在一起——角色rrr绑定内容fff记为r⊗fr\otimes fr⊗f张量积空间足以承载组合结构组合性未必只能靠符号。这场符号 vs 向量之争没有终局却把问题钉在了墙上组合结构不是向量表示的免费午餐。三十多年后余波仍在——有研究指出Transformer 的嵌入向量本身源于 NLP 分布语义传统正是符号与联结主义两种思想的合流Springer 2024。争论的双方最终在同一套向量里相遇。### 6.3 系统泛化的实验证据2023 年Lake 与 Baroni 在《Nature》623 卷用实验把争论推进了一大步。他们设计伪语言指令任务模型学会跳两次与走三圈后能否把部件重新组合正确执行从未见过的走两次“跳三圈”人类几乎不费吹灰之力而标准序列到序列神经网络显著失败。真正值得注意的是后半段只有用元学习MLC显式优化组合能力后神经网络才能逼近人类级的系统泛化Lake Baroni 2023。这个结果反证了一件事普通向量网络默认不具备系统性。组合能力不会从词压成向量 大语料训练中自动涌现它需要被显式地设计进训练目标。这正是第 3 章那个约 76%的另一面能线性平移的类比成功了需要重新拼装的组合失败了。6.4 收束代价而非缺陷把这一章拼起来看到的不是某个模型的 bug而是把意义装进线性空间这一选择的代价。第 2 章的不等式给了相似度一个严格的刻度也同时划定了刻度的边界内积度量同向程度却度量不了方向之外的结构。上下位与蕴含逃逸因为余弦不辨方向组合性逃逸因为拼装结构不在向量的语法里。第 5 章的线性化假设在此逐一兑现。语义中非线性、非对称、组合爆炸的部分恰好落在向量几何的盲区。这不是向量还不够好而是有些意义根本不是相似度这种量能够承载的。## 7. 边界之外图、符号、结构化表示与下一代 AI7.1 知识图谱如果说向量擅长回答像不像图擅长回答是什么、与谁有什么关系。知识图谱采用图结构化数据模型实体为节点关系为有向边语义关系被显式编码Wikipedia, “Knowledge graph”。这条线索脉络清晰WordNet1985为词义关系建词网DBpedia 与 Freebase2007从结构化数据中抽取大规模实体关系Google Knowledge Graph2012的引入正是为了弥补纯关键词与统计检索的不足——搜索引擎开始知道泰姬陵是一座建筑而不只是包含这些字的网页。在图里“狗—是—动物是一条有方向的边方向即上下位“哪位画家生于荷兰是一次沿边的路径遍历。这些正是第 6 章里逃逸向量表示的结构非对称、可组合、可推理。图的代价同样明显它需要人工或半自动地把世界显式写出来无法像向量那样从语料中自动长出来。但它的收益也正来源于此——每一条边都被显式地写清、可被人类逐条检查推理的每一步都留有痕迹。向量给的是算出来像不像”图谱给的是推出来是不是”。7.2 神经-符号融合于是两条路线有了明确分工。一句话定性神经网络与大语言模型擅长学——从海量数据中隐式习得、黑箱运作知识图谱与符号 AI 擅长知——显式编码、可解释推理metaphacts 博客。学习给出泛化知识给出可信。更进一步神经方法擅长感知与模式识别符号方法擅长知识表示、逻辑推理与可解释性IOS Press《Handbook on Neurosymbolic AI and Knowledge Graphs》。而把两者接起来的核心技术挑战是把符号映射到嵌入一边是连续向量一边是离散符号与规则两种表示本质不同。当前趋势正是让二者混合知识图谱充当符号逻辑与深度学习两个世界之间的桥梁。学与知各司其职。7.3 回望柯西-施瓦茨回到全书开头那条不等式∣⟨u,v⟩∣≤∥u∥⋅∥v∥|\langle u,v\rangle| \le \|u\|\cdot\|v\|∣⟨u,v⟩∣≤∥u∥⋅∥v∥。它给了语义一个可计算的支点——相似度因此严格、有界、可比较AI 的每一步检索与推荐都踩在它划定的边界之内。但边界不是终点这条不等式从来没有说语义只能如此。它只说明一旦把语义全部装进向量你就默认了线性、对称与有界。向量给了算的能力符号给了推的结构。回望来路Transformer 的嵌入向量源自分布语义传统本是符号与联结主义两条路线的合流Springer 2024——如今的分工不过是让这场合流再向前一步。下一代 AI 的关键不是二选一而是让两者各司其职向量度量相似图谱承载结构逻辑执行推理。7.4 结语理解边界是超越边界的第一步从一条约两百岁的不等式出发我们看清了 AI 的边界从何而来世界被嵌入向量空间的那一刻柯西-施瓦茨不等式就把内积钉在了长度乘积之内——相似的刻度由此可靠语义的线性边界也由此划定。非线性、非对称、组合爆炸的语义从边界逃逸不是偶然的失灵而是这场交易的价签。两百年前柯西写下那个有限和版本时大概想不到它会在两个世纪后为机器的理解划定疆界而理解这条边界并不是故事的终点知道什么逃出了向量才知道该用什么把它接住——这正是超越边界的第一步。所谓困在向量里从来不是牢笼而是一种坐标系的取舍选了向量就要接受它的边界看清边界才能决定何时走出它。