240
第 11 章 张量的发明¶
1861 年,格雷戈里奥·里奇(Gregorio Ricci)八岁,一连串旷日持久的政治与军事谋划终于以意大利王国的宣告成立而告终。这意味着,意大利那些彼此割裂的邦国、公国与王国,大多数终于正式地——即便不总是心甘情愿地——统一在了一起。但主导里奇童年的却是宗教。他的父亲是一位贵族地主、商人兼工程师,也是一位虔诚的罗马天主教徒;他表达自己的信仰,靠的不只是给教会的大笔捐赠,还有给饥饿的人饭吃。而他的母亲会带着四个孩子一起上街,去寻访穷人——尤其是穷苦的妇女。她似乎担当着一种劝导者的角色,倾听她们诉说苦处,并给予安慰。小里奇对母亲倾听每一个辛酸故事时那种一次次停下来、等下去的场面满腹牢骚,然而她在那情形中的尊严给他留下了持久的印象;而他本人也终身是一位虔诚的天主教徒。1
241
顺便说一句,里奇家族的姓氏是里奇·库尔巴斯特罗(Ricci Curbastro),但在他那篇关于张量微积分的里程碑式论文上,他署名“里奇”,所以今天人们就用这个名字称呼他。(我该提一句,类似地,詹姆斯·克拉克·麦克斯韦家的姓氏是克拉克·麦克斯韦,但他的朋友们称他为麦克斯韦。)小里奇是个勤奋的学生,用他一位老师的话说,有着异乎寻常的“穿透性心智”和“活泼的巧思”。2 接着,1869 年,他开始在罗马的教皇大学学习数学——但 1870 年夏天,因为又一场战争,他不得不回到家中。法国人原本与教皇的军队结盟;而当普鲁士人取胜之后,意大利的新国王抓住机会攻占了罗马,把它并入了新生的意大利王国。
如今罗马成了这个新国家的世俗首都,原先的教皇大学校舍也被国家接收,里奇于是把目光投向了历史悠久的博洛尼亚大学,那里离他位于意大利东北部的家乡卢戈-迪罗马涅(Lugo di Romagno)要近得多。为了取得入学资格,他不得不额外补一些功课——整整两年的量,可见那场政治动荡让他付出了多大代价。尽管如此,他是支持统一的;而且,他告诉一位朋友,在博洛尼亚还意味着“我可以更专注、也更热忱地关注我们的同胞——那些缔造了统一的意大利的人——[在卢戈]将要推行的政治改革”。3
在博洛尼亚度过极其出色的一年之后——他的微积分、化学和几何考试都拿了满分——他决定再次迁走,这一回是去比萨,因为那里有生气勃勃的数学学派。1875 年他拿到博士学位,次年又拿到教师资格证书——倒不是说他当时能找到工作,因为大学的职位十分稀缺。于是他以独立学者的身份留在比萨,研读最新的数学与物理学。和爱因斯坦一样,当他发现麦克斯韦的电磁理论时也格外兴奋——而在 1877 年,这确实是你在学校里学不到的前沿研究。麦克斯韦本人尚在人世,而距海因里希·赫兹产生出那如此壮观地证实了该理论的无线电波,还有十年时间。
242
在几次申请教职失败之后,里奇从公共教育部获得了一份研究员职位——他就是这样来到著名的费利克斯·克莱因(Felix Klein)门下学习的。克莱因当时常驻慕尼黑,已经因为发现了不变量理论与坐标变换群之间的关系而闻名;三十年后,亨利·庞加莱和爱因斯坦将证明洛伦兹变换构成一个群。正如我们前面看到的,正是在这些坐标变换之下,闵可夫斯基度规与麦克斯韦方程组保持不变——我在图 9.3 的框内图注里简要说明过它们为什么构成一个群。克莱因还发展了阿瑟·凯莱关于曲面的投影的工作;总而言之,他的数学兴趣之广,使得 1878 年秋天里奇抵达慕尼黑时,被克莱因摆在他面前的那个学习与研究计划压得喘不过气来。不过,他发现克莱因是一位“和善的”导师,在学习上给了他“有力的帮助”。4
更重要的是,与克莱因共事帮助里奇培养起了对自己能力的信心——这是一位老师给学生的绝好礼物。1890 年代奇泽姆(Chisholm)在克莱因门下读博士时,同样令她印象深刻的也不只是他那卓越的头脑,还有他鼓励学生要有“绝不迟钝!”的自信的那种方式。(1895 年她取得博士学位后不久——那是德国正式授予女性的第一个博士学位——她嫁给了她从前在格顿学院(Girton)的导师威廉·扬(William Young),所以今天她更为人知的名字是格蕾丝·奇泽姆·扬(Grace Chisholm Young)。她的博士论文研究的是克莱因的专长——代数群——在球面几何上的应用。)5
跟随克莱因一年之后,里奇又花了几年徒劳地寻找全职的大学职位——直到终于在 1880 年冬天,他被任命为帕多瓦大学的数学物理副教授。伽利略、哥白尼和卡尔达诺,不过是这所古老而开明的机构那批杰出前辈中的三位;而里奇将在这里度过接下来的四十五年。
243
作为帕多瓦的一名学者,他最初发表的论文是关于电磁学和微分方程的,但他很快就被不变性背后的数学迷住了。他也觉得是时候找个妻子了。他第一次坠入爱河是在比萨读书的时候,但那个女孩鄙夷了他笨拙的痴情。后来他哥哥那位“不合适”的恋人又激起了他保守的天主教父母的暴怒——她出身贫寒、家世不合常规,但真正让老里奇恼火的是她是自家亲戚,而他确信上帝不会认可这样一桩乱伦的结合。于是,三十岁的里奇决定,既要免受心碎之苦、又要避免父母不悦,最好的办法是去向当地的教士讨教相亲的意见。教士很乐意效劳,他安排里奇结识了一位活泼、聪慧且极为合适的年轻女子,名叫比安卡(Bianca)。那是一段美满的恋爱,她成了他的新娘和终身伴侣。6
不过,里奇做的可不只是谈情说爱。就在他结婚的同年,1884 年,他发表了通往张量分析之路上的第一篇论文。他的灵感来自黎曼和高斯的著作,论文讨论的是“二次微分形式”的变换性质——所谓二次微分形式,就是成对的微分的平方或其他乘积之和,就像我们在基于毕达哥拉斯定理的距离度规中见过的那样。我们在高斯度规上见到过其中一些性质,它在弯曲变换下是不变的——就像那张卷起来的纸,表明圆柱面的内蕴平直性与摊开的纸并无二致——在闵可夫斯基度规的洛伦兹不变性上,我们也见到过。1876 年,黎曼 1861 年那篇关于热的论文发表,它把高斯的工作推广到了 n 维;此后有好几位数学家接过了他的思想。但里奇的目标是“避免关于三维以上空间的存在与本性那种懒散的讨论”,并且把目光投向同事们对微分形式之应用的关注之外。相反,他想要对这套数学理论给出一种清晰的理解。7
244
四十年前,我们在哈密顿发展向量代数与向量微积分的规则时就见过这种对理论的强调。他从他的 i, j, k 的乘法规则入手——那正是他得意地刻在布鲁姆桥上的东西——而这些规则使他得以定义新型的乘法:四元数积、标量积和向量积。一旦手里有了这些,他就创造出了微分学的向量算子纳布拉,∇。直到麦克斯韦从泰特那里学到所有这些规则——并且给纳布拉的那几种运算起了梯度、散度和旋度的名字——他才安心地把向量微积分用进他的电磁理论。那么现在,为张量确立类似的规则,正是里奇着手要做的事。
倒不是他管它们叫张量:他干脆把它们称作“函数组”。举例来说,黎曼“线元(line element)”(即度规)Σβι,ι′dsιdsι′ 中的系数 βι,ι′,如今被称为一个张量的分量;而正如我们在第 10 章看到的,在曲面上它们是坐标的函数——所以,事实上,它们就是一组(或者说一个“系统”!)函数。(所以严格说来它们是“张量场”,但正如我在上一章提到的,不那么严格地说,叫“张量”也就够了。)我们后面会从数学上看明白度规为什么是一个张量——黎曼那个四指标的量也一样,里奇称之为“黎曼系统”,所以如今它叫黎曼张量。里奇没有说“张量微积分”,而是把他这套系统的微积分命名为“绝对微分学(absolute differential calculus)”。他说的“绝对”指的是不变,因为张量的有趣之处正在于,它们把不变性这个观念编码了进去。
不过,在讲里奇的数学之前,我要先把张量的基本观念勾勒出来:它是表示信息、并用信息进行计算的一种方式——就像向量一样。但首先,我要告诉你张量是怎么得到它们现代这个名字的。
张量如何得名——以及它们如何表示数据¶
“张量(tensor)”这个术语,是经哥廷根的数学教授沃尔德马尔·沃伊特(Woldemar Voigt)之手、从哈密顿那里传到我们这里的。但真正把这个名字牢牢确立下来的是爱因斯坦,那是在他和马塞尔·格罗斯曼(Marcel Grossmann)弄懂了里奇的绝对微分学之后。哈密顿是在另一个语境下使用这个术语的——作为四元数的模,他类比复数的模来定义它。它是四元数各分量平方和的平方根——正如向量的模是由它的各分量的平方和求得的。而在现代语境下第一个使用“张量”这个术语的,是沃伊特——在他 1898 年那本关于晶体学(crystallography)的书中;顺便说一句,奇泽姆·扬和她的丈夫在《自然》(Nature)上为这本书写了好评。8
245
沃伊特具体指的是晶体中的应力与张力(stress and tension)——而“tension(张力)”来自拉丁语“tensio”,后者又来自“tendere”,意思是“拉伸”。但沃伊特说,他只是在延伸哈密顿对“tensor”的用法。举例来说,向量积即叉积 a × b 产生第三个向量 c,它的模(也就是哈密顿意义上的“tensor”)与 a 和 b 的模(它们的“tensor”)有关。换句话说,叉积从两个模(“张量”)给出了一个新的模(“张量”)——而我们马上会看到,里奇张量分析的新颖之处之一,正是张量乘法能从旧的张量产生出新的、“高阶的”张量。
格拉斯曼也有过这个想法。正如我们在第 5 章看到的,他不用“向量”这个术语,而是用德语词 strecke,可以译作“线或伸展”——而他的基本几何对象是可以被“拉伸”或“延展”而构成平面的“线”,正如两个向量按平行四边形法则构成一个平面。格拉斯曼把两个三维向量的外积定义为由这两个向量所围成的平行四边形的有向面积。通常的向量积即叉积实际上也做到了这一点,但只适用于平行四边形;而格拉斯曼对外积的定义则意味着,你随后可以再加一个向量,把平行四边形延展成一个盒子,如此等等,想加多少新维度就加多少。
1880 年代,吉布斯进一步发展了格拉斯曼的想法,基本上撞上了与里奇大约同时正在创造的那种张量乘法的类似定义。今天它被称为“张量积(tensor product)”,或者沿用格拉斯曼的说法叫“外积(outer product)”,尽管吉布斯和里奇并没有用这些名字。它是把两个张量的信息合并成一个的一种方式——一种乘法版的罗马数字,你增添更多的符号来增大一个数的大小:I、II、III、V、VI、VII、VIII,如此等等。这个类比也说明了外积一般是不可交换的:VI 与 IV 是不同的数。
246
你可以在图 11.1 中看到张量(或外)积这个想法——它还凸显出一件事实:向量和矩阵都可以被看作张量。这背后有相当深刻的数学理由,不过眼下只需注意到,和张量一样,它们的分量是用指标来表示的——向量用一个指标,矩阵用两个,正如图 11.1 的图注所详细说明的那样。当然,正如我在第 9 章暗示过的,张量的标志并不止于它的分量是用指标来标记的——不过眼下我们且先这么看。因为张量积是一种产生新张量的方式,新张量带有更多的指标,而每一个指标都告诉你关于该张量分量所表示之数据的某种特定信息。

图 11.1 图 11.1 张量(或外)积把参与相乘的那些张量的信息合并起来。普通的数用诸如 a 这样的符号来表示。如果它们表示的是不依赖于坐标的量——比如温度——那么它们就是标量,而既然标量在坐标变换下不变,它们就是张量。我们会看到向量也是张量,而我们此前也已经看到,它们的分量用一个指标来标记,这个指标代表测量该分量所沿的那条轴。列向量 u 与行向量 v 的张量积可以表示成一个矩阵。你可能熟悉用符号 aij 表示矩阵第 i 行第 j 列的元素,所以这里 aij = uivj。我会在正文的二维例子中详细说明这一点。同样地,你可以构造出更多的张量积。例如,单指标向量 u 与矩阵 A 的张量积,其分量带有 3 个指标,你在正文中也能看到。类似地,如果矩阵 A 与 B 各自都由向量的外积构成,那么它们的张量积的分量就是 cijkl ≡ uivjwksl,如此等等。这并不是构造新张量的唯一方式,但请注意,随着张量的“秩(rank)”增大,你能表示的信息就更多。这个“秩”也叫张量的“阶(order)”,因为里奇提出这个想法时就是这么称呼它的。它与从一个坐标系变换到另一个坐标系所需要的变换矩阵的个数有关,但本质上它对应于指标的个数,每一个指标代表着一种不同类型的信息。(如果你熟悉矩阵代数,请注意:对于被视为张量的矩阵而言,这里“秩”的用法与线性代数中的用法不同。)关于这一点,我们后面还会看到更多。(图内标注为英文:Scalar=标量,u is a single number=u 是一个数;Rank 0–Rank 5=秩 0 至秩 5。)
247
张量与数据科学(以及量子力学一瞥)¶
图 11.1 也说明了张量如何在今天的数据科学中让数据得以存储和合并。在第 4 章里,我概述过向量和矩阵怎样被用于机器学习和搜索引擎,但有了张量,你能加进去的就不仅仅是更多的数据,而是不同种类的数据。举例来说,我们见过在搜索引擎中,信息可以存储为一个矩阵,行代表关键词,列代表包含这些关键词的不同文档。有了张量,你不仅能添加更多的词或更多的文档——那种事只要把矩阵做大就行——还能添加你塞不进矩阵里的额外信息。例如,如果你想加上文档的出版日期和作者,你就必须把你原来的矩阵扩展成图 11.1 所示的那个四维形状。关键在于,每一种信息都有它自己的指标。
张量的另一个现代应用是信号处理,比如用于解读脑电图(EEG)或心电图(ECG)。除了信号的空间分量之外,你可能还想知道诸如它的时间分量和频率分量这类东西——而同样地,每一种信息都需要它自己的指标。
248
所以,分量的个数与指标的个数是有区别的。在普通的向量分析中我们见过,在 n 维空间中(更严格地说,在一个 n 维“向量空间”——即具有群性质的 n 维空间中),一个向量有 n 个分量,每一个分量是从 n 条坐标轴中的一条去测量的。特定的轴给出了该分量上的特定标签——所以一个向量的分量是 v1 ≡ vx,如此等等,一直到 vn。换句话说,你有 n 个分量,但每个分量只有一个指标——而这一个指标取 n 个值中的一个,每一维一个值。我们也见过,矩阵的每个分量(或元素)有两个指标:一个定位行,另一个定位列。你需要这两个位置才能确定某个特定元素的位置,所以你需要两个指标。类似地,我们在图 9.5 中看到,应力张量的一个分量需要两个指标,一个指出应力作用其上的那个面,另一个指出力;在三维空间中,每个指标取从 1 到 3(或从 x 到 z)的值,于是总共是 3 × 3 = 9 个分量,正如我们在图 9.4 中看到的。
高阶张量也是如此。举例来说,我在上一章提到过黎曼张量,它有四个指标。乍一看很容易以为,它需要四个指标是因为它表示四维时空的曲率——但我们是在四维中工作这件事,只不过意味着黎曼张量上的每个指标可以取四个值,每一维一个值。而这些指标本身,各自代表着黎曼张量的一种不同属性、或者说一个不同的构造块。9 所以,普通空间中的应力张量有 3 × 3 = 9 个分量,而时空中的一个四指标张量将有 4 × 4 × 4 × 4 = 256 个分量:四个指标各有四种坐标选择。你能把这么多信息塞进一个张量里!而且你还可以继续下去,要多少维、多少阶的张量都行。(不过,如果一个张量具有“对称性”,就像黎曼张量那样——比如交换或者说“反射”两个指标并不改变该分量的值——那么它的某些分量是相同的,于是它能表示的数据量就减少了。)
再举一个数字张量的应用:在图像处理中,每个像素的位置用一个矩阵来表示,矩阵的行和列代表图像的尺寸——但要生成彩色图像,就需要三层矩阵,红、绿、蓝三色各一层。(这三种颜色是麦克斯韦发现彩色幻灯片摄影留下的遗产:他和他的助手托马斯·萨顿(Thomas Sutton)用红、绿、蓝滤镜拍下了史上第一张永久性的彩色照片,也就是我在第 6 章提到过的那条格子缎带。10)所以,编码相关像素信息的那个张量,它的第三个指标代表颜色。类似地,换个例子来说,如果医学诊断能把来自各种不同检查类型的数据合并起来,每一种类型由一个指标表示,那么诊断就会更准确。这类多指标构造——这些张量,以及它们的积——在数据科学中如此重要,以至于谷歌把自己的一个机器学习平台命名为 TensorFlow,此外还有各种各样的其他程序和工具,比如 Tensorlab 和 Tensorly。
249
既然张量积这么重要,我就把由图 11.1 中那样的列向量 u 与行向量 v 的张量积生成一个矩阵这一想法详细说明一下。为简单起见,这里我把向量取成二维的:
这是把两个向量的信息合并起来的一种巧妙方式,而且在这个情形下它也遵循普通矩阵乘法的规则。但当你试图用 u 去乘一个 2 × 2 的矩阵时,你就能看出矩阵乘法与张量积的区别:普通的矩阵规则根本不允许你拿一个 2 × 1 的矩阵去乘一个 2 × 2 的矩阵,但张量积允许:
$\(\left(\begin{matrix} u_{1} \\ u_{2} \end{matrix}\right)\left(\begin{matrix} a_{11} & a_{12} \\ a_{21} & a_{22} \end{matrix}\right)=\left(\begin{matrix} u_{1}\left(\begin{matrix} a_{11} & a_{12} \\ a_{21} & a_{22} \end{matrix}\right) \\ u_{2}\left(\begin{matrix} a_{11} & a_{12} \\ a_{21} & a_{22} \end{matrix}\right) \end{matrix}\right)=\left(\begin{matrix} u_{1}a_{11} & u_{1}a_{12} \\ u_{1}a_{21} & u_{1}a_{22} \\ u_{2}a_{11} & u_{2}a_{12} \\ u_{2}a_{21} & u_{2}a_{22} \end{matrix}\right)\)$.
250
所以,张量积是把两个(或更多)系统或集合的信息合并成一个大系统、大集合的一种方式。举例来说,想想支撑着下面这些奇妙之物的自然语言处理(NLP)程序:电子邮件垃圾过滤器、语言翻译器、把口语转成文字(供有听力障碍的人使用,比如给电视节目配字幕)、你 GPS 里那个热心的声音、公司聊天机器人发出的礼貌文本、网络搜索乃至电子邮件和 Instagram 这类应用里用的预测文本,以及 OpenAI 的 ChatGPT 这样的机器人生成出来的、惊人地像人写的文字。张量积可以提供一种把一组词与一组语法指令结合起来的办法——其中词被表示为向量,办法是给它们在词表中指派一个位置,语法也是一样。我该在这里补充一句:用来开发精密 NLP(尤其是大语言模型,即 LLM)的许多训练数据,是从网上抓取的、由人生成的内容,而内容创作者对此毫不知情,也没有许可过;作家和艺术家们正在试图反击这种盗窃,这让我感到欣慰。11 但既然张量本身并不是问题所在,而 NLP 与 LLM 程序和应用既有好处也有问题12,我就继续讲下去,讲讲张量积这个绝妙的应用。
为了简单起见,假设词表中包含三个词,“cats、love、mice”,并且每个词被指派一个从 1 到 3 的位置编号。因此这些词的向量表示的维数就是三,所以如果“cats”在第一位、“love”在第二位、“mice”在第三位,那么这些词就会被表示为向量 (1,0,0)、(0,1,0)、(0,0,1),我分别把它们记作 C, L, M。要造出句子“Cats love mice(猫爱老鼠)”,只要把这些向量加起来:C + L + M = (1,1,1)。但这与“Mice love cats(老鼠爱猫)”的向量表示并没有区别,而这显然是不对的。所以,正是在这里,张量积可以派上用场。取第二组向量,代表这些词将要扮演的角色的关键语法指令:主语、宾语、动词,比如说记作 S, O, V,并分别表示为 (1,0,0)、(0,1,0) 和 (0,0,1)。“cats”(表示为列向量)与“subject”(行向量)的张量积,就可以按我们前面刚看到的列向量与行向量的方式来表示:
“mice”与“object”、以及“like”与“verb”的张量积也类似。现在你就可以构造出一个没有歧义的句子,
其中 ⊗ 是张量积的符号。这与“Mice love cats”不同:
251
尽管这个句子是假的,它却是没有歧义的。
这个例子只是把张量积应用于 NLP 的其中一种方式。13 而在量子力学中,应用它们的一种方式是用来表示多个粒子的“量子态(quantum state)”。
我们在序言中看到,电子的自旋可以是“上”,用向量 (1, 0) 表示;也可以是“下”,用 (0, 1) 表示;所以这两种可能性的“叠加(superposition)”——一种两种结果都有可能发生的中间状态——是 (α, β),其中 α 是处于“上”态的“权重”或者说概率幅(probability amplitude),β 是处于“下”态的概率幅。(“概率幅”只是说 |α2| + |β2| = 1。为了让概率成立,α 和 β 是复数。)我们也看到,自旋可以被用来表示量子计算中的 0 和 1,比如说自旋“上”态代表二进制数字 0,“下”态代表 1。为了方便,我把这些“上”态和“下”态写成了行向量,但在量子力学中,态向量是写成列向量的,它们常被称为“右矢(ket)”。在第 4 章里,我讲过单位向量 i, j, k 是构造一个向量 v 的“基”——类似地,一个电子、或者说一个量子比特(qubit)的自旋态 ψ 的基可以选成这样,使得 \(\left(\begin{matrix} 1 \\ 0 \end{matrix}\right)\) 代表自旋“上”态,而 \(\left(\begin{matrix} 0 \\ 1 \end{matrix}\right)\) 代表自旋“下”态。用那种以量子先驱保罗·狄拉克(Paul Dirac)命名、被称为“狄拉克记号(Dirac notation)”的记法,这些基向量记作右矢 |0〉 和 |1〉。所以,一个量子比特的态向量用分量形式表示为
这意味着,在被实际观测之前,这个量子比特处于 |0〉 与 |1〉 这两个态之间的叠加态,α 和 β 分别代表它处于各个态的可能性大小。当量子比特被组合起来时——当然,要造出可用的量子计算机,它们就非被组合不可——张量积就登场了。不过咱们慢慢来,只取两个量子比特,并把它们的状态表示为
252
要求出这两个系统的组合的态,取它们的张量积:
它是一个 4 × 1 的向量,给出四种可能性的概率幅:两个量子比特都处于上态(都代表零)、第一个上而另一个下、第二个上而第一个下、以及两个都处于下态。正是每个量子比特都能表示 0 和 1 的叠加这一能力,使量子计算机具有如此巨大的潜在威力,因为它们可以同时进行多重计算。你可以从一个事实感受到这种威力:在一个 n 量子比特的系统中,张量积将有 2n 个复数分量。哪怕量子比特的数量相对不多,同时被处理的 0 和 1 也已经非常可观了。14
• • •
表示量子态的列向量被称为“右矢”,对任意的态记作 |A〉,而行向量则被称为“左矢(bra)”,记作 〈A|。这是因为当你把一个左矢和一个右矢放在一起时——比如你取两个态 |A〉 和 |B〉 的标量积(即内积)时——你就把那个括号补齐了(“bra-ket”,左矢-右矢):
标量积在态向量的“归一化(normalisation)”中是必需的,它确保 α 和 β 这类权重确实与测量结果的概率相对应——不过这里的要点在于,B〉 这个列向量的内容,现在正充当着一个左矢、或者说行向量 〈B|,作用在右矢 |A〉 上,给出标量积。这听起来很复杂(而且从技术上说,一个左矢是一个右矢的“对偶(dual)”,两者都栖居于复向量空间之中)——但你可以把它看成普通向量分析中一个结果的应用:在那里,向量可以扮演不同的角色,取决于你怎样书写它们。
253
举例来说,回到我们的列向量 u 和行向量 v,我们稍早前看到,u 乘以 v 的普通矩阵乘法给出一个 2 × 2 的矩阵(在这个情形下,那也正是它们的张量积)。但如果你把次序调换过来,v 乘以 u 的普通矩阵乘法给出的不是一个矩阵,而是一个数,v1u1 + v2u2。事实上,它就是这两个向量的标量积。(至少,在平直的二维欧几里得空间中,它就是标量积。正如我在第 9 章提到的,标量积依赖于度规。例如,在闵可夫斯基时空中,标量积是
a ∙ b = a1b1 + a2b2 + a3b3 − a4b4,或者 a ∙ b = − a0b0 + a1b1 + a2b2 + a3b3
如果时间分量用的是下标 0 而不是 4 的话。)所以你可以看出,把你的向量、你的数据写成行还是写成列,是有区别的。这种事情可能会让数学显得古怪而自相矛盾——但也恰恰是这种细节,撩起了一位有创造力的数学家的好奇心。而里奇和他的后继者们想出了一个巧妙的办法绕开它。
第一,用不同的记号来表示这两类向量。沿用里奇的做法,把列向量的分量写成带“上指标”或者说上标的形式——于是你不再写 u1 和 u2,而是写 u1 和 u2。(实际上他把上指标放进括号里,大概是为了表明这些是标签而不是幂次。后来,像爱因斯坦和格罗斯曼这样的数学家和物理学家越来越熟练地使用指标记号,就把括号丢掉了。)行向量则保留下指标,也就是下标。于是,在由一个列向量乘以一个行向量所形成的矩阵这一情形下,各个元素就可以表示为 u1v1、u1v2、u2v1、u2v2,如此等等。一眼看去,单凭记号你就能看出,你是在把两种不同类型的向量相乘。几十年后,狄拉克会通过他的左矢与右矢记号来应用这一区分。
254
第二,给这两个东西不同的名字,以免混淆。今天,在这个语境下,“向量”一词指的是列向量,而行向量被称为“一次形式(one-form)”或“对偶向量(dual vector)”。这些术语是二十世纪早期的研究者造出来的;这个想法源自格拉斯曼,他用的词是“补(complement)”而不是“对偶”。左矢就是一次形式的例子。早在 1880 年代,里奇就把向量和一次形式分别称为“逆变向量(contravariant vector)”和“协变向量(covariant vector)”,这两个名字今天也还在用。
实际上,里奇并没有专门谈行向量和列向量,因为它们不过是他那两类张量的例子。正如我们将在接下来两节中看到的,这一区分背后的一般观念——以及里奇选择这些名字的理由——来自一个超出指标记号与张量积的概念;而在数据科学中,需要的往往主要就是指标记号和张量积这两个方面。
事实上,在数据科学中,连指标的位置都不像在数学和物理学中那么重要,因为数据常常是根本不需要任何抽象符号就录入的。相反,许多程序员用来刻画每一个不同张量的,是它的秩和“形状(shape)”。例如,在 TensorFlow(以及像 Python 的 Numpy 这样的其他编程语言库)中,形状指的就是维数。一个标量的形状为 0,表示为一个空的方括号:[ ]。一个向量被编程为一串数字,每个分量一个;它的形状就是分量的个数,所以一个三维向量的形状是 [3]。二秩张量可以表示为矩阵,它们的形状就是行数和列数,所以上面那个 2 × 2 矩阵的形状是 [2, 2]。一个三秩张量,比如一个 2 × 3 × 5 的数组,形状是 [2, 3, 5],如此等等。
强调形状的一个好处是,程序员可以把 TensorFlow 所谓“参差张量(ragged tensor)”包括进来,也就是那些由长短不同的串构成的数组——也许是一串单词或句子,其中字母或单词的个数与空间的维数毫无关系。正如我说过的,在 n 维空间中,张量上的每个指标都必须取 1 与 n 之间的一个值,但“参差张量”却允许有可变的大小。这是数据科学家为了自身需要而改造一个数学概念的一个漂亮例子。
255
所有这一切,与张量最初被使用的方式相去甚远——尽管当时是不自觉地使用的——那就是作为数学物理中的应力张量和度规张量。尽管如此,这些较早的用法同样与表示和处理信息有关。我说的“处理”,指的是知道怎样把信息合并成新的张量,以及怎样解释和应用所得的结果。所以,要配得上张量这个名号,仅仅把信息列成一个清单、或者说数组是不够的——美索不达米亚人四千年前就在做那类事了。要成为张量,这些数组必须遵守某些规则,就像我们在第 4 章看到的向量和矩阵那样。我们已经认识了张量积,当然也还有加法的规则。我们见过向量相加的平行四边形法则如何顾及它们的模与方向,但更一般地说,向量和张量的加法——还有乘法——必须遵守“线性性(linearity)”的法则。(这意味着,举例来说,
(2a) ∙ b = 2(a ∙ b) = a ∙ (2b),以及 a ∙ (u + v) = a ∙ u + a ∙ v
——这类似于算术中的分配律。)
但在数学和物理学中,最重要的,是张量能够不变地——“绝对地”——表示信息,而不掺杂来自坐标选择的虚假数据。这对许多数据科学应用来说不是问题,尽管在其中某些应用里它很重要,比如我们前面见过的神经网络。不管怎样,张量这个想法所包含的内容,远比图 11.1 所显示的要多。
不变性(以及一桩学术丑闻)¶
不变量(invariant)——那些当你旋转、平移、或以别的方式改变参照系时保持不变的东西——这个想法,至少自 1840 年代凯莱与布尔合作共事以来,就一直让数学家着迷。在第 9 章里我们见过许多不变性的例子,从雪花的形状,到标量积 a ∙ b,再到闵可夫斯基度规,
ds2 = dx2 + dy2 + dz2 − (cdt)2
(其中单位常常选得使 c = 1)。但正如我们在图 9.1 和图 9.3 中看到的,这些形状和表达式中的每一个,都只是相对于某一特定的坐标变换群才是不变的。
256
在研究不变量时,像黎曼这样的数学家盯着的是物理应用——在他那里是曲面的曲率;而另一些人,包括凯莱和克莱因,感兴趣的则是这些坐标变换群的纯粹数学结构。克莱因曾担任《数学年刊》(Mathematische Annalen)的执行主编,那是他的导师阿尔弗雷德·克莱布施(Alfred Clebsch)突然死于白喉时他接下的职位。克莱布施就是那位教授:1869 年,尤斯图斯·格拉斯曼(Justus Grassmann)作为学生来到哥廷根时,曾把父亲那部《扩张论》(Ausdehnungslehre)送了一本给他。克莱布施印象很深,他此后既推广了格拉斯曼的思想,又参与创办了《数学年刊》,作为不变量理论研究的一个发表园地。
在十九世纪后半叶研究不变量和(或)微分形式的数学家,我还能在这个名单上添上许多别的名字——包括里奇从前在比萨的数学教授恩里科·贝蒂(Enrico Betti)。这里有一条交叠的线索,因为贝蒂的成就之一,就是把斯托克斯定理推广到了 n 维。我们前面看到,这个定理原来的三维版本最早发表于 1854 年的史密斯奖考试——麦克斯韦参加了那场考试——而它把一个面积分与一个线积分联系了起来。关键在于,它是以不变的方式做到这一点的:无论你使用什么坐标,你都应该得到同一个表面积。所以,贝蒂在这方面的工作,是数学家们对坐标变换与不变性感兴趣的各种不同理由的一个例子。
贝蒂还让我们想起十九世纪欧洲正在发生的那些革命性动荡。1848 年,还是学生的他参加了意大利独立战争中最早的两场战斗——他的论文导师曾率领托斯卡纳大学营。这一仗打输了,输给了奥地利人,但贝蒂幸运地活了下来,此后成为一位重要的数学家和教师——而里奇正是听从他的建议,才去柏林跟随克莱因学习的。15 贝蒂也为意大利那份新的纯粹与应用数学期刊《纯粹与应用数学年刊》(Annali di Matematica pura e applicata)撰稿。专业期刊——比如《年鉴》(Annali),以及克莱布施和克莱因的《数学年刊》(Annalen)——是数学家发表工作的重要场所;要是托马斯·哈里奥特的时代就有这样的期刊,也许他的工作就不会遗失那么久了:世界上最早的现代科学期刊之一,是伦敦皇家学会的《哲学汇刊》(Philosophical Transactions),它始于 1660 年代,那时距哈里奥特去世已近半个世纪。
257
拥有成熟的大学、科学社团和期刊的国家,往往处在数学进展的中心;1884 年,里奇把自己关于不变性的一些初步结果发表在了《年鉴》上。他最初踏上这段旅程时,并不知道黎曼的工作。相反,他最初的灵感来自埃尔温·克里斯托费尔(Elwin Christoffel)1869 年论文中那种纯粹数学的进路。正如我说过的,埃尔温·克里斯托费尔和黎曼各自独立地发现了如今被称为埃尔温·克里斯托费尔符号、以及黎曼张量(或黎曼–埃尔温·克里斯托费尔张量)的东西;而正如黎曼在他 1861 年的论文中所表明的,后者给出了判断一个曲面是否平直的不变条件。埃尔温·克里斯托费尔完全没有提到曲率——除了在论文末尾的一条注释里,说黎曼在他 1854 年的教授资格论文中把二次微分形式用到了线元上。但对里奇来说,这就够了,他由此开始搜寻黎曼的论文。
与此同时,他还要教书——对一个像里奇这样内敛而羞怯的人来说,这并不总是一件轻松的事。但他对自己的科目充满热情,而且如果说他的课缺少色彩,它们却依然是清晰而严格的——里奇是极重证明的人。正如他对一位同事说的:“我不否认[我课上]的那些证明给那些不幸并不认真对待自己学业的学生[造成了]一些困难。”尽管如此,他接着说,那并不会阻止他以数学应有的方式去呈现数学。毕竟,“如果我自己的判断没有欺骗我,这些证明是美的。”此外,最优秀的学生会被这种严格激励,而其余的人,他想,也可能从中受益,因为他们从中学毕业时,在数学基本功上根基不足。16 我相信今天许多讲课的人都能与他共情。
258
里奇同时在忙着申请晋升为正教授。1884 年他第一次尝试时,他和年轻的对手朱塞佩·韦罗内塞(Guiseppe Veronese)都败给了一位资历更深的候选人。里奇乐于让位于资历,但韦罗内塞提出了申诉。他还指出,自己出身工人阶级(不像里奇),需要增加的薪水来“帮助我贫寒的父母和我的兄弟们”。当局善意地受理了这一诉求,给了他一个永久的教职并加了薪。里奇处之泰然,1887 年再次争取正教授职位时满怀希望。此时他三十四岁,有着可观的发表记录——但韦罗内塞也有,而且他申请的是同一个职位。随之而来的争斗上了头版新闻,有传言说,教师间的暗中操纵最终剥夺了里奇本应得到的晋升。这桩公案拖了很久,里奇还要再过三年才终于拿到他的教授职位。17
与此同时,作为一位才华横溢的数学家,他还能做什么呢?只能一头扎进那项工作里去——那项最终将让他的名字不朽的工作。
如何处理那一大堆指标¶
在接下来的几页里,我会花些工夫说明,为什么里奇有两类不同的向量——用现代术语说,一个向量和一个一次形式——因为它们是所有张量的原型。(实际上,他是从一般的张量出发、把向量当作例子来讲的:也许是因为向量分析在当时不像今天这样确立得那么牢靠,但也是因为他的理论主要源自对不变微分形式的研究,而不是源自向量分析。)这两类向量与里奇的指标记号有关,而指标记号正是数学家运用符号来凸显数学概念底层结构的绝佳范例。我们在第 1 章代数的兴起、以及第 8 章向量记号之争中,都见过这类事情的一些侧面。不过这里有一些细节和一种进路,你也许并不熟悉,尽管你所需要的全部数学工具只是向量和矩阵的乘法。
259
不过,和往常一样,如果你到了只想听我一句话就作罢的地步,那就跳到下一节去。而如果你到了那里之后,又决定只想看看爱因斯坦和格罗斯曼怎样用张量来表述广义相对论的框架,那就直接往前翻到下一章。里奇会理解的:学习一项新技能总是要花力气的,他在自己那篇关于“绝对微分学”的开创性综述的导言中这样写道。18 泰特在试图说服人们相信四元数的好处时,也说过类似的话。但和泰特一样,里奇确信,在“克服了入门的困难”之后,读者很快就会让自己信服这些方法的“优雅与清晰”——而这些方法,关键就在于为不变性这个观念找到合适的记号。这是一种依赖于看出模式的记号,所以它也相当有趣。
• • •
如果张量要编码坐标变换下的不变性,里奇就必须找出:一个张量在一个参照系中的各个分量,与同一个张量在新参照系中的各个分量之间的特定关系。我们在图 9.1 中见过一个隐含的例子,那里我用几何方式表明,当你旋转坐标轴时,a 的模、以及标量积 a ∙ b 都是不变的。那时我没有展示的是每个向量分量如何变化,而这正是里奇试图回答的那类问题。
他从推广坐标变换的作用方式着手。不过我要从一个具体的例子开始,即图 9.1 中的那个旋转,其中从通常的 x-y 坐标到旋转后的 x′-y′ 坐标的变换方程是:
x′ = x cos θ + y sin θ,y′ = −x sin θ + y cos θ。
你可能已经注意到,它们是线性方程(它们只含 x 和 y,没有幂次或其他乘积),而且你可以把它们写成一个矩阵方程:
这是向量和矩阵在数学家想要表示和处理信息时反复冒出来的又一个例证。(你可能还注意到,这里的旋转矩阵与图 4.2 中的那个相似,不过那里我们转动的是机械臂,而这里,就像在图 9.1 中那样,向量保持不变,转动的是坐标轴本身。)
如果你令 \(X=\left(\begin{matrix} x \\ y \end{matrix}\right)\),并让 A 代表“变换矩阵”,你就可以把这个坐标变换方程写得更经济一些:
X′ = AX**。
260
正如我们在第 1 章看到的,当代数学家开始用符号代替词语或具体的数值例子时,他们就能够推广自己的结果——所以这个方程可以被推广,符号 A 可以代表任何二维线性齐次(homogeneous)坐标变换。(这里的“齐次”只是说,这个变换把原点的 O 映到新参照系的原点 O′,而这对张量是必需的,因为只有这样,像 a ∙ b = 0 这样的张量方程——或者说平直性的条件,黎曼张量 = 0——才会保持不变。)而从我们已经看到的向量与矩阵来看,这个方程也提示我们,可以很容易地从原来的二维旋转走到任意维数中的变换。
不同的作者使用不同的符号,不过在梳理和推广坐标变换的行为方式时,我将沿用当今张量分析教科书中广泛使用的那种记号。它与里奇的只有细微差别;特别是,逆变向量的分量和坐标都写成带上指标的形式,但里奇是把坐标写成我们在数学课上通常遇到的那种样子:x1、x2。所以,为了再深入一点探讨坐标旋转的结构——也为了摸清坐标变换一般是如何起作用的——首先,我用 x1、x2 表示原来的坐标 (x, y),用 x1′、x2′ 表示新的坐标 (x′, y′)。于是,原来的旋转变换方程 x′ = x cos θ + y sin θ 可以这样推广:
在我们这个具体的旋转情形中,\(A_{1}^{1'}=\cos\theta,A_{2}^{1'}=\sin\theta\)。(对于表示坐标变换的矩阵元素,我用的是 \(A_{1}^{1'}\) 等等,而不是线性代数里的 aij 记号。你很快就会明白为什么。)类似地,变换方程 y′ = −x sin θ + y cos θ 可以推广为
261
这里的指标有一种模式:在这两个一般方程的每一个中,同一个带撇的上指标贯穿始终。这意味着你可以把这两个方程合并成一个,其中一般的上指标 μ′(读作“mu-撇”)被假定依次取值 1 和 2,因为在二维空间中有两个独立坐标:
还要注意,在右边和式的每一项里,矩阵分量上的下指标都有一个原坐标上的上指标与之相配;于是,用希腊字母 σ(sigma)和我在第 10 章末尾提示过的那个求和记法,你就可以把上面的表达式简化成:
一旦爱因斯坦把这一切都摸透了,他会把这个记号弄得更简单。他会说,看看这个模式,注意只要你遇到相同的上、下指标——在这个情形里,一个 σ 像这样出现两次——你就把所有那些项加起来。而既然你也知道自己是在几维中工作,那何不干脆把求和号整个省掉,让重复的指标来告诉你这是一个和式:
今天,这个记号被称为爱因斯坦求和约定(Einstein summation convention)。
你可以看出我这么讲是要往哪儿走:当你加入更多变量——以至于你是在一个 n 维空间(黎曼的流形!)中工作——你可以使用同一个符号方程,只不过现在你的指标 μ′ 和 σ 将从 1 取到 n,而你那个和式隐含的项数不是两项,而是 n 项。那是 n 个方程(μ′ 的每个值一个),每个方程是 n 项的和(σ 的每个值一项),全部封装在一个小小的方程里。真是绝顶经济!
262
我在这里为指标标签选了 μ′ 和 σ,但它们是要代表一般的指标的,所以 μ 和 σ 这两个字母本身并没有什么特殊之处——就像学校代数里表示未知数的字母 x 是一个任意的选择一样(我选 \(A_{\sigma}^{\mu'}\) 来表示变换矩阵的分量也是任意的)。所以,不要盯着这里具体的字母看,而要盯着指标的模式看。正如我们将看到的,正是这种经济的符号体系,使得物理学的方程在用张量形式书写时显得如此优美典雅。
不变性与张量¶
现在我们要讲到这一切与不变性有什么关系了。一个向量 a 的各个分量是从坐标轴去测量的,所以它们以同样的方式变换,\(a^{\mu'}=A_{\sigma}^{\mu'}a^{\sigma}\)。举例来说,对于图 9.1 中的那个旋转,各分量的变换方式就和上面那些方程中的坐标一样,于是我们有——对(逆变的)向量 a 和 b 使用里奇的上指标——
a1′ = a1 cos θ + a2 sin θ,a2′ = −a1 sin θ + a2 cos θ,
b1′ 和 b2′ 也类似。当你把这些成对的分量乘起来、构成旋转后的参照系中的标量积时,你会发现
a1′b1′ + a2′b2′ = a1b1 + a2b2。
你在两个参照系中得到同一个数——同一个标量积,而这就是不变的含义。所以,这是图 9.1 中那个几何论证的代数版本。
可是,按我们在本科阶段所写的那种记号,标量积 a1b1 + a2b2 又该怎么说呢?
在里奇的记号中,这将是协变的、即行向量(或者一次形式)的标量积。正如我们后面会看到的,在通常的欧几里得空间和笛卡尔坐标系中,其实没有必要区分向量分量上的上指标和下指标。但首先,我们需要更多地了解下指标对张量意味着什么。
263
用于坐标和(逆变)向量变换的那个分量矩阵 \(A_{\sigma}^{\mu'}\),表明怎样用旧的坐标(或向量分量)写出新的坐标(或向量分量)。所以,要用新的坐标写出你原来的坐标,变换就得反着来。我们在图 9.3 中对洛伦兹变换见过这一点,但你可以这样看出对任何坐标变换该怎么做:回到把一般的变换方程写成 X′ = AX** 的形式。于是矩阵代数告诉你,要反向变换,你将有
X′ = AX ⟹ A−1X′ = X**。
举例来说,旋转矩阵 \(\left(\begin{matrix} \cos\theta & \sin\theta \\ -\sin\theta & \cos\theta \end{matrix}\right)\) 的逆是 \(\left(\begin{matrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{matrix}\right)\),因为 AA−1 = I。这提示我们,原来那个矩阵的第一列变成了逆矩阵中的第一行,第二列也同样。换句话说,原来那个矩阵的列——即带着上指标的逆变向量——在逆矩阵中变成了行,也就是带着下指标的协变向量。这意味着,要表示逆矩阵的各个分量,你只需把原来那个矩阵上的指标互换:\(A_{\sigma}^{\mu'}\to A_{\mu'}^{\sigma}\)。这就是为什么里奇用下指标来书写协变向量(一次形式或对偶向量):它们各分量的变换规则是 \(a_{\mu'}=A_{\mu'}^{\sigma}a_{\sigma}\)。利用这条规则,你可以证明 a1b1 + a2b2 是不变的,正如 a1b1 + a2b2 是不变的一样。
把向量推广到张量,里奇说:如果一个张量(无论秩是多少)的各分量上的所有指标都在上面,它就被称为“逆变的”;它的变换方式和逆变向量的分量一样,只不过要用上适当个数的变换矩阵 \(A_{\mu'}^{\sigma}\)(你可以在尾注19中看到)。如果所有指标都在下面,里奇就叫它“协变”张量。如果有些指标在上面、有些在下面,它就被称为“混合的(mixed)”。举例来说,我们看到,由一个列向量乘以一个行向量所得的张量积,其分量是 u1v1、u1v2、u2v1、u2v2,如此等等,所以它们是一个混合张量的分量。
264
这就是为什么里奇说向量就是张量:它们的分量——和高阶张量的分量一样——在坐标变换下以特定的方式变换。而标量是张量,因为它们只不过是完全不依赖于坐标的数或数值表达式——所以它们在坐标变换下自动是不变的。(把话说周全些:并非所有的数都是不变量或标量——比如,频率依赖于观察者的相对运动,我们在下一章会看到的多普勒效应就是例证。而如果昂鲁效应(Unruh effect)最终被探测到,那么甚至可能发现,温度并不完全是我在第 7 章和图 11.1 中所说的那种与坐标无关的标量——尽管你得接近光速旅行,才能察觉到一度的温度变化。20)
一种现代的视角¶
不过,指标记号并不全是关于坐标变换的,我们下一节就会看到。所以在这里,我想概述一种关于张量的现代视角。坐标变换仍然是它的核心,但现代数学家并不通过张量的分量在这些坐标变换下如何变换来定义张量,而是把“整体张量”定义为产生不变量的线性算子(linear operator)。
我们在第 6 章看到 \(\frac{d}{dx}\) 是一个算子,它的向量推广纳布拉 \(\nabla=\frac{\partial}{\partial x}\boldsymbol{i}+\frac{\partial}{\partial y}\boldsymbol{j}+\frac{\partial}{\partial z}\boldsymbol{k}.\) 也是一个算子。你必须把一个函数“插入”算子 \(\frac{d}{dx}\),才能得到它的导数;而把一个函数 f 插入纳布拉,则给你“grad f”,一个分量是该函数偏导数的向量。但张量更像散度算子 ∇∙,它作用于一个向量而给出一个标量。而标量,正如我们刚看到的,总是不变的。举例来说,在麦克斯韦方程组中,∇∙ 作用于电场和磁场向量,给出一个标量:
∇ ∙ E = 4πρ ∇ ∙ B = 0。
265
类似地,用一个行向量(协变向量、一次形式或对偶向量)去乘一个列向量(逆变向量),给出一个标量——在欧几里得空间中就是标量积。所以,你可以把一次形式看作作用于一个向量而给出一个标量、一个不变量的某种东西。这个定义正切中张量之所以为张量的核心:不在于分量与坐标变换本身,而在于那些变换之下的不变性。
往上走一阶(或者说秩),你可以把一个矩阵看作一个混合的二阶张量,它作用于一个向量和一个一次形式而给出一个标量。更具体地说,它作用于一个(列)向量而给出另一个(列)向量——就像变换方程 X′ = AX* 中的那个旋转矩阵 A,其中 A* “作用于” \(X=\left(\begin{matrix} x \\ y \end{matrix}\right)\) 而给出一个新向量 \(\left(\begin{matrix} x' \\ y' \end{matrix}\right)\);然后,正如我们刚看到的,当你用一个行向量(一次形式)作用于这个新向量时,你就得到了标量积。张量的阶越高,它必须作用于其上才能给出标量的向量和(或)一次形式就越多。
把张量理解为算子这种看法在量子理论中是根本性的,而纯粹数学家则把这个想法带进了多重线性映射(multilinear mapping)这种更为抽象的领地。所以,关于线性算子这个概念——以及关于“向量空间”,还有其他种种微妙之处,比如向量与一次形式的区别,以及变换“基”向量和一次形式、而不是变换向量与张量分量的意义——还有更多可说的,但那超出了我在这里的范围。不过,如果你已经跟我走到了这里,我希望这一节和上一节能让你对数学家发展他们想法的方式有所体会——他们怎样厘清自己的数学构造所必须遵守的规则,以及他们怎样用不变性这样的重要观念来解释这些规则和构造。这些解释会随着数学家在前辈洞见之上继续建造而演化。这是本书的一个关键主题,我们已经见过这类数学发展:从楔形文字泥板和计算算法,到符号代数、向量与矩阵,以及从微积分到向量分析。在本章后面,我们将迈出通往张量微积分的最后一步。
张量符号惊人的计算威力¶
266
张量分量上指标的位置,在张量方程和计算中起着至关重要的作用。举例来说,我们见过,在欧几里得空间中,用一个行(协变)向量 v 去乘一个列(逆变)向量 u,就给出它们的标量积。用里奇的指标记号和爱因斯坦的求和约定,我们就有了一个优美而经济的表示:
v1u1 + v2u2 ≡ vμuμ。
我在这里选字母 μ 并没有什么特别之处——再说一遍,我本可以选任何字母,因为要紧的是两个指标相同(所以这是一个和式)。21 这个表示惊人的地方在于:每一对上、下指标相同这一事实,实际上就告诉我们,这个标量积在适当的坐标变换下是不变的。你可以证明它是不变的,只要把那些变换方程代进去就行,你可以在下一条尾注中看到。不过一旦你明白了怎么做,指标记号就替你省了这份麻烦。22
张量记号让事情变得轻松,这确实非同寻常。尽管如此,你也许会嘀咕:到目前为止,我们已经有了三种不同类型的标量积,带上指标的、带下指标的,以及现在这种带混合指标的。这仅仅是因为在张量分析中有两类向量,不过我很快会说明这一切怎样汇成一个一般表达式。眼下,我想聚焦于混合形式的标量积通过其符号本身显示不变性这一非凡之处。这对高阶张量也成立,所以无论何时,只要你看到一个表达式中每个下指标都有相同的上指标与之相配——比如 Tμνhμν(ν 读作“nu”)——你就知道它是不变的。这真是相当不同凡响——而这不过是里奇的指标记号为何是这样一个绝妙创新的一个例子。他说它值得忍受入门的那番挣扎,是对的。
像 vμuμ 和 Tμνhμν 这样的张量表达式,是被称为“缩并(contraction)”的张量运算的例子——因为当你把一对上、下指标取成相等时,你就在降低、或者说收缩你的张量的秩。举例来说,vμuλ(其中 λ 读作“lambda”)是一个混合二秩(双指标)张量的一般分量,但当你令 λ = μ 时,你就把秩(或者说阶)降到了 0,因为 vμuμ 是一个标量(标量积)。
267
你并不必把所有指标都缩并掉,除非你想找出那些不变量。举例来说,Tμνhλσ 是一个四秩(四指标)张量的一般分量,但如果你令 λ = μ,你就得到一个双指标张量,分量为 Tμνhμσ。它是双指标的,因为你是在那个重复的指标 μ 上求和,只留下 ν 和 σ 两个指标自由。这就好像缩并 μ 指标把它们“消掉”了,颇有点像你在链式法则 \(\frac{dy}{dx}=\frac{dy}{du}\frac{du}{dx}\) 中“消去”各项的方式,只不过在这个情形里你是在把各项相加,而不是“删掉”它们。
有一种特别重要的缩并,如今为了纪念格拉斯曼而被称为“内积(inner product)”。正如我们前面看到的,哈密顿那套演化成了我们大学水平向量分析的系统,是完美适配于三维问题的——想想那些把他引上发现四元数之路的三维旋转吧!格拉斯曼的则更为抽象,所以尽管它更难应用,却更容易适配于黎曼所创造的、里奇的张量在其中运作的那些 n 维空间。于是,到二十世纪初,格拉斯曼的思想已经开始渗入主流,为源自哈密顿的向量分析与张量分析增添了概念上的实质内容。里奇属于哈密顿的传统,在他 1900 年关于自己那套微积分的综述中,他并没有使用“内”(或“外”)积这个术语;然而到了 1916 年——姑且只举一个例子——爱因斯坦在他关于广义相对论的综述中就会使用这些格拉斯曼式的术语了。
那么,内积是什么?它来自对一个由另两个张量的外积所形成的混合张量上的一对指标作缩并。举例来说,假设你把一个分量为 Tμν 的协变张量 T,与一个分量为 uσ 的向量 u 作外积。你得到一个新的混合张量,它的分量是 Tμνuσ。现在通过令 σ = μ 来缩并指标,得到 Tμνuμ;这就是 T 与 u 的内积的一般分量。(用分量形式写,它是 T1νu1 + T2νu2 + …,项数取决于空间的维数。)
268
但看看,如果你把这个张量与另一个(逆变的)向量 v 作外积,会发生什么:你得到一个新张量,分量为 Tμνuμvλ。(所以内积降低、即收缩秩,而外积则提高秩。)如果你现在令 λ = ν,你就又得到一个新张量,分量为 Tμνuμvν。这是 Tμνuμ 与 vλ 的内积。和标量积 vμuμ 一样,这个张量是一个标量(一个不变的数或函数),因为每一对指标都是相同的。
事实上,如果 T 是一个度规张量(metric tensor)——从现在起,我仿照爱因斯坦,把它记作 g,分量为 gμν——那么这个特定的内积,事实上正是我们习惯上称为 u 与 v 的标量积的那个东西。因为,正如我们看到的,度规实际上定义了标量积。举例来说,二维欧几里得度规
ds2 = dx2 + dy2 ≡ (dx1)2 + (dx2)2
的分量是 g11 = g22 = 1,其余分量为零;于是,把重复指标所指示的那些和写出来,这个情形下的内积就是:
gμνuμvν = g11u1v1 + g12u1v2 + g21u2v1 + g22u2v2 = u1v1 + u2v2。
这的确就是通常的向量分析中的标量积 u ∙ v,只不过带着里奇的上指标,因为这里两个向量都是逆变的。
对称性一瞥、度规为何是张量、以及理清标量积上的指标¶
我们在第 4 章看到,标量积是可交换的(不可交换的只有向量积)。而我们刚刚看到 u ∙ v = gμνuμvν(并且由此 v ∙ u = gνμvνuμ)。所以,这种可交换性,u ∙ v = v ∙ u,意味着我们必定有 gμν = gνμ。因此,度规张量各分量上的指标是对称的,就像镜中的映像。这种对称性在线性坐标变换下是不变的,因为标量积是不变的,所以它在计算中很顺手。正如我们看到的,一般说来,不变性就是一种数学上的“对称性”,因为当某个东西不变时,它就保持不变——就像一个反射出的影像,或者一片旋转着的雪花的形状那样。
269
在第 9 章里我们认识了欧几里得度规和闵可夫斯基度规,其中微分的系数是常数,标志着它们定义的是平直的空间。在第 10 章里我们看到,高斯证明了:关于一个曲面曲率的信息,包含在一般二维度规中微分的那些系数里,而黎曼把这一点推广到了弯曲的 n 维空间。所以,用任意的坐标 xμ,弯曲空间中的一个度规可以表示为
ds2 = gμνdxμdxν,
现在其中的系数 gμν 不是常数,而是坐标的函数。
从那些重复的指标你一眼就能看出,“距离”、或者说时空间隔的度量 ds2 是不变的,而且你可以利用坐标变换方程来证明它。23 我们已经见过这个一般结果的一些例子:欧几里得度规在诸如旋转这样的变换下是不变的,而闵可夫斯基度规在洛伦兹变换下是不变的(图 9.3)。可是,度规为什么是一个张量呢?线索就在不变性里;毕竟,表示不变性正是张量的全部意义所在。
为了更详细地看清这一点,我们前面刚看到 gμνuμvν 是向量 u 与 v 的标量积。这提示我们,度规 g “作用于”这两个向量,产生出一个标量——那个不变的标量积。这意味着,按照我两节前给出的那个现代定义,度规是一个张量。
按照里奇的定义,它也是一个张量,因为我们知道逆变向量分量 uμ、vν 的变换方程,所以如果 gμνuμvν 要成为一个不变的标量,那么 gμν 的变换方程就必须是协变二秩张量的变换方程。上一条尾注演示了表明这一点的计算,不过你已经能看出,现代的视角更为优雅。
• • •
270
在我简要勾勒里奇最高的成就——张量导数——之前,还有最后一件东西我想展示给你。当我前面谈到各种形式的标量积 v1u1 + v2u2、v1u1 + v2u2,以及 v1u1 + v2u2 时,我是在假定我们处在二维欧几里得空间中,那里的度规是 ds2 = dx2 + dy2。更一般地说,我们刚刚看到,在一个度规分量为 gμν 的空间中,两个(逆变的)向量 v 与 u 的标量积是 gμνuμvν。现在看看,如果我把指标的位置换一下、写成 gμνvμuν,会发生什么。这提示的是两个协变向量的标量积。可是 gμν 又是什么呢?里奇把 gμν 定义为具有一种非常特殊的性质:它“提升”一个协变张量的指标。我们稍早前看到,Tμνhμσ 带着重复的(被缩并的)μ 指标,是一个双指标张量,就好像我们在把它们加起来时把那两个 μ “消掉”了。于是,里奇定义了这样一些特殊的缩并
(实际上,里奇用的不是 gμν 而是 ars,不过除此之外我用的都是他的定义。)换句话说,gμν 把 gμσ 变成了 \(g_{\sigma}^{v}\)。而 gμνgλσ 把 gμσ 变成了 gλν。反过来也成立:gμν 可以降低指标。(那是因为里奇实质上把度规分量 gμν 与 gμν 的矩阵表示定义成了互逆的。不过关键在于,这些都是定义。)
里奇把这一点定义为一个一般的性质,使得度规张量在与任何张量缩并时都能提升或降低指标。这在像爱因斯坦方程那样的张量方程中很重要,我们后面会看到。但它也以一种相当绝妙的方式,把标量积的那些不同形式全都统一了起来。缩并 gμνvμ 降低了这个向量上的指标,给出 vν。这意味着,一般而言,gμνvμuν = vνuν,正如我前面就那个行向量与列向量的特定标量积所写的那样!类似地,gμνvμuν = vνuν。
但真正有趣的事情在这里。在欧几里得空间中用笛卡尔坐标,我们知道度规是 ds2 = dx2 + dy2。为简单起见我保持在二维,不过你当然可以加上更多维度,而我要引出的那个结果是一样的:那就是说,在这种情形下,你把自己的向量的指标写成上指标还是下指标,都无关紧要。这是因为(在二维中)
vν = gμνvμ = g1νv1 + g2νv2,
271
但欧几里得度规唯一非零的分量是 g11 = 1 = g22,所以,你有
v1 = g11v1 + g21v2 = 1 × v1 + 0 × v2 = v1,
而类似地,v2 = g12v1 + g22v2 = v2。换句话说,在通常取笛卡尔坐标的欧几里得空间中,一个向量的分量与一个一次形式的分量之间没有区别(也就是说,里奇的逆变向量与协变向量之间没有区别)。这就是为什么在普通的向量分析中,无须为这个术语上的区分、或者指标的位置操心。
张量微积分,极简版¶
对里奇来说,最大的问题是:如果你对一个张量求导,会发生什么?更具体地说,这个导数是不是一个张量?如果它不是,那么张量在物理学中就没有多大用处,因为在物理学里,物理现象广泛地是用微分方程来建模的——比如牛顿的运动定律和麦克斯韦的电磁学方程组。正如我们在第 9 章看到的,物理学的方程还必须保持它们的形式不变,即便你从一个参照系换到另一个参照系。否则,不同的观察者就会推导出不同的物理定律,而我们永远也无法就物理实在的本性达成一致。
272
形式不变的方程被称为“协变的(covariant)”,而里奇把他那个不变的导数称为“协变导数(covariant derivative)”。它与普通的、即偏导数并不相同,因为结果是:一个向量分量 uμ 对该参照系中某个坐标、比如 xλ 的偏导数,一般说来并不像张量那样变换。里奇利用埃尔温·克里斯托费尔发现的一个不变表达式,找到了导数正确的协变形式。它相当于在偏导数上加上一项,其中包含我在第 10 章提到过的埃尔温·克里斯托费尔符号。里奇沿用埃尔温·克里斯托费尔的做法,用花括号来表示这些符号,但今天,沿用爱因斯坦和其他人的做法,它们通常记作 \(\Gamma_{\sigma\lambda}^{\mu}\)。(符号 Γ 是大写的希腊字母 gamma;这些指标与相应的变换方程相吻合,尽管今天它们被解释为基向量导数的系数。举例来说,在笛卡尔坐标中,基向量是 i, j, k。它们是常数,所以它们的导数为零,因而在这种情形下埃尔温·克里斯托费尔符号也为零。所以,在欧几里得空间中,你只需要偏导数!)
对一个向量或张量的分量取偏导数,会给出它第二个指标——用以表明该分量是对哪个变量求导的。里奇表示向量的偏导数,用的只是简单地再添一个指标,但今天,那个新指标用一个逗号来标示,以表明它是导数。于是,uμ 的偏导数表示为
分号常被用来表示协变导数:
我把这个方程写出来,只是想给你一个直观印象,所以细节并不重要——除了要说一句:它对任何张量、而不只是向量,都有自然的推广。关键在于它是一个张量——所以它的值在相关的坐标变换下是不变的。换句话说,当你变换到新坐标、并就 xλ′ 对变换后的分量 uμ′ 取协变导数时,你得到的是同一个结果。
在笛卡尔坐标中,偏导数与协变导数之间的差别在平直的空间和时空中消失了。这是又一个例子,说明在弯曲空间中很重要的那些区分,到了平直空间中就消失了:在我们学校里学的欧几里得向量分析中,既无须谈论协变导数,也无须操心向量上指标的位置。
没人当回事!¶
273
当里奇把这一切汇入张量分析——他的“绝对微分学”——的时候,人们研究不变性和微分几何已经有很多年了。他汲取了这些先行者的成果——主要是高斯、黎曼和埃尔温·克里斯托费尔,但也有其他人,比如索菲斯·李(Sophus Lie),他关于群与不变性的工作至今仍然重要;还有著名的微分几何学家欧金尼奥·贝尔特拉米(Eugenio Beltrami),他是里奇在博洛尼亚求学时的教授。
1880 年代末,当里奇把自己几篇关于张量的论文送评意大利的皇家数学奖时,欧金尼奥·贝尔特拉米是评委之一。代表评审委员会发言时,他赞赏里奇的数学技艺,但他怀疑:为创造这套新微积分所付出的心血,是否终究能通过足够丰硕的应用得到回报——那些无法用现有方法做出的应用。24 他似乎颇以为不然——就像威廉·汤姆森(William Thomson)和阿瑟·凯莱看不出整体向量分析比起分开的分量计算有什么好处一样。(就在欧金尼奥·贝尔特拉米在意大利对张量发表这番议论的同时,向量之战正在英国打得不可开交。)但正如麦克斯韦曾论证说,在物理学中,整体向量的重要性在于它们所提供的物理洞见,里奇后来也写道:当涉及理解弯曲的 n 维曲面和空间时,他的微积分及其记号“不仅有助益于论证与结论的优雅,也有助益于它们的敏捷与清晰”。25
不过回到 1880 年代,对里奇来说——他那时还没能晋升为教授——这一切必定像是:尽管他学生时代那么出色、前途无量,他永远也不会得到承认,也永远无法实现抱负。
-
关于里奇的生平细节,包括政治背景,我在本章中始终参考 Judith Goodstein, Einstein’s Italian Mathematicians(Providence, RI: American Mathematical Society, 2018)。 ↩
-
Goodstein, Einstein’s Italian Mathematicians, 2。 ↩
-
里奇致 Antonio Manzoni,1872 年 11 月 24 日,转引自 Goodstein, Einstein’s Italian Mathematicians, 6。 ↩
-
Goodstein, Einstein’s Italian Mathematicians, 16。 ↩
-
里奇与奇泽姆谈克莱因:转引自 Goodstein, Einstein’s Italian Mathematicians, 16, 17。注意:柯瓦列夫斯卡娅(Kovalevsky)1874 年的哥廷根博士学位与奇泽姆的剑桥学位一样,是“非正式”的。 ↩
-
Goodstein(Einstein’s Italian Mathematicians, 27–30)用里奇与比安卡的通信勾勒出他们恋情的温情图景。 ↩
-
里奇为其 1884 年论文所写的引言:转引自 Goodstein, Einstein’s Italian Mathematicians, 32。 ↩
-
W. H. and G. Chisholm Young, Nature 58, no. 1492(June 2, 1898): 99–100。 ↩
-
黎曼张量上的指标:粗略地说,由于这个张量由双指标度规分量的二阶导数构成,它的四个指标涉及的是哪个度规分量被哪一对坐标所微分。实际情况比这稍复杂一些,因为黎曼张量是度规分量导数的和,但大意如此。 ↩
-
麦克斯韦的方法是“加色法”——把三个滤镜的光叠加,再把图像投射到屏幕上。今天的幻灯片、电视和数字图像用的就是这种方法。印刷图像用的是“减色法”(在麦克斯韦铺路之后才被发现),三种颜色是从纸上的颜料反射出来的,而不是透过滤镜/像素层传到屏幕上。减色法的三原色与麦克斯韦的正好“相反”——它们是青色、品红和黄色。 ↩
-
关于训练 AI 模型时盗用数据:见,例如,Nick Vincent and Hanlin Li, “ChatGPT Stole Your Work. So What Are You Going to Do?,” Wired(January 28, 2023), https://www.wired.com/story/chatgpt-generative-artificial-intelligence-regulation/。关于写作者的反击,见,例如,Vanessa Thorpe, “‘ChatGPT Said I Did Not Exist’: How Writers and Artists Are Fighting Back against AI,” The Guardian, March 19, 2023。 ↩
-
NLP(含大语言模型)的益处与问题:本书付印之时,情形想必已变了许多,AI 发展就是这么快;不过这里给出一些较新的参考。关于益处的另一个例子,见 Samantha Spengler, “For Some Autistic People, ChatGPT Is a Lifeline,” Wired, May 30, 2023;https://www.wired.com/story/for-some-autistic-people-chatgpt-is-a-lifeline/#。关于问题,除了训练数据被盗用之外,人们已就 ChatGPT 某些输出的不可靠写过很多——所以尽管益处明显,它在教育中的角色仍无定论:见,例如,Hayden Horner, “ChatGPT: Brilliance or a Bother for Education,” Engineering Institute of Technology 新闻网站, March 13, 2023, https://www.eit.edu.au/chatgpt-brilliance-or-a-bother-for-education/。同样地,在远程医疗(以及其他许多领域)中,有利也有弊:见,例如,Som Biswas, “Role of ChatGPT in Public Health,” Annals of Biomedical Engineering(March 2023),线上发表于 https://www.researchgate.net/profile/Som-Biswas-2/publication/369269117。复杂的 AI 带来明显的社会问题,从助长监控到制造深度伪造和假新闻。我在第 4 章的注释里提过偏见问题,另见,例如,Grace Browne, “AI Is Steeped in Big Tech’s ‘Digital Colonialism,’” Wired UK(May 25, 2023);https://www.wired.co.uk/article/abeba-birhane-ai-datasets。围绕相似主题,另见 MIT Technology Review 的系列文章 “AI Colonialism”,https://www.technologyreview.com/supertopic/ai-colonialism-supertopic/,其中也包含受压迫民族以积极方式使用 AI 进行反击的例子。此外还有环境问题,例如 Maanvi Singh, “As the AI Industry Booms, What Toll Will It Take on the Environment?,” The Guardian(June 9, 2003)。关于科学与技术的知情公共讨论,比以往任何时候都更为关键! ↩
-
当然,NLP 和大语言模型的内容远不止张量积。就我的叙述(以及关于 NLP 的更多内容)而言,我特别受惠于 Qiuyuan Huang, Paul Smolensky, Xiaodong He, Li Deng, Dapeng Wu, “Tensor Product Generation Networks for Deep NLP Modeling,” Proceedings of NAACL-HLT 2018(New Orleans): 1263–73;Lipeng Ahang et al., “A Generalized Language Model in Tensor Space,” 33rd Annual Conference of the AAAI (2019);以及 Matthew Kramer, “Word Embeddings,” Medium.com, August 31, 2021。 ↩
-
“原则上,一台 300 量子比特的量子计算机在一瞬间所能完成的计算,比可见宇宙中的原子还多”:Charles Q. Choi, “How Many Qubits Are Needed for Quantum Supremacy?” IEEE News, May 21, 2020;https://spectrum.ieee.org/qubit-supremacy#:~:text=Superposition%20lets%20one%20qubit%20perform,eight%20calculations%3B%20and%20so%20on。 ↩
-
Enrico Betti:n 维中的斯托克斯定理:Victor Katz, “The History of Differential Forms from Clairaut to Poincaré,” Historia Mathematica 8 (1981): 161–88, esp. 175。贝蒂当兵、为期刊投稿:Goodstein, Einstein’s Italian Mathematicians, 7。贝蒂与里奇的论文:Goodstein, Einstein’s Italian Mathematicians, 148。 ↩
-
里奇的信,转引自 Goodstein, Einstein’s Italian Mathematicians, 9–10。 ↩
-
里奇为晋升的长期奋斗:Goodstein, Einstein’s Italian Mathematicians, 35–43, 59–61。 ↩
-
G. Ricci and T. Levi-Civita, “Méthodes de calcul différential absolu et leurs applications,” Mathematische Annalen 54 (1900): 125–201;关于学习新技能所需付出的努力与回报,见 128(我的译文)。 ↩
-
例如,若按图 11.1 由两个逆变向量 a 和 b 的张量积(外积)构成一个二阶张量 T,你就有变换法则 \(T^{\mu'v'}\equiv a^{\mu'}b^{v'}=\left(A_{\sigma}^{\mu'}a^{\sigma}\right)\left(A_{\lambda}^{v'}a^{\lambda}\right)=A_{\sigma}^{\mu'}A_{\lambda}^{v'}a^{\sigma}a^{\lambda}\equiv A_{\sigma}^{\mu'}A_{\lambda}^{v'}T^{\sigma\lambda}.\) 别忘了,这里用于张量、变换矩阵系数和指标的字母都是任意的,就像代数里的 x。但它们提供了多么奇妙的灵活性——你可以如此轻易地挪动变换符号,从而给出你想要的任何种类张量的法则! ↩
-
昂鲁效应:1976 年,加拿大物理学家威廉·昂鲁(William Unruh)借助量子理论发现,广义相对论预言温度并不完全像我在图 11.1 中所说的那样是与坐标无关的标量。相反,加速运动的观测者所测得的时空温度,会与静止观测者测得的略有不同。这种“昂鲁效应”尚未被探测到——要测出一度的温度变化,你得接近光速旅行才行。但在 2022 年,由 James Quach 领导的阿德莱德大学团队发明了一种“量子温度计”,也许很快就能证明昂鲁、以及广义相对论是对的。 ↩
-
不过请注意,这里我们谈的是单一参照系中的向量——与上面的旋转例子不同,这种求和与参照系之间的变换无关。 ↩
-
证明 n 维中标量积在坐标变换下的不变性:用变换方程中矩阵系数的微分形式最容易看清。例如,二维旋转变换方程的第一个是 x′ = x cosθ + y sin θ。用偏导数,这个方程的微分形式是 \(dx'=\frac{\partial x'}{\partial x}dx+\frac{\partial x'}{\partial y}dy,\) 你可以看出 \(\frac{\partial x'}{\partial x}=\cos\theta\),其余导数依此类推——所以这些导数正是我在叙述中标为 \(A_{\sigma}^{\mu'}\) 的那些分量。对于列向量与行向量的数量(内)积,你会有(最后一项用链式法则得到): \(u^{\mu'}v_{\mu'}=A_{\sigma}^{\mu'}A_{\mu'}^{\lambda}u^{\sigma}v_{\lambda}\equiv\frac{\partial x^{\mu'}}{\partial x^{\sigma}}\frac{\partial x^{\lambda}}{\partial x^{\mu'}}u^{\sigma}v_{\lambda}=\frac{\partial x^{\lambda}}{\partial x^{\sigma}}u^{\sigma}v_{\lambda}.\) 重复指标意味着右端是 \(\frac{\partial x^{\lambda}}{\partial x^{1}}u^{1}v_{\lambda}+\frac{\partial x^{\lambda}}{\partial x^{2}}u^{2}v_{\lambda}+\dots+\frac{\partial x^{\lambda}}{\partial x^{n}}u^{n}v_{\lambda}.\) 这些导数是对独立坐标求的,所以唯一有意义的导数是 \(\frac{\partial x^{\lambda}}{\partial x^{\lambda}}=1\)。这类似于中学微积分:通常只有一个自变量,比如 x,于是 \(\frac{dx}{dx}=1.\)。所以上面那个右端表达式里 σ 唯一可能的取值是 λ。也就是说,我们有 uμ´ vμ´ = uλvλ。 这个表达式在变换后的坐标系(带撇的)中与在原来的坐标中形式相同。(重复指标用什么字母无关紧要,因为它们只是告诉你要求和的占位符。所以我可以把 μ 换成 λ。) 换句话说,标量积在这种坐标变换下是不变的。 ↩
-
ds2 的不变性:我们前面看到,逆变张量与协变张量的坐标变换矩阵互为逆矩阵,\(A_{\sigma}^{\mu'}\to A_{\mu'}^{\sigma}\)(或用导数记号表示矩阵分量,\(\frac{\partial x^{\mu'}}{\partial x^{\sigma}}\to\frac{\partial x^{\sigma}}{\partial x^{\mu'}}).\)所以互逆的一对会“抵消”,于是我们有 \(ds^{2}=g_{\mu'v'}dx^{\mu'}dx^{v'}=A_{\mu'}^{\sigma}A_{v'}^{\lambda}A_{\sigma}^{\mu'}A_{\lambda}^{v'}g_{\sigma\lambda}dx^{\sigma}dx^{\lambda}=g_{\sigma\lambda}dx^{\sigma}dx^{\lambda}.\) 距离测度 ds2 在每个参照系中具有相同的形式和相同的数值。(记住,重要的是指标的模式,而不是字母的选择。) ↩
-
欧金尼奥·贝尔特拉米论里奇的张量:Goodstein, Einstein’s Italian Mathematicians, 49。 ↩
-
Ricci and Levi-Civita, “Méthodes de calcul différential absolu,” 128(我的译文)。 ↩