三次型Cubic forms
当 \(|S(\alpha)|\) 大到某个程度时,要么这个三次型本身有大量"双线性零点"(选项 A),要么这个 \(\alpha\) 必定非常靠近一个分母不大的分数 \(a/q\)(选项 B)。
读完你将掌握:复指数 \(e(\alpha)\) 与圆法的基本框架、Weyl 差分法(把三次降成线性)、几何数论缩放引理的用法,以及"主弧/次弧"二分思想的来源。本章只搭舞台、磨刀,真正的估值在第 14、15 章。
阅读方式:灰色竖线框是原书译文(忠实翻译),其余彩色框与正文是面向高中生的逐句详解,把每个符号、每一步跳步都补全。
0. 先备齐工具:几个超出高中课本的记号
本章会反复用到几样高中没正式学过的东西。先一次性讲清,后面就不再打断。
① \(|e(\theta)|=1\)(永远在单位圆上);
② \(e(\theta_1)e(\theta_2)=e(\theta_1+\theta_2)\)(指数相加);
③ 只跟 \(\theta\) 的小数部分有关:\(e(\theta+m)=e(\theta)\) 对任意整数 \(m\) 成立(转整圈等于没转)。
1. 定理与历史:为什么是 17,为什么 10 不能再少
我们现在着手证明:一个具有整系数的齐次三次方程 \(C(x_1,\dots,x_n)=0\)(13.1),当 \(n\ge 17\) 时,总能在整数 \(x_1,\dots,x_n\)(不全为 \(0\))中求解。第一个这样的结果,附带条件 \(n\ge 32\),于 1957 年被证明;改进后的结果在 1962 年初被发现。1963 年我证明了条件 \(n\ge 16\) 已经足够,但这需要一个性质上颇为特殊、超出 \(n\ge 17\) 所需的更细致的论证。
这段在讲什么。开门见山地把全书这部分的主定理和它的历史进度条摆出来。先把名词拆开:
- "齐次"(homogeneous)
- 方程里每一项的次数都相同。三次齐次就是每一项都是三个变量相乘(如 \(x_1^3\)、\(x_1x_2x_3\)、\(5x_2^2x_3\)),没有二次项、一次项或常数项。齐次方程有个好处:若 \(\mathbf{x}\) 是解,则 \(t\mathbf{x}\) 对任意 \(t\) 也是解,所以我们只关心非平凡解(不全为零的解)。
- "三次"(cubic)
- 最高次数是 \(3\)。
- \(C(x_1,\dots,x_n)=0\)
- 一个 \(n\) 元三次齐次多项式等于零。变量越多(\(n\) 越大),自由度越高,越"容易"有解——这就是为什么定理形如"\(n\) 够大就一定有解"。
为什么"变量多就一定有解"是个难题?注意 \(\mathbf{x}=\mathbf{0}\) 永远是解,但它平凡、没意义。要找非零整数解则毫不显然:方程只有一个,未知数有 \(n\) 个,看上去"方程少、未知数多"应该容易,但整数解的限制极强(不能取分数、不能取实数逼近),这正是丢番图问题之难。Davenport 这套圆法给出的,是一个能定量保证解存在的方法。
- 1957:首次证明 \(n\ge 32\) 足够(文献 [21])。即便条件还很宽,能证"够多变量必有解"已是突破。
- 1962 年初:改进结果(文献 [20]),门槛进一步降低。
- 1963:Davenport 本人证明 \(n\ge 16\) 即可(文献 [22]),但用到一个"颇为特殊"的精细论证。
- 本书选择讲 \(n\ge 17\) 的版本——因为它能用统一、干净的论证讲清楚,而 \(n\ge 16\) 那一步是为了抠掉最后一个变量额外耍的特殊技巧,喧宾夺主。这正是"取舍":教学上宁可门槛松一点(17),换来思路的清爽。
Mordell 于 1937 年指出,存在九个变量的三次型不表示零,因而条件 \(n\ge 10\) 对于 (13.1) 总可解而言是必不可少的。Mordell 的例子基于一个三次域的范数型的性质。如果 \(p\) 是一个在该域中不分解的素数,那么范数型 \(N(x,y,z)\) 永远不能被 \(p\) 整除,除非 \(x,y,z\) 都能被 \(p\) 整除。由此容易推出,方程 \[ N(x_1,x_2,x_3)+pN(x_4,x_5,x_6)+p^2 N(x_7,x_8,x_9)=0 \] 除平凡解外,没有整数解 \(x_1,\dots,x_9\)。
这段在讲什么。上一段说"变量够多就有解",这段从反方向立一根界桩:变量太少时,确实可能无非零解。所以门槛不能无限往下压——\(n\ge 10\) 是必需的(即存在 \(9\) 个变量的反例)。这保证了我们追求的 \(n\ge 17\) 不是无的放矢。先解释名词。
"不分解的素数"与整除性质。"素数 \(p\) 在域中不分解"是数论里的说法,对我们只需用它的一个结论:
这里"同余 / 整除"是高中数论的延伸:\(p\mid a\) 读作"\(p\) 整除 \(a\)",意思是 \(a\) 是 \(p\) 的倍数;\(a\equiv 0\pmod p\) 是同一件事的另一种写法。下面用这个关键事实,一步步证明那个 \(9\) 元方程只有平凡解。
原文说"由此容易推出",这里把"容易"摊开成完整的无穷递降论证。设 \(\mathbf{x}=(x_1,\dots,x_9)\) 是整数解。记三块为 \[ A=N(x_1,x_2,x_3),\quad B=N(x_4,x_5,x_6),\quad D=N(x_7,x_8,x_9), \] 方程即 \(A+pB+p^2D=0\)。
- 先看 \(A\) 必被 \(p\) 整除。由 \(A=-pB-p^2D=-p(B+pD)\),右边显然是 \(p\) 的倍数,故 \(p\mid A\),即 \(p\mid N(x_1,x_2,x_3)\)。
- 用关键事实。\(p\mid N(x_1,x_2,x_3)\) 迫使 \(x_1,x_2,x_3\) 全是 \(p\) 的倍数。写 \(x_1=px_1',\,x_2=px_2',\,x_3=px_3'\)。
- 范数随之被 \(p^3\) 整除。因为 \(N\) 是三次齐次,把每个变量放大 \(p\) 倍,整体放大 \(p^3\) 倍:\(A=N(px_1',px_2',px_3')=p^3N(x_1',x_2',x_3')\)。
- 代回方程并约去一个 \(p\)。方程变成 \(p^3N(x_1',x_2',x_3')+pB+p^2D=0\),两边同除以 \(p\): \[ p^2N(x_1',x_2',x_3')+B+pD=0. \] 于是 \(B=-p^2N(x_1',x_2',x_3')-pD=-p(\dots)\),故 \(p\mid B=N(x_4,x_5,x_6)\)。
- 再次用关键事实:\(x_4,x_5,x_6\) 也全被 \(p\) 整除,写 \(x_4=px_4'\) 等,则 \(B=p^3N(x_4',x_5',x_6')\)。代回上式 \(p^2N(x_1',x_2',x_3')+p^3N(x_4',x_5',x_6')+pD=0\),再除以 \(p\):\(pN(x_1',x_2',x_3')+p^2N(x_4',x_5',x_6')+D=0\)。于是 \(p\mid D=N(x_7,x_8,x_9)\),从而 \(x_7,x_8,x_9\) 全被 \(p\) 整除。
- 结论——无穷递降。至此 \(x_1,\dots,x_9\) 全部都是 \(p\) 的倍数。设 \(x_j=px_j'\),由齐次性,\((x_1',\dots,x_9')\) 也是同一方程的解,且每个坐标都缩小为原来的 \(1/p\)。若原解非零,可一直这样除下去,得到无穷多个越来越小的非零整数解——这不可能(非零整数的绝对值不能无限缩小且仍是整数)。矛盾!故唯一解是 \(\mathbf{x}=\mathbf{0}\)。∎
事实上,我们还可以进一步断言:相应的模 \(p^3\) 的同余式除了所有变量都 \(\equiv 0\pmod p\) 之外没有解。一个简单的例子可由取 \(p=7\) 并令 \[ N(x,y,z)=x^3+2y^3+4z^3-6xyz \] 给出,这正是由 \(\sqrt[3]{2}\) 生成的域的范数型。一个与上述类似的构造,给出了 \(k^2\) 个变量中 \(k\) 次齐次不可解方程的例子。
这段在讲什么。把上面的反例做得更"狠",并给出一个具体可验证的例子。"更狠"体现在:不只整数方程无非零解,连模 \(p^3\) 的同余式都只有平凡解。
- 它确实是 \(\sqrt[3]2\) 的范数型。令 \(\omega=\sqrt[3]2\)(\(\omega^3=2\)),数 \(\xi=x+y\omega+z\omega^2\)。三个共轭是把 \(\omega\) 换成 \(\omega,\ \omega\zeta,\ \omega\zeta^2\)(\(\zeta=e(1/3)\) 是 \(1\) 的复立方根)。三者相乘 \(N=\prod(x+y\omega\zeta^k+z\omega^2\zeta^{2k})\),展开(利用 \(1+\zeta+\zeta^2=0\)、\(\omega^3=2\))正好得到 \(x^3+2y^3+4z^3-6xyz\)。系数 \(2,4\) 来自 \(\omega^3=2,\ \omega^6=4\),\(-6\) 来自交叉项 \(-3\omega^3=-6\)。
- 为什么取 \(p=7\)?因为 \(7\) 是一个在 \(\mathbb{Q}(\sqrt[3]2)\) 中"不分解"的素数(即 \(2\) 不是模 \(7\) 的三次剩余:\(1^3,2^3,\dots\equiv 1,1,6,1,6,6\pmod7\) 取不到 \(2\))。这保证了上面的"关键事实"成立。换个 \(p\)(如 \(p=31\),那里 \(2\) 是模 \(31\) 的三次剩余,故 \(31\) 在域中分解,"关键事实"不再成立)就不行——这就是"为什么这样取参数"。
"\(k^2\) 个变量、\(k\) 次"的推广。把上面"三块、系数 \(1,p,p^2\)"的把戏推到 \(k\) 次:用一个 \(k\) 次域的范数型 \(N\)(\(k\) 个变量),堆 \(k\) 块、系数 \(1,p,p^2,\dots,p^{k-1}\),共用 \(k\cdot k=k^2\) 个变量,同样的无穷递降说明它不可解。当 \(k=3\) 就回到 \(9=3^2\) 个变量的三次情形。这说明:对 \(k\) 次方程,门槛至少得超过 \(k^2\)。
2. 搭舞台:指数和 \(S(\alpha)\) 与圆法的出发点
关于三次方程的定理的证明分为若干章,每一章在很大程度上是自成一体的。我们从考虑与一个三次型相关联的指数和开始。写 \[ C(\mathbf{x})=C(x_1,\dots,x_n)=\sum_i\sum_j\sum_k c_{ijk}\,x_i x_j x_k, \] 其中各求和指标从 \(1\) 跑到 \(n\),系数 \(c_{ijk}\) 是整数,并且我们可以假设 \(c_{ijk}\) 是关于 \(i,j,k\) 的对称函数。
这段在讲什么。正式给三次型一个统一写法,并约定系数对称。这两点是后面所有计算的地基。
为什么"可以假设"?因为 \(x_ix_jx_k\) 这个乘积本身与下标次序无关(乘法可交换),所以同一个单项式 \(x_1x_2x_3\) 会在 \(6\) 个不同下标组合里出现。我们总可以把这 \(6\) 个系数平均掉,换成对称的系数而不改变整个多项式的值。例如某项原本只在 \(c_{123}\) 写了 \(6\)、其余写 \(0\),可改成 \(c_{123}=c_{132}=\dots=1\)(六个各 \(1\)),总和 \(6x_1x_2x_3\) 不变。对称化是纯粹为后面求导/差分时系数好看(会反复出现 \(3\)、\(6\) 这样的整齐倍数),属于"先把记号理顺"的预备动作。
设 \(P\) 是一个大的正整数。设 \(\mathfrak{B}\) 是 \(n\) 维空间中一个固定的盒子,即由 \(n\) 个区间构成的笛卡尔积 \(x_j'\lt x_j\le x_j''\)(\(1\le j\le n\))。仅为方便起见,我们假设 \(x_j''-x_j'\lt 1\)。令 \[ S(\alpha)=\sum_{P\mathfrak{B}}e\!\left(\alpha C(x_1,\dots,x_n)\right), \] 其中求和遍历盒子 \(P\mathfrak{B}\) 中的所有整点,盒子 \(P\mathfrak{B}\) 由下式给出 \(Px_j'\lt x_j\le Px_j''\)(\(1\le j\le n\))。
这段在讲什么。定义本章的主角——指数和 \(S(\alpha)\)。它把"我们关心的整点"全部塞进一个和式,是圆法的发动机。逐件解释。
- \(P\)(大正整数)
- "放大倍数"。我们让 \(P\to\infty\),看解的个数如何随 \(P\) 增长。所有 \(\ll,\gg\) 里的"常数与 \(P\) 无关"都是相对它而言。
- 固定盒子 \(\mathfrak{B}\)
- \(n\) 维空间里一个长方体:第 \(j\) 个坐标被限制在小区间 \((x_j',x_j'']\)。"笛卡尔积"就是各坐标区间独立组合成的盒子。假设每条边长 \(x_j''-x_j'\lt 1\) 只是技术性的"小盒子"约定,方便计数。
- 放大盒子 \(P\mathfrak{B}\)
- 把盒子整体放大 \(P\) 倍,得到 \(Px_j'\lt x_j\le Px_j''\)。它的每条边长约 \(P(x_j''-x_j')\),所以里面大约有 \(\prod_j P(x_j''-x_j')\sim P^n\) 个整点。这就是"自变量 \(\mathbf{x}\) 的取值范围"。
- \(\alpha\)(实数,取自 \([0,1]\))
- 一个旋钮。\(S(\alpha)\) 把每个整点 \(\mathbf{x}\) 贡献一个单位圆上的复数 \(e(\alpha C(\mathbf{x}))\),再全部相加。改变 \(\alpha\) 就改变所有相位。
设 \(\mathcal{N}(P)\) 表示 \(P\mathfrak{B}\) 中满足 (13.1) 的整点 \(\mathbf{x}\) 的个数。则 \[ \mathcal{N}(P)=\int_0^1 S(\alpha)\,d\alpha. \tag{13.2}\]
这段在讲什么。圆法的命门:把"解的个数"\(\mathcal{N}(P)\) 写成一个积分。这一步把组合问题(数解)变成分析问题(算积分),是整套方法的灵魂。原文直接给结论,下面补全为什么成立。
- 核心恒等式。对任意整数 \(m\): \[ \int_0^1 e(m\alpha)\,d\alpha=\begin{cases}1,&m=0,\\[2pt]0,&m\ne 0.\end{cases} \] 理由:若 \(m=0\),被积函数 \(e(0)=1\),积分 \(\int_0^1 1\,d\alpha=1\)。若 \(m\ne0\),\(\int_0^1 e(m\alpha)d\alpha=\dfrac{e(m\alpha)}{2\pi i m}\Big|_0^1=\dfrac{e(m)-e(0)}{2\pi i m}=\dfrac{1-1}{2\pi i m}=0\)(因为 \(e(m)=1\),整数转整圈回原点)。这是一个"探测器":它只在 \(m=0\) 时亮 \(1\),其余全灭。
- 把 \(S(\alpha)\) 代入积分。 \[ \int_0^1 S(\alpha)\,d\alpha=\int_0^1\sum_{\mathbf{x}\in P\mathfrak{B}}e(\alpha C(\mathbf{x}))\,d\alpha. \]
- 交换求和与积分(有限和,可逐项积分): \[ =\sum_{\mathbf{x}\in P\mathfrak{B}}\int_0^1 e(\alpha\,C(\mathbf{x}))\,d\alpha. \]
- 用探测器。这里 \(m=C(\mathbf{x})\) 是整数。由第 1 步,每一项的积分在 \(C(\mathbf{x})=0\) 时为 \(1\),否则为 \(0\)。于是 \[ \int_0^1 S(\alpha)d\alpha=\sum_{\mathbf{x}\in P\mathfrak{B}}[\,C(\mathbf{x})=0\,]=\#\{\mathbf{x}\in P\mathfrak{B}:C(\mathbf{x})=0\}=\mathcal{N}(P). \] 积分把"满足方程的点记 1、不满足记 0"自动加总,得到的正是解的个数。∎
3. 目标与那个"自相矛盾"的策略
我们的目标(原则上)是证明:通过适当选取盒子 \(\mathfrak{B}\),当 \(P\to\infty\) 时 \(\mathcal{N}(P)\) 有一个渐近公式,其中主项的阶为 \(P^{n-3}\)。实际上这并不总是成立。我们将要得到的,是一个看似自相矛盾的结果:该渐近公式在 (13.1) 不可解(从而 \(\mathcal{N}(P)=0\))的假设下成立!这对我们的目的而言已经足够,因为它将证明 (13.1) 是可解的。
这段在讲什么。说明整套证明的逻辑诡计,这是全章最妙、也最容易看晕的一句话。慢慢拆。
- "渐近公式,主项阶 \(P^{n-3}\)"
- "渐近公式"指当 \(P\) 很大时 \(\mathcal{N}(P)\approx c\,P^{n-3}\)(再加更低阶的误差)。为什么是 \(P^{n-3}\)?直觉:盒子里约 \(P^n\) 个点,方程 \(C(\mathbf{x})=0\) 是"一个三次方程"的约束,\(C(\mathbf{x})\) 的取值范围约 \(P^3\),命中 \(0\) 的"概率"约 \(P^{-3}\),于是解数约 \(P^n\cdot P^{-3}=P^{n-3}\)。只要 \(c>0\) 且 \(n>3\),这就是正且趋于无穷的——意味着有解,而且解很多。
一旦推出来,矛盾就来了:左边 \(=0\),右边 \(\ge cP^{n-3}-(\text{误差})>0\)(\(P\) 大时主项压过误差)。\(0>0\) 不可能!所以"无解"的假设错误,方程必有解。
妙处在于:"无解"这个假设反而让某些捣乱项消失,使渐近公式更容易证出来。我们不需要真的算出解的个数,只要逼出一个矛盾。这就是"看似自相矛盾却足够用"的含义。
4. 平凡估计与"大 \(S\) 假设"(13.3)
\(|S(\alpha)|\) 的平凡估计是 \(P^n\)。我们首先研究:若对于某个特定的 \(\alpha\),有 \(|S(\alpha)|\ge P^{n-K}\)(13.3),会发生什么,其中 \(K\) 是某个正数。最终,正如前几章那样,我们的目标是能够从 \(\alpha\) 的集合中去掉任何对积分贡献的量低于 \(P^{n-3}\) 阶的子集。
这段在讲什么。给 \(S(\alpha)\) 立一个"上限标杆",并提出本章真正要攻的问题。
· 次弧(minor arcs):\(S(\alpha)\) 普遍偏小的那些 \(\alpha\),贡献小,丢掉;
· 主弧(major arcs):\(S(\alpha)\) 可能很大的那些 \(\alpha\)(靠近 \(a/q\)),它们贡献主项 \(P^{n-3}\),要精算。
本章的引理 13.1–13.4 就是要刻画"\(S\) 大"的 \(\alpha\) 长什么样,为第 15 章的二分做准备。
5. Weyl 不等式的推广:双线性型 \(B_j\)
第一步是证明 Weyl 不等式的一个推广。对于任意两点 \(\mathbf{x},\mathbf{y}\),我们定义一组 \(n\) 个双线性型: \[ B_j(\mathbf{x}\,|\,\mathbf{y})=\sum_i\sum_k c_{ijk}\,x_i y_k,\quad (1\le j\le n). \]
这段在讲什么。引入本章第二位主角——双线性型 \(B_j\)。它是把三次型"求两次差分、降两次次数"后剩下的线性骨架,后面所有引理都围着它转。
动机:原三次型 \(C\) 是三次的,直接处理太难。Weyl 的思想是"差分降次":三次型差一次降成二次、再差一次降成一次(线性)。差两次后,跟求和变量 \(\mathbf{z}\) 线性相关的系数恰好就是 \(6\alpha B_j(\mathbf{x}\,|\,\mathbf{y})\)(见下一节推导)。所以 \(B_j\) 是"三次型经两次差分后留下的线性核心",把对三次和的估计转化成对线性和的估计——这是整个 Weyl 方法的关键转译。
对称性提示:因 \(c_{ijk}\) 对称,交换 \(\mathbf{x},\mathbf{y}\) 的角色相当于交换下标 \(i,k\),所以 \(B_j(\mathbf{x}\,|\,\mathbf{y})\) 关于 \(\mathbf{x},\mathbf{y}\) 也有良好对称性,后面会用到。
引理 13.1:Weyl 不等式的推广
这条引理在说什么。"如果 \(S(\alpha)\) 大(假设 13.3),那么左边这个又长又怪的和必定也大(\(\gg P^{3n-4K}\))。"左边是对所有点对 \((\mathbf{x},\mathbf{y})\) 求和,每项是 \(n\) 个 \(\min(\cdots)\) 的乘积。先读懂这个 \(\min\)。
· 当 \(6\alpha B_j\) 很接近整数(\(\|6\alpha B_j\|\) 很小),\(1/\|\cdots\|\) 很大,被 \(P\) 截住,取 \(P\);
· 当 \(6\alpha B_j\) 离整数较远,\(\|\cdots\|\) 不小,\(1/\|\cdots\|\) 较小,取这个倒数。
这个量正是下一节那条"几何级数求和"估计的输出:一段长 \(\le P\) 的等差相位求和 \(\sum_z e(\beta z)\) 的大小 \(\ll\min(P,\|\beta\|^{-1})\)。\(\min\) 越大,说明相位越"齐"、相消越少。所以引理左边大 = "存在很多点对让所有 \(B_j\) 都使相位齐整"。
- 第一次平方(差分一次)。 \[ |S(\alpha)|^2=S(\alpha)\overline{S(\alpha)}=\sum_{\mathbf{z}\in P\mathfrak{B}}\sum_{\mathbf{z}'\in P\mathfrak{B}}e\!\big(\alpha C(\mathbf{z}')-\alpha C(\mathbf{z})\big). \] 这里用了 \(\overline{e(\theta)}=e(-\theta)\)(共轭等于相位取负),把 \(S\) 与其共轭相乘展成双重和。
- 换元 \(\mathbf{z}'=\mathbf{y}+\mathbf{z}\)。令 \(\mathbf{y}=\mathbf{z}'-\mathbf{z}\),则 \[ |S(\alpha)|^2=\sum_{\mathbf{z}\in P\mathfrak{B}}\ \sum_{\mathbf{y}+\mathbf{z}\in P\mathfrak{B}}e\!\big(\alpha C(\mathbf{y}+\mathbf{z})-\alpha C(\mathbf{z})\big). \] "差分"二字就在这:被积相位从 \(C\) 本身变成了差 \(C(\mathbf{y}+\mathbf{z})-C(\mathbf{z})\),这是一个关于 \(\mathbf{z}\) 的二次多项式(三次差一次降为二次),最高次降了一级。
- 把 \(\mathbf{y}\) 提到外层、对内层取模长。对每个固定的 \(\mathbf{z}\),"盒子 \(P\mathfrak{B}\) 平移 \(-\mathbf{z}\)"含于 \(|\mathbf{y}|\lt P\) 之内(因为盒子边长 \(\le P\))。把 \(\mathbf{y}\) 的范围放宽到 \(|\mathbf{y}|
公共部分(保证 \(\mathbf{z}\) 和 \(\mathbf{z}+\mathbf{y}\) 都在原盒子里)。
- Cauchy 不等式再平方一次。Cauchy(柯西)不等式:\(\bigl|\sum_{k=1}^{N}a_k\bigr|^2\le N\sum_{k=1}^N|a_k|^2\)。这里 \(\mathbf{y}\) 的取值个数 \(\ll P^n\),把它当作 \(N\):
\[ |S(\alpha)|^4=\Big(|S(\alpha)|^2\Big)^2\le\Big(\sum_{|\mathbf{y}|
线性。平方正好制造出"第二次差分"的机会。
- 第二次差分(对内层重复步骤 1–2)。内层 \(\bigl|\sum_{\mathbf{z}}e(\cdots)\bigr|^2\) 再展成关于新增变量 \(\mathbf{x}\) 的双重和(\(\mathbf{z}\) 与 \(\mathbf{z}+\mathbf{x}\))。结果其平方不超过
\[ \sum_{|\mathbf{x}|\lt P}\Big|\sum_{\mathbf{z}\in\mathcal{S}(\mathbf{x},\mathbf{y})}e\!\Big(\alpha\big(C(\mathbf{z}+\mathbf{x}+\mathbf{y})-C(\mathbf{z}+\mathbf{x})-C(\mathbf{z}+\mathbf{y})+C(\mathbf{z})\big)\Big)\Big|, \]
其中 \(\mathcal{S}(\mathbf{x},\mathbf{y})\) 是依赖 \(\mathbf{x},\mathbf{y}\) 的 \(\mathbf{z}\) 盒子,各棱长 \(
二阶混合差分。
- 关键代数:二阶差分关于 \(\mathbf{z}\) 是线性的。断言 \[ C(\mathbf{z}+\mathbf{x}+\mathbf{y})-C(\mathbf{z}+\mathbf{x})-C(\mathbf{z}+\mathbf{y})+C(\mathbf{z})=6\sum_{i,j,k}c_{ijk}x_iy_kz_j+\psi=6\sum_j z_jB_j(\mathbf{x}\,|\,\mathbf{y})+\psi, \] 其中 \(\psi\) 不含 \(\mathbf{z}\)。为什么是这样、系数为何是 6:对一个三次型,做关于 \(\mathbf{y}\) 的一阶差分 \(C(\mathbf{z}+\mathbf{y})-C(\mathbf{z})\),其含 \(\mathbf{z}\) 二次的部分是 \(3\sum c_{ijk}y_iz_jz_k\);再做关于 \(\mathbf{x}\) 的差分,把 \(z_jz_k\) 换成 \((z_j+x_j)(z_k+x_k)-z_jz_k=x_jz_k+z_jx_k+x_jx_k\),其中含 \(\mathbf{z}\) 一次的是 \(x_jz_k+x_kz_j\)。于是 \(\mathbf{z}\)-线性项为 \(3\sum c_{ijk}y_i(x_jz_k+x_kz_j)\);利用 \(c_{ijk}\) 的对称性把两块都整理成 \(z_j\) 出头,合并得 \(6\sum c_{ijk}x_iy_kz_j\)。系数 \(6=2\times3\) 正来自"两次差分各放出一个因子、再加对称排列"。其余项 \(\psi\) 全是 \(\mathbf{x},\mathbf{y}\) 的函数,不含 \(\mathbf{z}\)。最后按 \(j\) 归并 \(\sum_{i,k}c_{ijk}x_iy_k=B_j(\mathbf{x}\,|\,\mathbf{y})\)。
- 提出不含 \(\mathbf{z}\) 的相位。\(e(\alpha\psi)\) 与 \(\mathbf{z}\) 无关,模长为 1,可直接提到 \(\mathbf{z}\) 求和外,不影响绝对值。于是内层关于 \(\mathbf{z}\) 的和化为 \[ \Big|\sum_{\mathbf{z}\in\mathcal{S}(\mathbf{x},\mathbf{y})}e\!\Big(6\alpha\sum_j B_j(\mathbf{x}\,|\,\mathbf{y})\,z_j\Big)\Big|. \] 相位对 \(\mathbf{z}\) 已是线性——目标达成。
- 几何级数估计("现已熟悉的估计")。因为相位 \(6\alpha\sum_j B_jz_j=\sum_j(6\alpha B_j)z_j\) 在各坐标 \(z_j\) 上分离,指数乘积拆成各坐标独立的几何级数之积: \[ \sum_{\mathbf{z}}e\!\Big(\sum_j(6\alpha B_j)z_j\Big)=\prod_j\Big(\sum_{z_j}e\big((6\alpha B_j)z_j\big)\Big). \] 单个几何级数 \(\sum_{z_j}e(\beta z_j)\)(\(z_j\) 跑一段长 \(\le P\) 的连续整数,\(\beta=6\alpha B_j\))的标准上界是 \(\ll\min(P,\|\beta\|^{-1})\)(证明见下方小框)。于是 \[ \Big|\sum_{\mathbf{z}\in\mathcal{S}}e\!\big(6\alpha\textstyle\sum_jB_jz_j\big)\Big|\ll\prod_{j=1}^n\min\!\big(P,\ \|6\alpha B_j(\mathbf{x}\,|\,\mathbf{y})\|^{-1}\big). \]
- 回代汇总。把第 9 步代进第 5 步、再代进第 4 步(全程只对 \(|S|\) 平方两次:先 \(|S|^2\),再经 Cauchy 得 \(|S|^4\)),最终得到
\[ \sum_{|\mathbf{x}|
∎
- 若把它当 \(N\) 个模长 1 的数相加,三角不等式给上界 \(N\)。这是 \(\min\) 里的第一个候选。
- 当 \(\beta\) 不是整数时用等比数列求和:\(\sum_{z=0}^{N-1}e(\beta z)=\dfrac{e(\beta N)-1}{e(\beta)-1}\)。取模长,分子 \(|e(\beta N)-1|\le 2\),分母 \(|e(\beta)-1|=2|\sin\pi\beta|\)。又有不等式 \(|\sin\pi\beta|\ge 2\|\beta\|\)(正弦在到最近整数距离上的线性下界)。故 \[ \Big|\sum_{z}e(\beta z)\Big|\le\frac{2}{2|\sin\pi\beta|}\le\frac{1}{2\|\beta\|}\ll\|\beta\|^{-1}. \] 这是第二个候选。
- 两个上界同时成立,取较小者,得 \(\ll\min(N,\|\beta\|^{-1})\)。直观:\(\beta\) 越接近整数,相位转得越慢、相消越少、和越大(趋于 \(N\));\(\beta\) 离整数越远,转得越快、相消越多、和越小(趋于 \(\|\beta\|^{-1}\))。∎
这条注在提醒什么。做估计前先"对账":把不等式里每个 \(\min\) 都取上限 \(P\)(最宽松情形),看看会得到什么。这里乘积变成 \(P^n\),再对 \(P^n\) 个点对 \(\mathbf{x},\mathbf{y}\) 求和得 \(P^n\cdot P^n\cdot P^n=P^{3n}\);这对应 \(|S(\alpha)|^4\ll P^{4n}\),即 \(|S|\ll P^n\),正是平凡估计,没有出现荒谬(比如 \(|S|\) 被估得比 \(P^n\) 还大)。这说明引理 13.1 的不等式方向、量级都自洽,没有"凭空多估"或"永远丢掉了不该丢的东西"。这是做解析数论的好习惯:随时用平凡情形当"体检"。
6. 引理 13.2:从"\(\min\) 之和大"到"小余项点对多"
这条引理在说什么、为什么要它。引理 13.1 的结论是个"加权和大",但权重(那些 \(\min\))是连续的、不好直接用。引理 13.2 把它翻译成一句更朴素的话:满足"所有 \(\|6\alpha B_j\|
点对个数很多(\(\gg P^{2n-4K}(\log P)^{-n}\))。从"加权和"过渡到"计数",是为了后面能把它当成可数的几何对象处理。
- 设 \(Y(\mathbf{x})\) = 对给定 \(\mathbf{x}\) 满足 (13.4) 的 \(\mathbf{y}\) 个数。目标是把引理 13.1 左边的和用 \(Y(\mathbf{x})\) 控制住。
- "鸽笼式"上界。把每个 \(6\alpha B_j(\mathbf{x}\,|\,\mathbf{y})\) 的小数部分 \(\{6\alpha B_j\}\in[0,1)\) 按 \(\frac{r_j}{P}\le\{6\alpha B_j\}<\frac{r_j+1}{P}\) 分成 \(P\) 个等宽小格(\(r_j=0,1,\dots,P-1\)),并把 \(\mathbf{y}\) 的每个坐标限制在一段长 \(P\) 的区间内。断言:落在某一组固定 \((r_1,\dots,r_n)\) 小格里的 \(\mathbf{y}\) 个数 \(\le Y(\mathbf{x})\)。
- 为什么 \(\le Y(\mathbf{x})\)(差分消格)。设 \(\mathbf{y}'\) 是这组小格里某个固定点,\(\mathbf{y}\) 是同组里任意点。两点在同一小格 \(\Rightarrow\) 它们的 \(\{6\alpha B_j\}\) 相差 \(<1/P\),于是 \(\|6\alpha B_j(\mathbf{x}\,|\,\mathbf{y})-6\alpha B_j(\mathbf{x}\,|\,\mathbf{y}')\|
把绝对位置问题平移成相对位置问题的标准技巧。
- 把立方体切块、用 \(Y(\mathbf{x})\) 控制加权和。把 \(|\mathbf{y}|
- 调和级数求和。单个坐标 \(\sum_{r=0}^{P-1}\min(P,\frac{P}{r},\frac{P}{r-1})\):\(r=0,1\) 附近取 \(P\),其余取 \(P/r\),于是 \(\approx P+P\sum_{r=1}^{P-1}\frac1r\approx P(1+\log P)\ll P\log P\)。\(n\) 个坐标相乘得 \((P\log P)^n\)。故
\[ \sum_{|\mathbf{y}|
- 对 \(\mathbf{x}\) 求和、代入引理 13.1。两边对 \(|\mathbf{x}|
- 解出计数。\(\sum_{\mathbf{x}}Y(\mathbf{x})\) 恰是满足 (13.4) 的点对 \((\mathbf{x},\mathbf{y})\) 总数。于是 \[ \#\{(\mathbf{x},\mathbf{y})\text{ 满足 }(13.4)\}=\sum_{\mathbf{x}}Y(\mathbf{x})\ \gg\ \frac{P^{3n-4K}}{(P\log P)^n}=P^{2n-4K}(\log P)^{-n}. \] 得证。∎
这条注在说什么。又一次"对账"。点对 \((\mathbf{x},\mathbf{y})\) 各自约 \(P^n\) 种,总数平凡上界 \(P^{2n}\)。我们的下界是 \(P^{2n-4K}(\log P)^{-n}\)——指数部分 \(2n-4K\) 比 \(2n\) 小(损失来自 \(K\),是真问题里不可避免的),而 \((\log P)^{-n}\) 是额外多丢的一点点。作者明确说这 \((\log P)^n\) "不重要",因为它比 \(P^{\varepsilon}\) 还小,后面取 \(K\) 时留点余量就能吸收掉。
7. 引理 13.3:把范围从 \(P\) 缩到 \(P^\theta\)(两用几何数论)
这条引理在说什么、为什么要它。引理 13.2 给出的是"大盒子 \(|\mathbf{x}|,|\mathbf{y}|
松余项 \(\|6\alpha B_j\|
小盒子 \(
紧余项 \(
收缩"步骤,靠两次调用第 12 章的几何数论缩放引理(引理 12.6)完成。
第一次:固定 \(\mathbf{x}\),缩 \(\mathbf{y}\)。
- 认出线性型。固定 \(\mathbf{x}\),记 \(L_j(\mathbf{y})=6\alpha B_j(\mathbf{x}\,|\,\mathbf{y})\)。它关于 \(\mathbf{y}\) 线性,且满足对称性:\(L_j\) 中 \(y_k\) 的系数是 \(6\alpha\sum_i c_{ijk}x_i\),交换 \(j,k\) 时(因 \(c_{ijk}\) 对称)不变。这正是引理 12.6 的前提。
- 把 (13.4) 摆成 12.6 的形状(\(Z_2=1\))。取 \(a=P,\ Z_2=1,\ Z_1=P^{-1+\theta}\)。当 \(Z=Z_2=1\):盒子 \(|y_j|
(此处用到 \(b\) 使 \(bZ_2=P^{-1}\)。) - 缩到 \(Z_1=P^{-1+\theta}\)。盒子变 \(|y_j|
- 对 \(\mathbf{x}\) 求和。于是满足 \[ |\mathbf{x}|
- 对 \(\mathbf{x}\) 求和。于是满足 \[ |\mathbf{x}|
第二次:固定 \(\mathbf{y}\),缩 \(\mathbf{x}\)。现在 \(\mathbf{y}\) 已缩到 \(
- 换角色认线性型。对每个 \(\mathbf{y}\),把 (13.7) 看成关于 \(\mathbf{x}\) 的系统,记 \(M_j(\mathbf{x})=B_j(\mathbf{y}\,|\,\mathbf{x})\)(即把 \(\mathbf{x},\mathbf{y}\) 角色对调,利用 \(B_j\) 的双线性对称)。(13.7) 即 \(|x_j|
- 选缩放参数。这次取
\[ a=P^{\frac32-\frac12\theta},\quad Z=Z_2=P^{-\frac12+\frac12\theta},\quad Z_1=P^{-\frac32+\frac32\theta}. \]
核对 \(Z_2\):盒子 \(|x_j|
为什么这样取 \(a,Z_2\) 而不照搬上一次?因为这一次的余项上界已经是 \(P^{-2+\theta}\)(比第一次的 \(P^{-1}\) 紧),要让"盒子边 \(=aZ_2=P\)、余项 \(=bZ_2=P^{-2+\theta}\)"同时成立,\(a\) 与 \(Z_2\) 必须重新配比,于是出现了 \(\frac32,\frac12\) 这种半整数指数。参数是被"两端边界条件"逼出来的,不是随手取的。 - 缩到 \(Z_1\)。盒子 \(|x_j|
- 对 \(\mathbf{y}\) 求和收官。满足 (13.5)(即 \(|\mathbf{x}|,|\mathbf{y}|
∎
- 对 \(\mathbf{y}\) 求和收官。满足 (13.5)(即 \(|\mathbf{x}|,|\mathbf{y}|
8. 引理 13.4:本章的总结论——非此即彼
(A) 存在多于 \(P^{n\theta+\varepsilon}\) 个满足 \[ |\mathbf{x}|\lt P^\theta,\quad |\mathbf{y}|\lt P^\theta,\quad B_j(\mathbf{x}\,|\,\mathbf{y})=0,\quad (1\le j\le n) \tag{13.8}\] 的整点对 \(\mathbf{x},\mathbf{y}\);
或者 (B) 对每个 \(\alpha\),假设 \[ |S(\alpha)|\ge P^{n-\frac14 n\theta+\varepsilon} \tag{13.9}\] 蕴含 \(\alpha\) 有一个有理逼近 \(a/q\) 使得 \[ (a,q)=1,\quad 1\le q\ll P^{2\theta},\quad |q\alpha-a|\lt P^{-3+2\theta}. \tag{13.10}\]
这条引理在说什么。本章的主结果,一个"二选一"(不是说有时 A 有时 B,而是说:对给定的三次型 \(C\),至少有一个分支永远成立)。
- 选项 (A)
- 三次型 \(C\) 自身的性质:双线性型 \(B_j\) 有"异常多"的公共零点对 \((\mathbf{x},\mathbf{y})\)(多于 \(P^{n\theta+\varepsilon}\) 个,比"正常的 \(P^{n\theta}\) 量级"还多一个 \(P^\varepsilon\) 因子)。注意 (A) 完全不含 \(\alpha\)——它是几何/代数性质。
- 选项 (B)
- 关于指数和的结论:只要 \(S(\alpha)\) 还算大(13.9),\(\alpha\) 就必定非常靠近一个分母 \(q\ll P^{2\theta}\) 的最简分数 \(a/q\),逼近误差 \(
· \((a,q)=1\):\(a,q\) 互素(最简分数,没有可约的公因子)。
· \(1\le q\ll P^{2\theta}\):分母 \(q\) 不超过 \(P^{2\theta}\) 量级——"小分母"。分母越小,分数 \(a/q\) 越"特殊"、越稀疏。
· \(|q\alpha-a|
- 把 \(K\) 取成与 (13.9) 匹配。在 (13.3) 里取 \(K=\frac14 n\theta-\varepsilon\),则 \(P^{n-K}=P^{n-\frac14 n\theta+\varepsilon}\),于是 (13.3) 与 (13.9) 是同一条假设。这一步是把可调参数 \(K\) 钉死,让前面引理的输出对接到本引理要的形式。
- 引理 13.3 给出大量满足 (13.5) 的点对。代 \(K=\frac14 n\theta-\varepsilon\): \[ \#(13.5)\ \gg\ P^{2n\theta-4K}(\log P)^{-n}=P^{2n\theta-(n\theta-4\varepsilon)}(\log P)^{-n}=P^{n\theta+4\varepsilon}(\log P)^{-n}\gg P^{n\theta+\varepsilon}. \] 最后一步:\(P^{4\varepsilon}(\log P)^{-n}\gg P^{\varepsilon}\),因为 \(P^{3\varepsilon}\) 远大于 \((\log P)^n\)(多项式吃掉对数)。所以满足 (13.5) 的点对多于 \(P^{n\theta+\varepsilon}\) 个。
- 二分。看这一大堆满足 (13.5) 的点对,问:是否所有点对都让所有 \(j\) 满足 \(B_j(\mathbf{x}\,|\,\mathbf{y})=0\)?
· 若是:那这些点对全都满足 (13.8)(注意 (13.8) 的盒子约束 \(|\mathbf{x}|,|\mathbf{y}|P^{n\theta+\varepsilon}\),选项 (A) 成立。
- · 若不是:则存在某个满足 (13.5) 的点对 \((\mathbf{x},\mathbf{y})\) 和某个 \(j\),使 \(B_j(\mathbf{x}\,|\,\mathbf{y})\ne0\) 且(由 (13.5) 第三条)
\[ \|6\alpha B_j(\mathbf{x}\,|\,\mathbf{y})\|
- 造 \(q\) 与 \(a\)。取 \(q=6|B_j(\mathbf{x}\,|\,\mathbf{y})|\)(正整数,因 \(B_j\ne0\)、且 \(c_{ijk}\) 整数使 \(B_j\) 是整数),取 \(a\) 为最接近 \(q\alpha\) 的整数。则
\[ |q\alpha-a|=\|q\alpha\|=\|6\alpha B_j\|
- 估 \(q\) 的大小。
\[ q=6|B_j(\mathbf{x}\,|\,\mathbf{y})|\ll\Big|\sum_{i,k}c_{ijk}x_iy_k\Big|\ll\sum_{i,k}|c_{ijk}|\,|x_i|\,|y_k|\ll|\mathbf{x}|\,|\mathbf{y}|\ll P^\theta\cdot P^\theta=P^{2\theta}. \]
其中 \(|c_{ijk}|\) 是固定常数(被 \(\ll\) 吸收),\(|x_i|\le|\mathbf{x}|
- 化简成最简分数。此时未必 \((a,q)=1\),但把 \(a,q\) 的公因子一并约掉,得到的新 \(a/q\) 仍满足三条(约分只会让 \(q\) 更小、\(|q\alpha-a|\) 更小)。于是 选项 (B) 成立。∎
9. 收尾的注:两个选项各意味着什么
这条注在说什么。把选项 A "去掉伪装",看清它的真实身份。
- "不涉及 \(\alpha\)"
- (13.8) 里根本没有 \(\alpha\),纯粹是问双线性型 \(B_j\) 有多少公共零点。所以 A 是三次型 \(C\) 自带的代数事实,与圆法的旋钮 \(\alpha\) 无关。
- "也不涉及 \(\theta\)"
- 令 \(R=P^\theta\),断言变成"在边长 \(R\) 的盒子里,\(B_j\) 的公共零点对多于 \(R^{n+\varepsilon'}\) 个"。\(\theta\) 只是把 \(P\) 换了个名字成 \(R\),本质条件与 \(\theta\) 无关——只跟"盒子大小 \(R\)"有关。这说明 A 是个纯几何计数命题。
- "内禀性质"
- "零点对多于 \(R^{n+\varepsilon'}\)"是反常的:正常情况下,\(n\) 个方程 \(B_j=0\) 应把 \(2n\) 维的 \((\mathbf{x},\mathbf{y})\) 空间切到 \(n\) 维,零点对约 \(R^n\) 个;若多出 \(R^{\varepsilon'}\) 倍,说明这些方程"退化"、三次型有特殊的几何结构。第 14 章正是要分析这种退化三次型。
- "排除 \(\mathbf{x}=\mathbf{0}\) 或 \(\mathbf{y}=\mathbf{0}\)"
- 当 \(\mathbf{x}=\mathbf{0}\) 时 \(B_j(\mathbf{0}\,|\,\mathbf{y})=0\) 自动成立,这种"平凡零点对"有 \(\ll R^n\) 个;同理 \(\mathbf{y}=\mathbf{0}\)。它们远少于 \(R^{n+\varepsilon'}\),可以放心剔除而不影响 A 的断言——保证 A 里那些"异常多"的零点对是真有内容的非平凡零点。
这条注在说什么、本章如何接到后面。选项 B 的形状("\(S\) 大 \(\Rightarrow\) \(\alpha\) 靠近小分母 \(a/q\)")正是前面华林问题各章里 Weyl 不等式给出的同款结论——所以"原则上熟悉"。它的用处是实现主弧/次弧二分:
- 由 B,凡是 \(S(\alpha)\) 大的 \(\alpha\),都被关进"小分母分数 \(a/q\) 的窄邻域"里。这些窄邻域就是主弧,数量不多(小分母 \(q\) 的分数稀疏)、总长很短。
- 主弧之外的所有 \(\alpha\)(次弧),\(S(\alpha)\) 必定小(否则就该被关进主弧)。于是次弧对积分 \(\int_0^1S(\alpha)d\alpha\) 的贡献低于 \(P^{n-3}\) 阶,可整体丢弃——这正是第 15 章要做的"令人满意地估计一大类 \(\alpha\) 的贡献"。
- 剩下的只有"相对较少的若干短区间"(主弧),在其上 \(S(\alpha)\) 可以被一个干净的近似公式代替,进而算出主项 \(cP^{n-3}\)(第 15–17 章)。
- 至于选项 A(三次型退化的情形),第 14 章专门处理:证明若 \(B_j\) 有异常多零点,三次型必含一个可解的子结构,照样能找出解。两条分支殊途同归,主定理得证。
10. 全章脉络一句话总结
返回 全书目录