华林问题:数 \(G(k)\)Waring's problem: the number \(G(k)\)
本页是面向中国普通高中生的逐段精讲。彩色框(目标 / 符号 / 分步推演 / 配图)是为你准备的详解;我们把原书里所有"显然""容易看出""不难"的地方,统统拆成一步一步的完整推导,并把每一个超出高中范围的符号都从零讲清。读起来会很长——但读完,你能真正看懂 Vinogradov 这条著名定理的每一处细节。
每个正整数都能写成若干个完全 \(k\) 次幂(如 \(1,2^k,3^k,\dots\))之和——这是 18 世纪 Waring 的猜想。本章关心的是"对所有充分大的整数,最少需要几个 \(k\) 次幂",这个最少个数记作 \(G(k)\)。
读完你将掌握:
- \(G(k)\) 的精确定义,以及它的简单下界 \(G(k)\ge k+1\)、上界 \(G(k)\le 2^k+1\) 从何而来;
- 圆法(the circle method)怎样把"有多少种表示法"变成一个定积分 \(\int_0^1\);主弧、次弧如何划分区间 \([0,1]\);
- van der Corput 的"求和换积分"引理、Vinogradov 的"双线性和"估计这两件核心工具,以及它们各自的完整证明;
- 怎样把这些零件拼起来,证出 Vinogradov 1934 年的著名上界 \[ G(k) < (6+\delta)\,k\log k. \]
预备:先把记号从零讲清
本章用到大量分析数论的"行话"。它们其实都能用高中知识理解,只是写法陌生。下面这一组卡片请先扫一遍,遇到不懂的符号随时回来查。
这是全章的主角,务必弄懂。这里 \(i\) 是虚数单位(\(i^2=-1\)),\(\pi\) 是圆周率。由欧拉公式 \[ e^{i\theta}=\cos\theta+i\sin\theta, \] 所以 \[ e(\alpha)=e^{2\pi i\alpha}=\cos(2\pi\alpha)+i\sin(2\pi\alpha). \] 它是一个模长为 \(1\) 的复数,落在复平面的单位圆上。当 \(\alpha\) 增加 \(1\),角度 \(2\pi\alpha\) 增加 \(2\pi\),转回原处——所以 \(e(\alpha)\) 只看 \(\alpha\) 的小数部分,是个周期为 \(1\) 的函数。两条最常用的性质:
- \(e(\alpha)\,e(\beta)=e(\alpha+\beta)\)(指数相加,对应角度相加);
- \(|e(\alpha)|=1\)(模长恒为 \(1\))。
\(\int_0^1 g(\alpha)\,d\alpha\) 就是高中学的定积分(函数图象与横轴之间的"带符号面积"),这里被积函数取复值,把实部虚部分别积分即可。本章反复用到一条正交关系:对任意整数 \(m\), \[ \int_0^1 e(m\alpha)\,d\alpha=\begin{cases}1,&m=0,\\[2pt]0,&m\neq 0.\end{cases} \] 为什么?当 \(m=0\) 时被积函数恒为 \(1\),积分得 \(1\);当 \(m\neq0\) 时 \(e(m\alpha)\) 在 \([0,1]\) 上正好转 \(|m|\) 整圈,正负抵消,面积为 \(0\)。直接算:\(\int_0^1 e^{2\pi i m\alpha}d\alpha=\big[\tfrac{e^{2\pi i m\alpha}}{2\pi i m}\big]_0^1=\tfrac{e^{2\pi i m}-1}{2\pi i m}=0\),因为 \(e^{2\pi i m}=1\)。这条关系是圆法的总开关:它能从一大堆 \(e(\cdot)\) 之和里,精确"挑出"指数为 \(0\) 的那一项。
这是"略去常数、只看增长速度"的速记。
- \(f=O(g)\)(读作"\(f\) 是大 O 的 \(g\)")意思是:存在一个与变量无关的常数 \(C>0\),使 \(|f|\le C\,g\) 恒成立。即 \(f\) 的大小被 \(g\) 的某个倍数压住。
- \(f\ll g\) 与 \(f=O(g)\) 完全同义(Vinogradov 记号)。
- \(f\gg g\) 表示 \(g\ll f\),即 \(f\ge c\,g\)(\(f\) 至少是 \(g\) 的某个正倍数)。
- 同时 \(f\ll g\) 且 \(f\gg g\),就说 \(f\) 与 \(g\) 同阶。
例:\(3n^2+5n=O(n^2)\),因为 \(3n^2+5n\le 8n^2\)。本章里这些常数 \(C\) 允许依赖 \(k\)(但不依赖 \(P,N\) 这些"趋于无穷"的量),这一点很关键。符号 \(\varepsilon\) 表示"任意小的正数",\(P^\varepsilon\) 用来吸收像 \(\log P\) 这样增长极慢的因子。
- \(f\sim g\)(当 \(X\to\infty\))表示 \(f/g\to 1\),即两者比值趋于 \(1\),"几乎相等"。
- \(\Vert x\Vert\) 表示 \(x\) 到离它最近的整数的距离,例如 \(\Vert 2.3\Vert=0.3,\ \Vert 2.8\Vert=0.2\),总有 \(0\le\Vert x\Vert\le\tfrac12\)。它度量"\(x\) 离整数有多近"。
- \([x]\) 是下取整(不超过 \(x\) 的最大整数),如 \([3.7]=3\)。
- \(a\equiv b\pmod q\) 表示 \(a-b\) 能被 \(q\) 整除("\(a,b\) 除以 \(q\) 余数相同")。这是初中"被几整除"的精确写法。
- \((a,q)\) 表示 \(a,q\) 的最大公约数;\((a,q)=1\) 即两者互素(没有大于 \(1\) 的公因子)。
- 欧拉函数 \(\varphi(q)\) 表示 \(1,2,\dots,q\) 中与 \(q\) 互素的数的个数(本章在"奇异级数"里间接用到)。
- \(T(\alpha)=\sum_{x=1}^{P}e(\alpha x^k)\)
- 生成函数(指数和):把 \(1^k,2^k,\dots,P^k\) 都"挂"到单位圆上。它的 \(s\) 次幂展开后,指数恰好是各种 \(k\) 次幂之和,这正是华林问题需要的。
- \(S_{a,q}=\sum_{z=1}^{q}e(az^k/q)\)
- 一个完整指数和(高斯和的推广),只跟模 \(q\) 的算术有关,反映"\(k\) 次幂模 \(q\) 的分布"。
- \(I(\beta)=\int_0^P e(\beta\xi^k)\,d\xi\)
- 奇异积分的雏形,是把 \(T\) 里的求和换成积分得到的连续版本。
- \(\mathfrak{S}(M)\)
- 奇异级数:把所有 \(q\) 的 \(S_{a,q}\) 贡献加起来,是一个反映"模任意数都无障碍"的正因子。
- \(\mathfrak{M}\)(主弧)/ \(\mathfrak{m}\)(次弧)
- 把区间 \([0,1]\) 切成两部分:靠近"分母小的分数 \(a/q\)"的一小段段叫主弧,其余叫次弧。
设我们想数:\(N\) 写成 \(s\) 个 \(k\) 次幂之和 \(x_1^k+\cdots+x_s^k=N\)(每个 \(1\le x_j\le P\))共有几种方法。把 \[ T(\alpha)^s=\Big(\sum_{x=1}^{P}e(\alpha x^k)\Big)^s=\sum_{x_1}\cdots\sum_{x_s}e\big(\alpha(x_1^k+\cdots+x_s^k)\big) \] 乘上 \(e(-N\alpha)\) 再沿 \([0,1]\) 积分。由上面的正交关系,只有 \(x_1^k+\cdots+x_s^k=N\) 的那些项积出 \(1\),其余积出 \(0\)。于是 \[ \int_0^1 T(\alpha)^s e(-N\alpha)\,d\alpha=\#\{(x_1,\dots,x_s):x_1^k+\cdots+x_s^k=N\}. \] 这就把"数解的个数"变成了"算一个积分"。剩下的全部工作,就是估这个积分——把 \([0,1]\) 切成主弧(贡献主项,给出正的下界)和次弧(贡献误差,要证明它小)。本章就是这条路线的一次精彩演出。
第 1 段:\(G(k)\) 的定义与最朴素的上下界
译文:数 \(G(k)\) 被(Hardy 和 Littlewood)定义为具有如下性质的最小的 \(s\) 值:每个充分大的整数 \(N\) 都可以表示为 \(s\) 个正整数 \(k\) 次幂之和。由定理 4.1 和定理 5.1,我们已经知道 \(G(k)\le 2^k+1\)。从相反的方向看,由密度方面的考虑容易推出 \(G(k)\ge k+1\);事实上,满足
\[ x_1^k+\cdots+x_k^k\le X,\quad 0 这一段在讲什么:先把研究对象 \(G(k)\) 定义清楚,再说它现成已知的两道"夹板"——上界 \(2^k+1\) 和下界 \(k+1\)(以及更精细的 \(\Gamma(k)\))。 "\(s\) 个正整数 \(k\) 次幂之和"指的是形如 \(x_1^k+x_2^k+\cdots+x_s^k\)(\(x_j\ge1\))的数。\(G(k)\) 定义为:使得所有足够大的 \(N\) 都能这样表示的最小个数 \(s\)。注意两个关键词: 上界 \(G(k)\le 2^k+1\) 从哪来:这是前几章(定理 4.1、5.1)已经证过的结论,用的正是上面说的圆法:取 \(s=2^k+1\) 个变量,能保证次弧误差被华的不等式压住、主弧给出正的主项,于是大整数都有表示。本章的目标,是当 \(k\) 很大时把这个上界从指数级的 \(2^k\) 大幅降到 \(k\log k\) 级别。 下界 \(G(k)\ge k+1\) 的"密度"论证——把省略补全:原文说"容易看出"个数渐近于 \(\gamma X\) 且 \(\gamma<1\)。我们把它说透。 有时候问题"卡"在模某个数上:比如模 \(8\) 时,任何完全平方数只能是 \(0,1,4\),于是 \(7\) 个奇平方相加也凑不出某些余数,这就给出比"密度"更强的下界。\(\Gamma(k)\)(第 4 章定义)正是把所有这类同余障碍综合起来得到的下界,故 \(G(k)\ge\Gamma(k)\)。直观上:哪怕"实数层面"能凑出,只要"模某个数"凑不出,整数表示就不存在。 译文:当 \(k\) 较大时,对 \(G(k)\) 存在更好的上界。1934 年 Vinogradov 证明了当 \(k>k_0(\delta)\) 时 \(G(k)<(6+\delta)k\log k\),其中 \(\delta\) 是任意小的正数。我们现在给出该证明的一个阐述(主要依据 Heilbronn)。系数 \(6\) 后来被 Vinogradov 于 1947 年改进为 \(3\),但证明较难。 这一段在讲什么:交代本章主定理的出处、数值以及在历史上的分量。 这里 \(\log\) 是自然对数(以 \(e\) 为底)。式子说:系数可以无限逼近 \(6\),代价是 \(k\) 要足够大——\(k_0(\delta)\) 是一个只依赖 \(\delta\) 的门槛,\(\delta\) 越小门槛越高。这是分析里典型的"\(\varepsilon\)–\(N\) 式"说法:结论对大 \(k\) 成立,把开头有限个小 \(k\) 排除在外。Heilbronn 是把 Vinogradov 较难读的原证整理清楚的人,本章正文沿用他的叙述。 译文:读者记得第 4 章把 \(\alpha\) 的积分区间分为主弧和次弧,主弧由那些容许有理逼近 \(a/q\)(\(q\le P^\delta,\ |\alpha-a/q|
这一段在讲什么:这是全章的"战略说明"。作者解释:以前用 \(s=2^k\) 个变量时,华的不等式很猛,主弧可以取得又少又短;但现在我们想用少得多的变量(只有 \(4k\) 个 \(T\)),次弧上没那么多"本钱"了,所以必须把主弧上对 \(T(\alpha)\) 的逼近做得更精细。这就引出第一件新工具。 \(T(\alpha)\) 有 \(P\) 项,每项模长 \(1\),所以平凡上界 \(|T(\alpha)|\le P\),于是 \(|T|^{2^k}\le P^{2^k}\),积分平凡估计 \(\le P^{2^k}\)。但华的不等式(引理 3.2)给出
\[ \int_0^1|T(\alpha)|^{2^k}d\alpha\ll P^{2^k-k+\varepsilon}, \]
比平凡估计小了一个 \(P^k\) 因子——这就是"节省了几乎 \(P^k\)"。本质原因:\(T(\alpha)\) 在大部分 \(\alpha\) 上远小于 \(P\),只有在主弧附近才接近 \(P\)。变量越多,这种节省越能压住次弧;变量少了,就得另想办法在主弧上把 \(T\) 算得更准。 \(T(\alpha)=\sum_x e(\alpha x^k)\) 是离散求和,难算;而积分 \(\int e(\alpha\xi^k)d\xi\) 是连续的,可以用换元、特殊函数算出干净的封闭形式。当 \(\alpha\) 靠近 \(a/q\) 时,相邻项 \(e(\alpha x^k)\) 变化很"平缓",求和与积分几乎相等。van der Corput 引理就是把这个"几乎相等"精确化:在导数受控的条件下,求和等于积分加一个 \(O(1)\) 的小误差。这正是我们需要的、比第 4 章粗糙办法精细得多的逼近。 第三步:拼成梯形求和公式。把($\ast$)对 \(m=A,A+1,\dots,B-1\) 求和。右边第一项 \(\sum_{m=A}^{B-1}\tfrac12\{F(m{+}1){+}F(m)\}\) 是经典的梯形和:每个内部整点 \(F(n)\)(\(A 第四步:把锯齿展成傅里叶级数。对任意非整数 \(x\),锯齿波有展开
\[ \Psi(x)=-\sum_{\nu=1}^{\infty}\frac{\sin2\pi\nu x}{\pi\nu}. \]
这是 \(\Psi\)(周期 \(1\) 的奇函数)的傅里叶正弦级数,是标准结果。代入并交换求和与积分(由级数有界收敛,交换合法):
\[ I=-\sum_{\nu=1}^{\infty}\frac{1}{\nu\pi}\int_A^B(\sin2\pi\nu x)\big(\cos(2\pi f(x))\big)'\,dx. \]
\(x-[x]\) 是 \(x\) 的小数部分,在 \(0\) 到 \(1\) 间锯齿状上升;减去 \(\tfrac12\) 把它居中到 \([-\tfrac12,\tfrac12)\),平均值为 \(0\)。它周期为 \(1\),在每个整数处跳变。傅里叶级数把这种锯齿写成无穷个正弦波之和——这样就能把含 \(\Psi\) 的积分逐项处理。 第五步:把积分整理成一个干净形状。注意 \(\big(\cos(2\pi f)\big)'=-2\pi f'\sin(2\pi f)\),代入上式,常数 \(-2\pi\) 与前面的 \(-\tfrac1{\nu\pi}\) 合并出系数 \(\tfrac{2}{\nu}\):
\[ I=2\sum_{\nu=1}^{\infty}\frac1\nu\int_A^B(\sin2\pi\nu x)\,(\sin2\pi f(x))\,f'(x)\,dx. \]
再用积化和差 \(2\sin A\sin B=\cos(A-B)-\cos(A+B)\)(这里 \(A=2\pi\nu x,\ B=2\pi f\)):
\[ I=\sum_{\nu=1}^{\infty}\frac1\nu\int_A^B f'(x)\Big\{\cos\!\big(2\pi(\nu x-f)\big)-\cos\!\big(2\pi(\nu x+f)\big)\Big\}dx. \]
现在只要对每个 \(\nu\)、每个符号 \(\pm\),证明单个积分小即可。 第六步:单个积分的估计——核心不等式。我们证
\[ \left|\int_A^B f'(x)\cos\!\big(2\pi(\nu x\pm f)\big)dx\right|<\frac{1}{\pi(2\nu-1)}. \tag{$\dagger$} \]
把被积函数改写:令 \(\phi(x)=\sin\!\big(2\pi(\nu x\pm f)\big)\),则 \(\phi'(x)=2\pi(\nu\pm f')\cos\!\big(2\pi(\nu x\pm f)\big)\)。于是
\[ f'\cos\!\big(2\pi(\nu x\pm f)\big)=\frac{1}{2\pi}\cdot\frac{f'}{\nu\pm f'}\cdot\phi'(x), \]
积分变成 \(\dfrac1{2\pi}\displaystyle\int_A^B\dfrac{f'}{\nu\pm f'}\,\phi'\,dx\)。这是"单调函数 × 振荡导数"的标准形状,用第二中值定理处理。 第七步:对 \(\nu\) 求和收尾。第 \(\nu\) 项是两个 cos 积分之差 \(\frac1\nu\int f'\{\cos(2\pi(\nu x-f))-\cos(2\pi(\nu x+f))\}dx\),由($\dagger$)每个积分的绝对值都 \(<\tfrac1{\pi(2\nu-1)}\)(其中"\(+\)"号那个由第六步还更小,\(<\tfrac1{\pi(2\nu+1)}\))。按书中的写法逐项相加:
\[ |I|<\frac1\pi\sum_{\nu=1}^{\infty}\frac{1}{\nu(2\nu-1)}<\frac2\pi. \]
为什么级数 \(<2\):首项 \(\nu=1\) 是 \(\tfrac1{1\cdot1}=1\),其余 \(\tfrac1{\nu(2\nu-1)}<\tfrac1{\nu(2\nu-2)}=\tfrac1{2\nu(\nu-1)}\) 可与收敛级数比较,总和 \(=2\ln2\approx1.386<2\)。于是 \(|I|<\tfrac2\pi\),是个绝对常数,即 \(I=O(1)\)。引理 9.1 证毕。∎ 译文:我们为本章定义主弧 \(\mathfrak{M}_{a,q}\),由满足
\[ (a,q)=1,\quad 1\le a\le q,\quad q\le P^{1/2},\quad |q\alpha-a|<\frac{1}{2kP^{k-1}} \tag{9.1}\]
的区间组成。如第 2 章,定义 \(T(\alpha)=\sum_{x=1}^{P}e(\alpha x^k)\)。 这一段在讲什么:正式划定"主弧"——即 \([0,1]\) 里靠近某个分母 \(q\le P^{1/2}\) 的既约分数 \(a/q\) 的那些极窄区间;同时重申主角生成函数 \(T(\alpha)\)。 所有这些小区间的并集记作 \(\mathfrak{M}\)(主弧全体);\([0,1]\) 中剩下的部分记作 \(\mathfrak{m}\)(次弧)。 把 \(x=1,2,\dots,P\) 的 \(k\) 次幂 \(x^k\) 当相位挂到单位圆上求和。当 \(\alpha\) 是整数时所有项都等于 \(1\),\(T=P\)(峰值);当 \(\alpha\) 一般时各项方向杂乱、互相抵消,\(|T|\) 远小于 \(P\)。主弧正是 \(T\) 接近峰值、贡献主项之处。这里取上限 \(P\),是因为我们要表示的 \(N\sim P^k\),每个底数最大约 \(N^{1/k}\approx P\)。 这一段在讲什么:把主弧上的 \(T(\alpha)\) 拆成两部分相乘:一个算术因子 \(q^{-1}S_{a,q}\)(只跟 \(q\) 的同余结构有关)乘上一个分析因子 \(I(\beta)\)(连续积分),再加一个不大的误差 \(O(q)\)。这正是圆法主弧分析的标准形态。 第二步:验证内和满足 van der Corput 条件。令 \(f(y)=\beta(qy+z)^k\)。则(设 \(\beta>0\))
\[ f'(y)=k\beta q(qy+z)^{k-1}. \]
因为 \(qy+z\le P\),\((qy+z)^{k-1}\le P^{k-1}\);又由 (9.1),\(|\beta|<\dfrac1{2kqP^{k-1}}\)。代入:
\[ f'(y) 第三步:用引理 9.1 把内和换成积分。
\[ \sum_y e\big(\beta(qy+z)^k\big)=\int e\big(\beta(q\eta+z)^k\big)\,d\eta+O(1). \]
对积分作换元 \(\xi=q\eta+z\)(\(d\xi=q\,d\eta\)):\(\displaystyle\int e(\beta(q\eta+z)^k)d\eta=\frac1q\int e(\beta\xi^k)d\xi=\frac1q I(\beta)\),其中 \(I(\beta)=\int_0^P e(\beta\xi^k)d\xi\)(积分上下限的小偏差并入误差)。 第四步:合并。代回外和:
\[ T(\alpha)=\sum_{z=1}^q e\!\Big(\frac{az^k}{q}\Big)\Big[\frac1q I(\beta)+O(1)\Big]
=\frac1q\,I(\beta)\underbrace{\sum_{z=1}^q e\!\Big(\frac{az^k}{q}\Big)}_{=\,S_{a,q}}+\;\underbrace{O(q)}_{q\text{ 个 }O(1)}. \]
即 \(T(\alpha)=q^{-1}S_{a,q}I(\beta)+O(q)\),得 (9.2)。∎ 解读这条注:证明里真正用到的只是 \(|\beta|\) 的上界(让 \(f'\le\tfrac12\))。\(q\le P^{1/2}\) 是为了让误差 \(O(q)\) 相对主项足够小(下条引理 9.3 会精确利用)。如果 \(q\) 大到接近 \(P\),误差 \(O(q)\) 就可能淹没主项 \(q^{-1}S_{a,q}I(\beta)\),逼近失去意义。这是"为什么这样取参数"的典型例子。 译文(补充逼近):还有更有效的逼近:若 \(q\le P^{1-\delta}\) 且 \(|q\alpha-a|
解读:这是一个更强但更难证的版本(来自 Davenport 的论文),本章主线不用它,只是顺带提及。它把误差从 \(O(q)\) 改进到 \(O(q^{3/4+\varepsilon})\),而且这个 \(3/4\) 与 \(k\) 无关——这很反直觉,因为 \(k\) 越大问题通常越难。作者点出它,是想让读者知道"主弧逼近还能更精细",但为保持证明简洁,本章用引理 9.2 的较弱版本就够了。这体现了一种取舍:够用即可,不追求最优。 这一段在讲什么:引理 9.3 说,只要变量个数 \(s\ge4k\),主弧上的核心积分就有一个正的下界 \(\gg P^{s-k}\),而且对一整段 \(M\) 都成立。这个"主项确实是正的、且足够大"是整个圆法成功的命脉——它保证表示数最终为正。"对一个范围的 \(M\)"这个细节,是为了后面把 \(u_1,u_2,y^kv\) 这些变动的量塞进 \(M\) 里(见主要思想 (9.5))。 第二步:误差 \(O(q)\) 不超过主项。要证 \(q\ll q^{-1/k}\min(P,|\beta|^{-1/k})\),即 \(q^{1+1/k}\) 同时 \(
第三步:误差项积分并对 \(a,q\) 求和——确认它是低阶。对 \(\beta\) 积分(范围可放大到 \((-\infty,\infty)\)),用 \(\int(\min(P,|\beta|^{-1/k}))^{s-1}d\beta\ll P^{s-1-k}\),得每个 \(\mathfrak{M}_{a,q}\) 上误差 \(\ll q\cdot q^{-(s-1)/k}P^{s-1-k}=q^{1-(s-1)/k}P^{s-1-k}\)。再对 \(a\)(至多 \(q\) 个)与 \(q\le P^{1/2}\) 求和:
\[ \ll P^{s-1-k}\sum_q q\cdot q^{1-(s-1)/k}=P^{s-1-k}\sum_q q^{2-(s-1)/k}\ll P^{s-k-1}, \]
级数收敛因为指数 \(2-\dfrac{s-1}{k}<-1\),即 \(s-1>3k\),由 \(s\ge4k\) 成立。结论:误差是 \(P^{s-k-1}\),比目标 \(P^{s-k}\) 低一个 \(P\) 因子。 第四步:主项的贡献。主项对 (9.4) 的贡献为
\[ \sum_q\sum_a\big(q^{-1}S_{a,q}\big)^s e(-Ma/q)\int I^s(\beta)e(-M\beta)\,d\beta. \]
把 \(\beta\) 积分扩展到 \((-\infty,\infty)\),所添尾部用 \(|I|\ll|\beta|^{-1/k}\) 估计:
\[ \ll\sum_q q\,q^{-s/k}\int_{(2kq)^{-1}P^{1-k}}^{\infty}\beta^{-s/k}d\beta\ll\sum_q q^{1-s/k}q^{s/k-1}P^{(k-1)(s/k-1)}\ll P^{s-k-s/k+3/2}\ll P^{s-k-1}. \]
(用了 \(\int_c^\infty\beta^{-s/k}d\beta\sim c^{1-s/k}\),\(c=(2kq)^{-1}P^{1-k}\),并对 \(P^{1/2}\) 个 \(q\) 求和;指数 \(-s/k+3/2\le-4+1.5<-1\)。)于是尾部也是低阶的。 第五步:算干净的核心积分 \(\int I^s e(-M\beta)d\beta\)。先作变量替换把 \(I\) 标准化:令 \(I(\beta)=Pk^{-1}I_1(\beta P^k)\),其中 \(I_1(\gamma)=\int_0^1 e(\gamma\eta)\eta^{-1+1/k}d\eta\)。
验证:在 \(I(\beta)=\int_0^P e(\beta\xi^k)d\xi\) 中令 \(\eta=(\xi/P)^k\)(即 \(\xi=P\eta^{1/k},\ d\xi=\tfrac Pk\eta^{-1+1/k}d\eta\)),则 \(\beta\xi^k=\beta P^k\eta\),
\[ I(\beta)=\frac Pk\int_0^1 e(\beta P^k\eta)\,\eta^{-1+1/k}d\eta=Pk^{-1}I_1(\beta P^k). \]
再令 \(\beta=P^{-k}\gamma\)(\(d\beta=P^{-k}d\gamma\)):
\[ \int_{-\infty}^{\infty}I^s(\beta)e(-M\beta)d\beta=P^{s-k}k^{-s}\int_{-\infty}^{\infty}I_1^s(\gamma)e(-\theta\gamma)d\gamma,\qquad \theta=\frac{M}{P^k}\in[\tfrac15,1]. \] 第六步:用傅里叶积分定理算出封闭形式。如定理 4.1 的证明,
\[ \int_{-\infty}^{\infty}I_1^s(\gamma)e(-\theta\gamma)d\gamma=\int_0^1\!\!\cdots\!\int_0^1\big\{\zeta_1\cdots\zeta_{s-1}(\theta-\zeta_1-\cdots-\zeta_{s-1})\big\}^{-1+1/k}d\zeta_1\cdots d\zeta_{s-1}, \]
积分区域是 \(\zeta_1+\cdots+\zeta_{s-1}<\theta\) 的单纯形。这是一个 Beta/Dirichlet 型积分,算得
\[ \int_{-\infty}^{\infty}I_1^s(\gamma)e(-\theta\gamma)d\gamma=\theta^{s/k-1}\frac{\Gamma(1/k)^s}{\Gamma(s/k)}. \]
因 \(\theta\ge\tfrac15\),这是一个正的、与 \(P\) 无关的常数(含 \(\Gamma\) 函数值),故
\[ \int_{-\infty}^{\infty}I^s(\beta)e(-M\beta)d\beta\gg P^{s-k}. \] \(\Gamma(z)=\int_0^\infty t^{z-1}e^{-t}dt\) 是阶乘的连续推广(\(\Gamma(n)=(n-1)!\))。上式的 \(\Gamma(1/k)^s/\Gamma(s/k)\) 就是那个"奇异积分"的精确值,是个固定正数。它和第 1 段里"同余障碍"的 \(\Gamma(k)\) 毫无关系,只是恰好都用了希腊字母 \(\Gamma\)。 第七步:奇异级数给出正的算术下界。剩下要给
\[ \sum_{q\le P^{1/2}}\ \sum_{\substack{a=1\\(a,q)=1}}^{q}(q^{-1}S_{a,q})^s e(-Ma/q) \]
一个正下界。把它延拓到 \(q=\infty\),所添尾部由 \(P\) 的负幂界定(引理 6.4,因 \(s\ge4k>2k+1\) 保证级数收敛)。延拓后它就是奇异级数 \(\mathfrak{S}(M)\),由定理 6.1 它有一个不依赖 \(M\) 的正下界。把第五、六、七步合起来,主项 \(\gg P^{s-k}\);与第三、四步的误差 \(\ll P^{s-k-1}\) 相比占绝对优势。故 (9.4) 成立。引理 9.3 证毕。∎ 译文:现在来到证明的主要思想:考虑大数 \(N\) 的如下表示
\[ N=x_1^k+\cdots+x_{4k}^k+u_1+u_2+y^k v, \tag{9.5}\]
其中 (i) \(1\le x_j\le P\);(ii) \(u_1,u_2\) 遍历所有小于 \(\tfrac14P^k\) 且可表示为 \(\ell\) 个正整数 \(k\) 次幂之和的不同的数;(iii) \(1\le y\le P^{1/2k}\);(iv) \(v\) 遍历小于 \(\tfrac14P^{k-1/2}\) 且可表示为 \(\ell\) 个 \(k\) 次幂之和的不同的数。这样我们把 \(N\) 表示为 \(4k+3\ell\) 个 \(k\) 次幂之和。取 \(P=[N^{1/k}]+1\),则
\[ \tfrac15P^k 这一段在讲什么:这是全章的战略核心。直接用 \(s\) 个变量 \(x_1^k+\cdots+x_s^k=N\) 需要 \(s\) 很大才能让圆法奏效。Vinogradov 的妙招是:只用 \(4k\) 个"自由幂" \(x_j^k\)(由引理 9.3 掌控),其余的"凑数"任务交给三个"打包好的零件" \(u_1,u_2,y^kv\)——它们各自已经是 \(\ell\) 个 \(k\) 次幂之和。这样总幂数是 \(4k+3\ell\),只要 \(\ell\) 取成 \(\sim2k\log3k\),就得到 \(k\log k\) 量级的上界。 总幂数:\(4k\)(来自 \(x_j\))\(+\ \ell\)(\(u_1\))\(+\ \ell\)(\(u_2\))\(+\ \ell\)(\(y^kv\))\(=4k+3\ell\)。所以一旦证明这种表示对大 \(N\) 必存在,就得到 \(G(k)\le4k+3\ell\)。 为什么取 \(P=[N^{1/k}]+1\),以及 (9.6) 的完整验证:
"以后必须用 \(k\) 来选取 \(\ell\)"的含义:\(\ell\) 是每个打包数里用的幂数,是我们手里的自由参数。\(\ell\) 越大,打包数能凑出的不同值越多(表示越容易存在),但总幂数 \(4k+3\ell\) 也越大(上界越差)。后面会精确地把 \(\ell\) 取到刚好够用的最小值 \(\sim2k\log3k\),这是一次典型的"取舍优化"。 这一段在讲什么:这条引理量化了"打包数到底有多丰富"——不超过 \(X\) 的、能写成 \(\ell\) 个 \(k\) 次幂之和的不同数,至少有 \(X^{1-\lambda^\ell}\) 个。注意 \(\lambda=1-\tfrac1k\in(0,1)\),故 \(\lambda^\ell\) 随 \(\ell\) 增大迅速趋于 \(0\),指数 \(1-\lambda^\ell\) 趋于 \(1\)——意思是"用足够多的幂,几乎每个数都能凑出"。 每加一个 \(k\) 次幂,能凑出的数的"维度"就以因子 \(\lambda=1-\tfrac1k\) 的方式逼近满额。\(\ell=1\) 时只有完全 \(k\) 次幂,稀疏得很(指数 \(1-\lambda=\tfrac1k\) 很小);\(\ell\) 一大,\(\lambda^\ell=(1-\tfrac1k)^\ell\) 指数式衰减,指数 \(1-\lambda^\ell\) 飞快逼近 \(1\)。例如要让 \(\lambda^\ell\approx\tfrac1{Ck^2}\),取 \(\ell\approx Ck\log k\) 即可(后面正是这么选)。 奠基 \(\ell=1\):能写成"一个 \(k\) 次幂"且 \(\le X\) 的数就是 \(1^k,2^k,\dots\),共 \([X^{1/k}]\) 个,\(\gg X^{1/k}=X^{1-\lambda}\)(因 \(1-\lambda=\tfrac1k\))。成立。 归纳步:设结论对 \(\ell-1\) 成立,证它对 \(\ell\) 成立。构造形如 \(x^k+z\) 的数,其中
\[ \big(\tfrac14X\big)^{1/k} 解读:(9.7) 是这套方法里相对"粗"的一环,至今仍是瓶颈之一。改进它就能改进 \(G(k)\) 的上界——这也解释了为什么后来人们能把系数从 \(6\) 降到 \(3\) 再继续降:很大程度靠把这类计数与指数和估计做得更精细。 这一段在讲什么:把"打包数有多少个"这个计数事实,翻译成圆法需要的积分语言。\(R(\alpha)\) 是打包数 \(u\) 的生成函数;\(\int_0^1|R|^2\) 恰好等于打包数的个数 \(R(0)\),而引理 9.4 又告诉我们这个个数很大,于是 \(\int|R|^2\) 相对 \(R(0)^2\) 很小——这正是次弧估计要用的"节省"。 把这条关键的"注"讲透: 这一段在讲什么:这是 Vinogradov 方法的"心脏"。它处理的是双线性和 \(\sum_x\sum_y e(\alpha xy)\)——相位 \(\alpha xy\) 是两个变量的乘积。关键在于:只要 \(\alpha\) 能被一个中等大小的分母 \(q\) 逼近,这个和就比平凡估计 \(X_0Y_0\) 小很多。这种"乘积型相位"在 \(y^kv\)(\(y^k\) 与 \(v\) 相乘)里天然出现,正好能用。 单变量指数和 \(\sum_x e(\alpha x^k)\) 难估计,因为相位是高次的。但 \(\sum_x\sum_y e(\alpha xy)\) 的相位对每个变量都是一次的——固定 \(x\) 后对 \(y\) 求和是等比级数,能直接算!Vinogradov 的洞见是:很多高次和可以拆成或比较成这种双线性形状,从而借用等比级数的好性质。这一原理"在 Vinogradov 的大部分工作中起重要作用"。 对实数 \((\sum a_xb_x)^2\le(\sum a_x^2)(\sum b_x^2)\)——这就是高中的"\((\vec u\cdot\vec v)^2\le|\vec u|^2|\vec v|^2\)"。复数版把平方换成模平方。本证明取 \(a_x=1\),把"和的平方"换成"\(X_0\) 乘以各项平方和",从而打开了对 \(x,y,y'\) 三重求和的展开之路。这是分析数论里最常用的一招。 这一段在讲什么:把刚证的一般引理 9.5 套到我们具体的 \(S(\alpha)\)(第三个零件 \(y^kv\) 的生成函数)上。结论是:在次弧(\(q>P^{1/2}\))上,\(|S(\alpha)|\) 比它的平凡上界 \(S(0)\) 小一个约 \(P^{1/4k}\) 的因子。这就是前面"注"里说的、用来补足缺口的额外节省。 第二步:代入 (9.10) 并化简。
\[ |S(\alpha)|^2\ll X_0\,P^{\frac1{2k}}\,\frac{\log q}{q}\Big(q+\tfrac14P^{k-\frac12}\Big)\big(q+P^{1/2}\big). \]
现在用条件 \(P^{1/2} 第三步:除以 \(S(0)^2\)。平凡值 \(S(0)=\sum_y\sum_v1=P^{\frac1{2k}}X_0\gg P^{\frac1{2k}}X_0\)。所以
\[ \Big|\frac{S(\alpha)}{S(0)}\Big|^2\ll\frac{X_0P^{\frac1{2k}}(\log P)P^{k-\frac12}}{(P^{\frac1{2k}}X_0)^2}=\frac{(\log P)P^{k-\frac12}}{P^{\frac1{2k}}X_0}\ll P^{-\frac1{2k}+(k-\frac12)+\varepsilon}X_0^{-1}. \]
(\(\log P\) 被 \(P^\varepsilon\) 吸收。) 第四步:用引理 9.4 估 \(X_0\)。\(X_0=U_\ell(\tfrac14P^{k-1/2})\gg P^{(k-\frac12)(1-\lambda^\ell)}\),故 \(X_0^{-1}\ll P^{-(k-\frac12)(1-\lambda^\ell)}\)。代入:
\[ \Big|\frac{S(\alpha)}{S(0)}\Big|^2\ll P^{-\frac1{2k}+(k-\frac12)+\varepsilon-(k-\frac12)(1-\lambda^\ell)}=P^{-\frac1{2k}+(k-\frac12)\lambda^\ell+\varepsilon}. \]
开平方(指数减半,\(\varepsilon\) 可略):
\[ \Big|\frac{S(\alpha)}{S(0)}\Big|\ll P^{-\frac1{4k}+\frac12(k-\frac12)\lambda^\ell}, \]
即 (9.12)。∎ 解读:当 \(\lambda^\ell\) 很小(我们会让它 \(\approx\tfrac1{Ck^2}\))时,指数里 \(\tfrac12(k-\tfrac12)\lambda^\ell\) 那一项可忽略,于是 \(|S(\alpha)|\ll S(0)P^{-1/4k}\)——次弧上额外省了 \(\tfrac1{4k}\)。这恰好就是前面"注"里说"还需多省一点(比 \(\tfrac1{Ck}\) 更多)"的那一点。三块拼图(\(T\) 的平凡 \(P\)、\(R\) 的 \(k(1-\lambda^\ell)\)、\(S\) 的 \(\tfrac1{4k}\))合起来,才够把次弧压下去。 这一段在讲什么:这是圆法的"清扫战"——证明次弧对总积分的贡献,比主弧的主项 \(P^{3k}R^2(0)S(0)\) 小一个 \(P^{-\delta}\) 因子,从而可以忽略。三块生成函数各出一份力,合起来刚好把次弧压成低阶。 第二步:搬来三块估计。
第三步:把三块乘起来。在被积式里,\(|T|^{4k}\) 用 \(P^{4k}\) 顶掉,\(|S(\alpha)|\) 用其次弧上界顶掉(与 \(\alpha\) 无关的常数因子可提出积分),剩下 \(\int_{\mathfrak m}|R|^2\le\int_0^1|R|^2\):
\[ \int_{\mathfrak m}|T|^{4k}|R|^2|S|\,d\alpha\ll P^{4k}\cdot S(0)P^{-\frac1{4k}+\frac12(k-\frac12)\lambda^\ell}\cdot R^2(0)P^{-k+k\lambda^\ell}. \]
合并 \(P\) 的指数:\(4k-k=3k\);剩下 \(-\dfrac1{4k}+\big[\tfrac12(k-\tfrac12)+k\big]\lambda^\ell\)。注意 \(\tfrac12(k-\tfrac12)+k=\tfrac32k-\tfrac14<\tfrac32k\),故
\[ \ll P^{3k}R^2(0)S(0)\,P^{-\frac1{4k}+\frac32k\lambda^\ell}. \] 第四步:用 \(\ell\ge2k\log3k\) 压住 \(\lambda^\ell\)。
\[ \log\lambda^\ell=\ell\log\Big(1-\frac1k\Big)<\ell\cdot\Big(-\frac1k\Big)=-\frac\ell k\le-2\log3k, \]
(用了不等式 \(\log(1-t)<-t\),对 \(0 第五步:净得负幂。于是指数 \(-\dfrac1{4k}+\dfrac32k\lambda^\ell<-\dfrac1{4k}+\dfrac1{6k}=-\dfrac1{12k}\)。取 \(\delta=\dfrac1{12k}>0\)(一个固定正数),即得
\[ \int_{\mathfrak m}|T|^{4k}|R|^2|S|\,d\alpha\ll P^{3k}R^2(0)S(0)\,P^{-\delta}. \]
引理 9.6 证毕。∎ 这一段在讲什么:收官。把前面所有引理像齿轮一样咬合:主弧给正主项(引理 9.3),次弧可忽略(引理 9.6),于是表示数 \(r_1(N)\to\infty\),表示必存在,读出 \(G(k)\) 的上界。 第二步:拆成主弧 + 次弧。\(\int_0^1=\int_{\mathfrak M}+\int_{\mathfrak m}\)。由引理 9.6,只要 \(\ell\ge2k\log3k\),次弧部分
\[ \Big|\int_{\mathfrak m}\Big|\ll P^{3k}R^2(0)S(0)P^{-\delta}, \]
比主项低 \(P^\delta\) 阶,可忽略。 第三步:主弧部分。把 \(R^2(\alpha)S(\alpha)\) 按定义展开成对 \(u_1,u_2,y,v\) 的求和(每个 \(e(\alpha\cdot)\) 提出来),主弧贡献为
\[ \sum_{u_1}\sum_{u_2}\sum_y\sum_v\int_{\mathfrak M}T^{4k}(\alpha)\,e\big(\alpha(-N+u_1+u_2+y^kv)\big)\,d\alpha. \]
外层求和的项数 \(=R(0)\cdot R(0)\cdot S(0)=R^2(0)S(0)\)(\(u_1,u_2\) 各 \(R(0)\) 种,\((y,v)\) 共 \(S(0)\) 种)。 第四步:对每一项套引理 9.3。令 \(M=N-u_1-u_2-y^kv\)。第三步里的积分正是 \(\int_{\mathfrak M}T^{4k}(\alpha)e(-M\alpha)d\alpha\)。由 (9.6),无论怎么选 \(u_1,u_2,y,v\),都有 \(\tfrac15P^k 第五步:合计并读出结论。主弧贡献 \(\gg R^2(0)S(0)\cdot P^{3k}\),主导次弧的 \(P^{3k}R^2(0)S(0)P^{-\delta}\)。故
\[ r_1(N)\gg P^{3k}R^2(0)S(0). \]
当 \(N\to\infty\) 时 \(P\to\infty\),且 \(R(0),S(0)\to\infty\),所以 \(r_1(N)\to\infty\)。表示数趋于无穷,特别地大于 \(0\),于是 (9.5) 形式的表示对所有充分大的 \(N\) 必存在。因为这种表示用了 \(4k+3\ell\) 个 \(k\) 次幂,故
\[ G(k)\le4k+3\ell. \]
取允许的最小 \(\ell=\lceil2k\log3k\rceil\le2k\log3k+1\):
\[ G(k)\le4k+3(2k\log3k+1)=4k+6k\log3k+3. \]
定理 9.1 证毕。∎ 当 \(k\to\infty\) 时,\(\log3k=\log k+\log3\),于是
\[ 4k+6k\log3k+3=6k\log k+(6\log3)\,k+4k+3=6k\log k\Big(1+\underbrace{\tfrac{6\log3+4}{6\log k}+\tfrac1{2k\log k}}_{\to0}\Big). \]
括号里的修正项随 \(k\) 增大趋于 \(0\),所以对任意 \(\delta>0\),当 \(k>k_0(\delta)\) 时 \(G(k)<(6+\delta)k\log k\)——正是第 2 段宣告的 Vinogradov 定理。低阶的 \(4k,\,3\) 等项在 \(k\) 大时全被 \(k\log k\) 吞掉。 返回 全书目录
第 2 段:Vinogradov 定理与它的历史地位
第 3 段:为什么旧的主弧不够用,需要新工具
引理 9.1(van der Corput):把求和精确换成积分
主弧 \(\mathfrak{M}_{a,q}\) 的定义与生成函数 \(T(\alpha)\)
引理 9.2:主弧上 \(T(\alpha)\) 的精确逼近
引理 9.3:主弧积分的下界(带 \(M\) 的范围)
所以 (9.2) 主项的模 \(\ll q^{-1/k}\min(P,|\beta|^{-1/k})\)。
所以可写
\[ T(\alpha)^s=(q^{-1}S_{a,q}I(\beta))^s+O\Big\{q\cdot q^{-(s-1)/k}\big(\min(P,|\beta|^{-1/k})\big)^{s-1}\Big\}. \]
为什么是这个误差:设主项 \(\sim M_0\),误差 \(\sim q\le|M_0|\),则 \((M_0+E)^s=M_0^s+O(E\,M_0^{s-1})\),代入 \(E=q,\ M_0^{s-1}\sim(q^{-1/k}\min)^{s-1}=q^{-(s-1)/k}\min^{s-1}\)。
证明的主要思想:表示 (9.5)
引理 9.4(Hardy–Littlewood):打包数能凑出多少个
引理 9.4 的推论:把计数翻译成积分估计 \(R(\alpha)\)
引理 9.5(Vinogradov):双线性和的威力
引理 9.5 的推论:估计 \(S(\alpha)\)
引理 9.6:次弧贡献是低阶的
定理 9.1:Vinogradov 的上界