Weyl 不等式与华罗庚不等式Weyl's inequality and Hua's inequality
本页是对本章译文的逐段高中详解:先按原文顺序复述每一段在讲什么,再把其中所有“显然”“容易看出”的跳步补成一步一句的完整推导,每个超出高中范围的符号都从零讲起。黑字是原文的意思,彩色框(目标 / 符号 / 分步推演 / 图)是为高中生补充的讲解。
这一章是整本《圆法》的技术心脏。圆法要研究“一个数能否写成若干个 \(k\) 次方之和”(华林问题),核心是去估计一种叫做指数和的东西 \[T(\alpha)=\sum_{x=1}^{P}e(\alpha x^{k})\quad\big(e(\theta):=e^{2\pi i\theta}\big).\] 这一章给出两件最重要的“武器”:
- Weyl 不等式(引理 3.1):当 \(\alpha\) 不太接近“分母很小的分数”时,上面这种和会比它的平凡上界 \(P\) 小很多。这把“和很大”的坏情形局限在很窄的范围里。
- 华罗庚不等式(引理 3.2):\(|T(\alpha)|\) 的高次方在 \([0,1]\) 上的平均(积分)很小。这是后面建立渐近公式时控制“次弧”的关键。
读完你应当能:理解 \(e(\alpha)\)、积分 \(\int_0^1\)、求和号、\(\ll\)/\(O\)、\(\|\lambda\|\)、除数函数等记号;并能独立复述这两个不等式的每一步证明——为什么对和取平方、为什么用差分降次、为什么用 Cauchy 不等式、为什么把项按公因子合并、为什么积分恰好是“方程解的个数”。
第 0 节 先把工具备齐:高中生需要的全部预备知识
原文默认读者已经熟悉下面这些记号,直接拿来用。但高中课本里没有它们,所以我们先单独花一节把它们讲透。看不懂证明时,多半是卡在这一节的某个符号上,回来查即可。
定义 \(e(\theta):=e^{2\pi i\theta}\),读作“e 括号 theta”。这里 \(i\) 是虚数单位(\(i^2=-1\)),\(e\) 是自然常数。由欧拉公式 \[e^{i\varphi}=\cos\varphi+i\sin\varphi\] 可得 \[e(\theta)=e^{2\pi i\theta}=\cos(2\pi\theta)+i\sin(2\pi\theta).\] 它是复平面单位圆上的一个点,对应的角度是 \(2\pi\theta\)(即把整整一圈 \(2\pi\) 分成 \(\theta\) 份)。两个关键性质:
- 模长恒为 1:\(|e(\theta)|=\sqrt{\cos^2+\sin^2}=1\)。它永远在单位圆上跑,绝不会变长或变短。
- 把加法变成乘法:\(e(\theta_1)\,e(\theta_2)=e(\theta_1+\theta_2)\),因为指数相加。于是 \(e(-\theta)=1/e(\theta)=\overline{e(\theta)}\)(共轭)。
- 以 1 为周期:\(e(\theta+1)=e(\theta)\),因为转一整圈(\(2\pi\))回到原地。所以 \(e(\theta)\) 只关心 \(\theta\) 的小数部分。
\(\displaystyle\sum_{x=1}^{P}g(x)=g(1)+g(2)+\cdots+g(P)\),把方括号内变量从下界取到上界逐项相加。本章里被加的常是复数 \(e(\cdots)\),所以和也是复数。复数 \(z=a+bi\) 的模长 \(|z|=\sqrt{a^2+b^2}\),表示它到原点的距离;\(|z|^2=z\bar z\)(自己乘以自己的共轭)。我们要估计的就是这种复数和的模长 \(\big|\sum e(\cdots)\big|\)。
\(\Re z\) 表示复数 \(z=a+bi\) 的实部 \(a\)。一个有用事实:对任意复数 \(z\),\(z+\bar z=2\Re z\)。本章把“一对 \((x_1,x_2)\) 和它交换后的 \((x_2,x_1)\)”合并时会用到它——这两项互为共轭,加起来正好是 \(2\Re\)。
\(\int_0^1 g(\alpha)\,d\alpha\) 是函数 \(g\) 在区间 \([0,1]\) 上的定积分,几何上是曲线下的“带符号面积”。本章只需要一个具体结果,叫正交关系:对整数 \(n\), \[\int_0^1 e(n\alpha)\,d\alpha=\int_0^1 e^{2\pi i n\alpha}\,d\alpha=\begin{cases}1,& n=0,\\[2pt]0,& n\neq 0.\end{cases}\] 为什么?当 \(n=0\) 时被积函数恒等于 \(e^0=1\),积分就是区间长度 1。当 \(n\neq0\) 时, \[\int_0^1 e^{2\pi i n\alpha}\,d\alpha=\left[\frac{e^{2\pi i n\alpha}}{2\pi i n}\right]_0^1=\frac{e^{2\pi i n}-e^{0}}{2\pi i n}=\frac{1-1}{2\pi i n}=0,\] 因为 \(e^{2\pi i n}=1\)(\(n\) 是整数,转了整数圈)。这条性质极其重要:它把“积分”变成了“数方程的解”——见引理 3.2。
\(A\ll B\)(读作“\(A\) 远小于等于 \(B\)”,与 \(A=O(B)\) 同义)意思是:存在一个常数 \(C>0\),使得 \(|A|\le C\,B\) 恒成立。这个常数 \(C\) 与我们关心的“大变量”(这里是 \(P\))无关,但允许依赖固定的参数(这里是次数 \(k\) 和 \(\varepsilon\))。例如 \(3n+5\ll n\),因为 \(3n+5\le 8n\)(取 \(C=8\),对 \(n\ge1\))。它让我们只盯量级、忽略不重要的常数,这正是解析数论的工作方式。脚注里说明:本章 \(\ll\) 隐含的常数只依赖 \(k\) 与 \(\varepsilon\)。
\(\varepsilon>0\) 表示一个可以取得任意小的固定正数。“对任意 \(\varepsilon>0\) 成立 \(A\ll P^{\varepsilon}\)”意思是:无论你把 \(\varepsilon\) 取多小(比如 \(0.001\)),都有一个对应的常数把 \(A\) 压在 \(P^{\varepsilon}\) 之下。直观上 \(P^{\varepsilon}\) 增长得比任何 \(P\) 的正数次幂都慢(比 \(\log P\) 还略大一点),是数论里“几乎可以忽略”的因子。注意:常数随 \(\varepsilon\) 变小而变大,但只要 \(\varepsilon\) 固定就没问题。
\((a,q)\) 是 \(a\) 与 \(q\) 的最大公约数,\((a,q)=1\) 表示二者互素(没有公共素因子)。\(am\equiv r\pmod q\) 表示 \(am\) 与 \(r\) 除以 \(q\) 余数相同,即 \(q\mid(am-r)\)。一个事实(本章要用):若 \((a,q)=1\),当 \(m\) 取遍 \(0,1,\dots,q-1\) 时,\(am\) 除以 \(q\) 的余数也恰好取遍 \(0,1,\dots,q-1\) 各一次——这叫“\(am\) 跑遍模 \(q\) 的完全剩余系”。原因:若 \(am_1\equiv am_2\),则 \(q\mid a(m_1-m_2)\),因 \((a,q)=1\) 得 \(q\mid(m_1-m_2)\),在 \(0\le m
\(\|\lambda\|\) 表示实数 \(\lambda\) 到离它最近的整数的距离,例如 \(\|3.2\|=0.2,\ \|3.8\|=0.2,\ \|5\|=0\)。它总满足 \(0\le\|\lambda\|\le\tfrac12\)。为什么本章离不开它?因为 \(e(\lambda x)\) 只看 \(\lambda\) 的小数部分,当 \(\lambda\) 接近整数(\(\|\lambda\|\) 小)时 \(e(\lambda)\approx1\),求和不会互相抵消、和会很大;\(\|\lambda\|\) 正好度量“离危险有多近”。
\(d(m)=\sum_{d\mid m}1\) 是 \(m\) 的正因子个数(“\(d\mid m\)”读作“\(d\) 整除 \(m\)”)。例如 \(d(6)=4\)(因子 \(1,2,3,6\)),\(d(12)=6\)。本章会证明它增长极慢:\(d(m)\ll m^{\varepsilon}\)。
\(\Delta_y f(x):=f(x+y)-f(x)\),叫“以步长 \(y\) 的一阶(前向)差分”。它是导数的离散版本。多次差分写成 \(\Delta_{y_1,\dots,y_\nu}f=\Delta_{y_\nu}\big(\cdots\Delta_{y_1}f\big)\),即依次以步长 \(y_1,\dots,y_\nu\) 做差分。核心性质:差分使多项式降低一次。下面证明里会反复用。
第 1 节 引言:Weyl 不等式的来历
这一段在讲什么:交代 Weyl 不等式是谁、什么时候、为什么提出的——它是研究华林问题乃至整个解析数论“最重要的单件工具”。
研究华林问题(Waring's problem),乃至研究数论解析理论中的许多其他问题时,最重要的单一工具就是 Weyl 不等式。这一不等式由 Weyl 在其 1916 年关于数列模 1 均匀分布的伟大论文中以一种不太显式的形式给出。针对多项式、并以其最高次系数表述的显式形式,则由 Hardy 与 Littlewood 给出。
华林问题(1770):英国数学家 Waring 猜想——对每个固定的 \(k\ge2\),存在一个数 \(s\),使得每个正整数都能写成至多 \(s\) 个 \(k\) 次方数之和(\(k=2\) 是四平方和定理,\(k=3\) 是若干立方数之和……)。这要数“某数有多少种写法”,自然导出指数和 \(T(\alpha)=\sum e(\alpha x^k)\)。
Hermann Weyl(1885–1955)是 20 世纪最伟大的数学家之一。他 1916 年的论文研究“数列 \(\{\alpha n^k\}\) 的小数部分是否在 \([0,1]\) 上均匀分布”。要判断均匀分布,按 Weyl 判别法就得估计 \(\sum e(\alpha x^k)\) 的大小——若这个和相对 \(P\) 很小,就说明转动充分“打散”、分布均匀。为此他发明了“反复平方降次”的技巧,这就是 Weyl 不等式的雏形。
Hardy 与 Littlewood 在他们 1920 年代关于华林问题的系列论文(书中简称 P.N. I,即 “Partitio Numerorum I”)中,把 Weyl 的思想整理成针对一般 \(k\) 次多项式、并用“最高次系数 \(\alpha\) 的有理逼近”来表述的显式不等式——也就是下面引理 3.1 的形式。为什么“显式”重要?因为圆法要把 \([0,1]\) 切成“主弧”(\(\alpha\) 接近小分母分数)和“次弧”(其余),在次弧上必须有一个能具体算出量级的上界,Weyl 不等式正好提供它。
第 2 节 引理 3.1:Weyl 不等式的陈述
这一段在讲什么:正式写出 Weyl 不等式。它说:只要 \(\alpha\) 有一个“好的有理逼近” \(a/q\),那么指数和 \(\sum e(f(x))\) 就有一个明确的上界。
- \(f(x)\)
- 一个 \(k\) 次实系数多项式。注意——只有最高次系数 \(\alpha\) 进入最终的上界,低次系数 \(\alpha_1,\dots,\alpha_k\) 完全不影响结果。后面会看到原因:证明用差分反复降次,最后只剩下与 \(\alpha\) 有关的线性项,其余系数都被“差掉了”。
- \(P\)
- 求和的项数(自变量 \(x\) 从 1 取到 \(P\))。它是“大变量”,我们关心 \(P\to\infty\) 时和的量级。平凡上界是 \(P\):因为每项模长为 1,\(P\) 项相加模长至多 \(P\)(三角不等式 \(|\sum|\le\sum|{\cdot}|=P\))。引理的价值在于给出比 \(P\) 更小的上界。
- \(a/q\)
- \(\alpha\) 的有理逼近,\(q>0\) 是分母,\((a,q)=1\) 保证它是“最简分数”,\(|\alpha-a/q|\le 1/q^2\) 保证逼近“足够好”。为什么这种逼近一定存在?这是 Dirichlet 逼近定理:对任意实数 \(\alpha\) 与任意 \(Q\ge1\),总能找到 \(1\le q\le Q\) 与整数 \(a\),使 \(|\alpha-a/q|\le 1/(qQ)\le 1/q^2\)。所以这个假设对每个 \(\alpha\) 都能满足,引理是普遍适用的。
- \(K=2^{k-1}\)
- “\(K\)”是后面反复平方所产生的指数。每平方一次幂指数翻倍,做 \(k-1\) 次后变成 \(2^{k-1}\)。所以 \(k=2\) 时 \(K=2\),\(k=3\) 时 \(K=4\),\(k=4\) 时 \(K=8\)……它随 \(k\) 指数级增大,这也是后来 Vinogradov 改进的动机(见后注)。
第 3 节 引理后的注:这个上界好在哪、什么时候有用
这一段在讲什么:解读 Weyl 不等式“有用”的范围——\(q\) 不能太小也不能太大,并解释为什么 \(q\) 太小时它必然失效(这是事物本身的性质,不是证明的缺陷)。
- 括号里三项谁说了算。上界括号里是 \(P^{-1/K}+q^{-1/K}+(P^k/q)^{-1/K}\)。括号外有个 \(P^{1+\varepsilon}\)。三项之和由最大的那一项决定量级。第一项 \(P^{-1/K}\) 是固定的“底线改进”;第二项随 \(q\) 增大而减小;第三项 \((P^k/q)^{-1/K}=q^{1/K}/P^{k/K}\) 随 \(q\) 增大而增大。所以 \(q\) 太小时第三项也许还行但第二项 \(q^{-1/K}\) 很大(接近 1),\(q\) 太大时第三项很大。两头都坏,中间才好。
- 为什么取 \(P^{\delta}\le q\le P^{k-\delta}\)。要让上界真正小于 \(P\),需要括号 \(\ll P^{-\eta}\)(某个 \(\eta>0\))。第二项 \(q^{-1/K}\le P^{-\delta/K}\) 要求 \(q\ge P^{\delta}\);第三项 \((P^k/q)^{-1/K}\le P^{-\delta/K}\) 要求 \(P^k/q\ge P^{\delta}\) 即 \(q\le P^{k-\delta}\)。两条合起来就是注里的范围。这就是“为什么这样取参数”的理由:恰好让两端的坏项都被压下去。
- “最常用”的 \(P\le q\le P^{k-1}\)。此时 \(q^{-1/K}\le P^{-1/K}\) 且 \((P^k/q)^{-1/K}\le P^{-1/K}\),括号三项都 \(\le P^{-1/K}\),于是整体 \(\ll P^{1+\varepsilon}\cdot P^{-1/K}=P^{1-1/K+\varepsilon}\)。这就是那个著名的省力上界:比平凡的 \(P\) 小了一个因子 \(P^{1/K}\)(再差一点点 \(P^{\varepsilon}\))。圆法在次弧上用的正是这个版本。
- 为什么 \(q\) 很小时必然没用——而且这是“正常”的。取最简单的 \(f(x)=\alpha x^k\) 且 \(\alpha\) 极接近一个小分母分数 \(a/q\)(\(q\) 很小)。那么 \(\alpha x^k\approx (a/q)x^k\),而 \(e\big((a/q)x^k\big)\) 关于 \(x\) 是周期为 \(q\) 的,许多项指向同一个方向、互相叠加而非抵消,整个和的模长真的会接近 \(P\)。既然和本身就大,任何上界都不可能小于它——所以不是 Weyl 不等式“弱”,而是事实如此。这正是圆法把这种 \(\alpha\)(小分母附近)单独划成“主弧”去精细处理的原因。
第 4 节 引理 3.1 的证明(上):平方降次的基本操作
这一段在讲什么:说明整个证明的核心套路——把指数和的模长取平方,就能把一个 \(k\) 次多项式的和,换成许多 \((k-1)\) 次多项式的和的平均。这是 Weyl 的发明,叫“Weyl 平方法”或“Weyl differencing”。
证明中的基本操作是对一个指数和的绝对值取平方,从而把该和与一些次数更低的多项式的同类和的平均值联系起来。令 \[S_{k}(f)=\sum_{x=P_{1}+1}^{P_{2}}e(f(x)),\] 其中 \(0\le P_{2}-P_{1}\le P\),下标 \(k\) 用于标记 \(f(x)\) 的次数。
原来的和是 \(x\) 从 1 到 \(P\)。但证明里反复降次后,会出现“\(x\) 取遍某个长度 \(\le P\) 的区间”的和。为了让归纳能进行,作者把和写成更一般的 \(\sum_{x=P_1+1}^{P_2}\),区间长度 \(P_2-P_1\) 介于 0 和 \(P\) 之间。下标 \(k\) 提醒我们里面的多项式 \(f\) 是 \(k\) 次的。动机:降一次次数,下标就从 \(k\) 变 \(k-1\),区间也会变(依赖于差分步长 \(y\)),用统一记号才好递推。
则 \[\begin{aligned}|S_{k}(f)|^{2}&=\sum_{x_{1}}\sum_{x_{2}}e(f(x_{2})-f(x_{1}))\\&=P_{2}-P_{1}+2\Re\!\!\sum_{\substack{x_{1},x_{2}\\ x_{2}>x_{1}}}\!\! e(f(x_{2})-f(x_{1})).\end{aligned}\]
- 对复数 \(z\),\(|z|^2=z\bar z\)。这里 \(z=S_k(f)=\sum_{x_2}e(f(x_2))\),它的共轭 \(\bar z=\sum_{x_1}\overline{e(f(x_1))}=\sum_{x_1}e(-f(x_1))\)(因为 \(\overline{e(\theta)}=e(-\theta)\),用了 \(\overline{e^{i\varphi}}=e^{-i\varphi}\))。
- 两个和相乘,按分配律把每个 \(x_2\) 项乘每个 \(x_1\) 项: \[|S_k|^2=\Big(\sum_{x_2}e(f(x_2))\Big)\Big(\sum_{x_1}e(-f(x_1))\Big)=\sum_{x_1}\sum_{x_2}e(f(x_2)-f(x_1)),\] 这里又用了 \(e(A)e(-B)=e(A-B)\)。两个变量都跑遍同一个区间 \((P_1,P_2]\)。
- 分出对角项与非对角项。当 \(x_1=x_2\) 时,指数 \(f(x_2)-f(x_1)=0\),\(e(0)=1\)。这样的对角项有“区间内整数个数”那么多,即 \(P_2-P_1\) 个,贡献 \(\sum 1=P_2-P_1\)。
- 剩下 \(x_1\neq x_2\) 的项可两两配对:项 \((x_1,x_2)\) 与项 \((x_2,x_1)\) 的指数互为相反数,于是这两项 \(e(\theta)+e(-\theta)=2\Re\,e(\theta)\)(用了 \(z+\bar z=2\Re z\))。把每对只数一次(约定 \(x_2>x_1\)),就得到 \(2\Re\sum_{x_2>x_1}e(f(x_2)-f(x_1))\)。
- 合并即得所示等式。关键收获:平方后,被研究的对象从 \(f(x)\) 变成了差 \(f(x_2)-f(x_1)\)。下一步会看到这个差的次数比 \(f\) 低一次。
令 \(x_{2}=x_{1}+y\)。则 \(1\le y\lt P_{2}-P_{1}\),且 \[f(x_{2})-f(x_{1})=f(x_{1}+y)-f(x_{1})=\Delta_{y}f(x_{1}),\] 此处采用了显然的记号。于是 \[|S_{k}(f)|^{2}=P_{2}-P_{1}+2\Re\sum_{y=1}^{P}\sum_{x}e\left(\Delta_{y}f(x)\right),\] 其中对 \(x\) 的求和取遍一个依赖于 \(y\) 但包含于 \(P_{1}\lt x\le P_{2}\) 之中的区间。对某些 \(y\) 的取值而言,该区间可能为空。
- 换元的动机:非对角和里出现 \(f(x_2)-f(x_1)\),我们想固定“间距” \(y=x_2-x_1\) 来求和。因为 \(x_2>x_1\) 且都在 \((P_1,P_2]\) 内,所以 \(y\) 至少是 1,至多是区间长度减 1,即 \(1\le y< P_2-P_1\le P\)。把外层换成对 \(y\) 求和,内层对 \(x:=x_1\) 求和。
- 记 \(\Delta_y f(x)=f(x+y)-f(x)\)(前面定义过的差分算子)。则 \(f(x_2)-f(x_1)=\Delta_y f(x_1)\)。
- 为什么 \(\Delta_y f\) 比 \(f\) 低一次(这是全章发动机)。设 \(f(x)=\alpha x^k+(\text{低次})\)。看最高次项: \[(x+y)^k-x^k=\Big(x^k+ky\,x^{k-1}+\cdots\Big)-x^k=k\,y\,x^{k-1}+(\text{更低次}),\] 其中用了二项式定理 \((x+y)^k=\sum_{j}\binom{k}{j}x^{k-j}y^{j}\),\(j=0\) 的 \(x^k\) 被减掉,剩下最高是 \(j=1\) 的 \(ky\,x^{k-1}\)。于是 \(\Delta_y f(x)=k\alpha y\,x^{k-1}+\cdots\),确是 \(k-1\) 次,最高次系数变成 \(k\alpha y\)。
- 对 \(x\) 求和的范围:要求 \(x=x_1\) 和 \(x_2=x_1+y\) 都落在 \((P_1,P_2]\) 内,即 \(P_1
特别地, \[|S_{k}(f)|^{2}\le P+2\sum_{y=1}^{P}|S_{k-1}(\Delta_{y}f)|,\] 其中 \(S_{k-1}\) 所对应的区间正是刚才描述的那种。
- 对角贡献 \(P_2-P_1\le P\),放大成 \(P\)。
- 对 \(2\Re\sum_y\sum_x e(\Delta_y f(x))\):先用 \(\Re w\le|w|\),再用三角不等式 \(\big|\sum_y(\cdots)\big|\le\sum_y\big|\sum_x e(\Delta_y f(x))\big|\)。注意内层 \(\sum_x e(\Delta_y f(x))\) 正是一个 \((k-1)\) 次多项式 \(\Delta_y f\) 的指数和,记作 \(S_{k-1}(\Delta_y f)\)。
- 于是 \(|S_k(f)|^2\le P+2\sum_{y=1}^{P}|S_{k-1}(\Delta_y f)|\)。意义:一个 \(k\) 次和的平方,被一堆 \((k-1)\) 次和的模长之和控制住了。降次成功一次。
重复上述论证,我们得到 \[|S_{k-1}(\Delta_{y}f)|^{2}\le P+2\sum_{z=1}^{P}|S_{k-2}(\Delta_{y,z}f)|,\] 其中 \(S_{k-2}\) 的求和区间同时依赖于 \(y\) 与 \(z\)。利用 Cauchy 不等式,便可把第二个不等式中的 \(S_{k-1}\) 代入第一个不等式: \[\begin{aligned}|S_{k}(f)|^{4}&\ll P^{2}+P\sum_{y=1}^{P}|S_{k-1}(\Delta_{y}f)|^{2}\\&\ll P^{3}+P\sum_{y=1}^{P}\sum_{z=1}^{P}|S_{k-2}(\Delta_{y,z}f)|.\end{aligned}\]
柯西不等式(高中可理解的求和形式):对任意实数 \(a_1,\dots,a_n\), \[\Big(\sum_{i=1}^{n}a_i\Big)^2\le n\sum_{i=1}^{n}a_i^2.\] (这是 \(\big(\sum a_i\cdot1\big)^2\le(\sum a_i^2)(\sum 1^2)\) 的特例。)直观:把“和的平方”换成“项数乘以平方和”,代价是多一个因子 \(n\)。为什么这里要用它?因为我们手上是 \(\sum_y|S_{k-1}|\)(一次方之和),而降次公式给的是 \(|S_{k-1}|^2\)(平方)的上界。柯西不等式正好把“一次方之和”转成“平方之和”,于是能代入。
- 对第一层 \(|S_k|^2\le P+2\sum_{y=1}^{P}|S_{k-1}(\Delta_y f)|\) 两边平方。用 \((A+B)^2\le 2A^2+2B^2\)(这是 \((A-B)^2\ge0\) 的推论): \[|S_k|^4\le 2P^2+8\Big(\sum_{y=1}^{P}|S_{k-1}|\Big)^2.\]
- 对括号里的和用柯西不等式(\(n=P\) 项):\(\big(\sum_{y=1}^{P}|S_{k-1}|\big)^2\le P\sum_{y=1}^{P}|S_{k-1}|^2\)。于是 \[|S_k|^4\le 2P^2+8P\sum_{y=1}^{P}|S_{k-1}(\Delta_y f)|^2\ll P^2+P\sum_{y=1}^{P}|S_{k-1}|^2.\] (常数 2、8 都吸进 \(\ll\)。)这正是第一行。
- 把第二层 \(|S_{k-1}(\Delta_y f)|^2\le P+2\sum_{z=1}^{P}|S_{k-2}(\Delta_{y,z}f)|\) 代入: \[P\sum_{y}|S_{k-1}|^2\le P\sum_{y}\Big(P+2\sum_z|S_{k-2}|\Big)=P\cdot P\cdot P+2P\sum_{y}\sum_{z}|S_{k-2}|.\] 第一块 \(P\cdot P\cdot P=P^3\)(外层 \(\sum_y\) 有 \(P\) 项,每项里那个 \(P\),再乘前面的 \(P\))。
- 合起来 \(|S_k|^4\ll P^3+P\sum_{y=1}^{P}\sum_{z=1}^{P}|S_{k-2}(\Delta_{y,z}f)|\)。降次成功第二次,代价是和的层数多了一层、外面的 \(P\) 幂也升高了。
此过程可以继续进行,由此建立的一般不等式为 \[|S_{k}(f)|^{2^{\nu}}\ll P^{2^{\nu}-1}+P^{2^{\nu}-\nu-1}\sum_{y_{1}=1}^{P}\cdots\sum_{y_{\nu}=1}^{P}|S_{k-\nu}(\Delta_{y_{1},\ldots,y_{\nu}}f)|.\tag{3.1}\] 这只需对 \(\nu\) 作归纳即可证明。须知 (3.1) 中对 \(x\) 的求和范围是一个依赖于 \(y_{1},\ldots,y_{\nu}\) 的区间,但包含于 \(P_{1}\lt x\le P_{2}\)。
- 基础 \(\nu=1\):就是上面证过的 \(|S_k|^2\le P+2\sum_y|S_{k-1}|\),对照 (3.1):\(2^1-1=1\)(前一项 \(P^1\)),\(2^1-1-1=0\)(后一项前缀 \(P^0=1\)),完全吻合。
- 归纳假设:设 (3.1) 对 \(\nu\) 成立。两边平方并用 \((A+B)^2\le2A^2+2B^2\): \[|S_k|^{2^{\nu+1}}\ll P^{2^{\nu+1}-2}+P^{2^{\nu+1}-2\nu-2}\Big(\sum_{y_1,\dots,y_\nu}|S_{k-\nu}|\Big)^2.\]
- 对那个多重和用柯西不等式,项数是 \(P^{\nu}\)(共 \(\nu\) 个变量各跑 \(P\)): \[\Big(\sum_{y_1,\dots,y_\nu}|S_{k-\nu}|\Big)^2\le P^{\nu}\sum_{y_1,\dots,y_\nu}|S_{k-\nu}|^2.\]
- 对每个 \(|S_{k-\nu}(\Delta_{y_1,\dots,y_\nu}f)|^2\) 再用一次“平方降次”基本操作(引入新变量 \(y_{\nu+1}\)):\(|S_{k-\nu}|^2\le P+2\sum_{y_{\nu+1}}|S_{k-\nu-1}|\)。
- 把这些都串起来,整理 \(P\) 的幂次:第一项变 \(P^{2^{\nu+1}-1}\),第二项前缀变 \(P^{2^{\nu+1}-(\nu+1)-1}\),多重和变成对 \(y_1,\dots,y_{\nu+1}\) 的 \(\nu+1\) 重和,被加的是 \(|S_{k-\nu-1}|\)。这正是把 (3.1) 里的 \(\nu\) 换成 \(\nu+1\)。归纳完成。
- 幂次记忆法:每平方一次,左边指数翻倍(\(2^\nu\to2^{\nu+1}\));第一项 \(P^{2^\nu-1}\) 是“全程用平凡上界”留下的;第二项前缀 \(P^{2^\nu-\nu-1}\) 里的 \(-\nu\) 来自 \(\nu\) 次柯西不等式各贡献的一个 \(P\)(被分摊)。
在此我们插入一点说明,它在引理 3.2 的证明中会有用。这就是:若在导出 (3.1) 的最后一步中,我们把基本操作以其原始形式应用,则得到 \[|S_{k}(f)|^{2^{\nu}}\ll P^{2^{\nu}-1}+P^{2^{\nu}-\nu-1}\sum_{y_{1}=1}^{P}\cdots\sum_{y_{\nu}=1}^{P}\Re S_{k-\nu}(\Delta_{y_{1},\ldots,y_{\nu}}f).\tag{3.2}\] 此处同样,\(S_{k-\nu}\) 中 \(x\) 的取值范围依赖于 \(y_{1},\ldots,y_{\nu}\),并且有时可能为空。
- 回忆最初的等式 \(|S_k|^2=(P_2-P_1)+2\Re\sum_y\sum_x e(\Delta_y f(x))\) 是带 \(\Re\) 的等式。在推 (3.1) 时,最后一步我们用 \(\Re(\cdot)\le|\cdot|\) 放成了绝对值。
- 但如果最后一步不放绝对值,保留 \(\Re\) 与“求和后再取实部”的原始形式,就得到 (3.2):被加的是 \(\Re S_{k-\nu}\) 而不是 \(|S_{k-\nu}|\)。
- 为什么要专门留这个版本?因为引理 3.2 要把 \(S_{k-\nu}\)(不取绝对值的、带正负号的复数)整体拿去乘 \(|T|^{2^\nu}\) 再积分——积分会用到正交关系,把它变成“某方程解的个数”。若提前取了绝对值就破坏了这个结构。这是一个“为后文埋的伏笔”,体现了好的证明会保留尽量多的信息。
第 5 节 引理 3.1 的证明(中):降到一次、化为几何级数
这一段在讲什么:取 \(\nu=k-1\),把多项式一路差分到一次(线性)。一次多项式的指数和是等比数列求和,能精确算出,于是出现了 \(\|\lambda\|\)。
回到 (3.1),我们取 \(\nu=k-1\),并在原始的 \(S_{k}\) 中取 \(P_{1}=0,\ P_{2}=P\)。我们注意到 \[\Delta_{y_{1},\ldots,y_{k-1}}f(x)=k!\,\alpha y_{1}\cdots y_{k-1}x+\beta,\] 不妨这样记,其中 \(\beta\) 是一些与 \(x\) 无关的项的集合。
- 取 \(\nu=k-1\),从 \(k\) 次降 \(k-1\) 次到 1 次。每差分一次,次数减 1、最高次系数乘上(当前次数)×(步长),前面在 \((x+y)^k-x^k=ky\,x^{k-1}+\cdots\) 已看到这个规律。
- 逐次追踪最高次系数:起点 \(\alpha\)(\(k\) 次)。第一次差分(步长 \(y_1\)):系数 \(\to k\,\alpha\,y_1\)(\(k-1\) 次)。第二次(步长 \(y_2\)):\(\to (k-1)\cdot k\,\alpha\,y_1\,y_2\)(\(k-2\) 次)。……第 \(k-1\) 次:系数 \(\to k(k-1)(k-2)\cdots 2\cdot\alpha\,y_1\cdots y_{k-1}\)(1 次)。
- 而 \(k(k-1)\cdots2=k!/1!=k!\)(这是从 \(k\) 一直乘到 2,正好是 \(k\) 的阶乘)。所以一次项系数恰为 \(k!\,\alpha\,y_1\cdots y_{k-1}\)。
- 常数项 \(\beta\) 是什么?差分得到的一次多项式 \(=(\text{一次系数})x+(\text{常数})\)。那个常数依赖于所有 \(y_i\) 和 \(f\) 的低次系数 \(\alpha_1,\dots,\alpha_k\),但不依赖 \(x\)。我们把它统称 \(\beta\)。下一步会看到,\(e(\beta)\) 是一个模长为 1 的常数,提到求和号外面不影响 \(\big|\sum\big|\)——这就是为什么低次系数最终全部消失、只有最高次系数 \(\alpha\) 进入答案。
于是 \[\left|S_{1}(\Delta_{y_{1},\ldots,y_{k-1}}f)\right|=\left|\sum_{x}e(k!\,\alpha y_{1}\cdots y_{k-1}x)\right|.\] 右边的和取遍任一长度至多为 \(P\) 的 \(x\) 区间,形如 \[\left|\sum_{x=x_{1}}^{x_{2}-1}e(\lambda x)\right|\le\frac{2}{|1-e(\lambda)|}=\frac{1}{|\sin\pi\lambda|}\ll\frac{1}{\|\lambda\|},\] 其中 \(\|\lambda\|\) 表示 \(\lambda\) 到最近整数的距离。当 \(\lambda\) 是整数时这一估计失效,但我们可以用显然的上界 \(P\) 来补充。
- 把 \(e(\beta)\) 提到外面:\(\big|\sum_x e(\lambda x+\beta)\big|=|e(\beta)|\cdot\big|\sum_x e(\lambda x)\big|=\big|\sum_x e(\lambda x)\big|\),其中 \(\lambda=k!\,\alpha y_1\cdots y_{k-1}\)。这一步用 \(|e(\beta)|=1\),确认了 \(\beta\) 不影响大小。
- 等比求和。记 \(w=e(\lambda)\),则 \(\sum_{x=x_1}^{x_2-1}e(\lambda x)=\sum_x w^x\) 是公比 \(w\) 的等比数列。用求和公式 \(\sum_{x=x_1}^{x_2-1}w^x=\dfrac{w^{x_1}-w^{x_2}}{1-w}\)(\(w\neq1\))。取模长,分子 \(|w^{x_1}-w^{x_2}|\le|w^{x_1}|+|w^{x_2}|=2\)(三角不等式,\(|w|=1\)),所以 \[\Big|\sum_x e(\lambda x)\Big|\le\frac{2}{|1-w|}=\frac{2}{|1-e(\lambda)|}.\]
- 把 \(|1-e(\lambda)|\) 算成 \(\sin\)。用 \(1-e^{i\varphi}=1-\cos\varphi-i\sin\varphi\),其模长平方 \((1-\cos\varphi)^2+\sin^2\varphi=2-2\cos\varphi=4\sin^2\tfrac\varphi2\),故 \(|1-e^{i\varphi}|=2|\sin\tfrac\varphi2|\)。代 \(\varphi=2\pi\lambda\) 得 \(|1-e(\lambda)|=2|\sin\pi\lambda|\)。于是 \(\dfrac{2}{|1-e(\lambda)|}=\dfrac{1}{|\sin\pi\lambda|}\)。
- 用 \(\|\lambda\|\) 替换 \(\sin\)。\(\sin\pi\lambda\) 只看 \(\lambda\) 小数部分,且当 \(\lambda\) 离整数距离为 \(\|\lambda\|\le\tfrac12\) 时,\(|\sin\pi\lambda|=\sin(\pi\|\lambda\|)\)。利用初等不等式 \(\sin(\pi t)\ge 2t\)(对 \(0\le t\le\tfrac12\),因为正弦在这段是凹的、端点连线在曲线下方),得 \(|\sin\pi\lambda|\ge 2\|\lambda\|\)。所以 \[\frac{1}{|\sin\pi\lambda|}\le\frac{1}{2\|\lambda\|}\ll\frac{1}{\|\lambda\|}.\]
- 整数情形的补丁。若 \(\lambda\) 恰是整数,\(\|\lambda\|=0\)、上面分母为 0、估计失效;其实那时每项 \(e(\lambda x)=1\)、和等于项数,模长至多区间长 \(\le P\)。所以无论如何都有 \[\Big|\sum_x e(\lambda x)\Big|\le\min\!\Big(P,\ \frac{1}{\|\lambda\|}\Big)\quad(\text{约定 }\tfrac1{\|\lambda\|}=\infty\text{ 当 }\|\lambda\|=0).\] 取“\(P\) 与 \(1/\|\lambda\|\) 中较小者”,两种情形就统一了——这正是后面 \(\min(P,\cdots)\) 的来历。
于是 (3.1) 给出 \[|S_{k}(f)|^{K}\ll P^{K-1}+P^{K-k}\sum_{y_{1}=1}^{P}\cdots\sum_{y_{k-1}=1}^{P}\min\!\left(P,\ \|k!\,\alpha y_{1}\cdots y_{k-1}\|^{-1}\right).\]
- 在 (3.1) 里取 \(\nu=k-1\):左边指数 \(2^{\nu}=2^{k-1}=K\),第一项 \(P^{2^\nu-1}=P^{K-1}\),第二项前缀 \(P^{2^\nu-\nu-1}=P^{K-(k-1)-1}=P^{K-k}\)。完全对上。
- 多重和里被加项 \(|S_1(\Delta_{y_1,\dots,y_{k-1}}f)|\le\min(P,\|k!\alpha y_1\cdots y_{k-1}\|^{-1})\),由上一步。代入即得本式。这就把“高次指数和”彻底化简为“关于 \(\|k!\alpha\cdot(\text{乘积})\|\) 的算术和”。
第 6 节 引理 3.1 的证明(下):除数函数 + 分块求和
这一段在讲什么:多重和里出现的是乘积 \(y_1\cdots y_{k-1}\),很多不同的 \((y_1,\dots,y_{k-1})\) 给出同一个乘积值。把它们按乘积值 \(m\) 合并,需要“一个数有多少种因子分解”的估计——这就是除数函数 \(d(m)\ll m^\varepsilon\)。
现在我们诉诸初等数论中的一个结果,它使我们能把和中所有使 \(k!\,y_{1}\cdots y_{k-1}\) 取某个给定值(记为 \(m\))的项合并到一起。这样的项的个数是 \(\ll m^{\varepsilon}\)。为证明此点,只需证明 \[d(m)\ll m^{\varepsilon},\tag{3.3}\] 对任意整数 \(m\) 成立。事实上,对于每个 \(y_{1},\ldots,y_{k-1}\),至多有 \(d(m)\) 种可能。
- 固定乘积值 \(m=k!\,y_1\cdots y_{k-1}\),问:有多少组 \((y_1,\dots,y_{k-1})\) 给出它?等价于问 \(y_1\cdots y_{k-1}=m/k!\) 有多少有序解。
- 先看 \(y_1\):它必须是 \(m/k!\) 的一个因子,所以 \(y_1\) 的取法 \(\le d(m)\) 种。定下 \(y_1\) 后,\(y_2\) 是 \((m/k!)/y_1\) 的因子,取法又 \(\le d(m)\)……每个变量都至多 \(d(m)\) 种。所以总组数 \(\le d(m)^{k-1}\)。
- 因为 \(k-1\) 固定,\(d(m)^{k-1}\ll (m^\varepsilon)^{k-1}=m^{(k-1)\varepsilon}\),把 \((k-1)\varepsilon\) 重新记作 \(\varepsilon\)(\(\varepsilon\) 任意小,乘个常数还是任意小),得到“合并项数 \(\ll m^\varepsilon\)”。所以只需证核心事实 (3.3):\(d(m)\ll m^\varepsilon\)。
为建立 (3.3),设 \(m=p_{1}^{\lambda_{1}}p_{2}^{\lambda_{2}}\cdots\),并注意到 \[\frac{d(m)}{m^{\varepsilon}}=\prod_{i}\frac{\lambda_{i}+1}{p_{i}^{\varepsilon\lambda_{i}}}\le\prod_{p_{i}\le 2^{1/\varepsilon}}\frac{\lambda_{i}+1}{2^{\varepsilon\lambda_{i}}}\le C(\varepsilon),\] 因为 \(2^{-\varepsilon\lambda}(\lambda+1)\) 对 \(\lambda>0\) 是有上界的。
- 除数函数的乘积公式。设 \(m\) 的素因子分解 \(m=p_1^{\lambda_1}p_2^{\lambda_2}\cdots\)。\(m\) 的每个因子形如 \(p_1^{a_1}p_2^{a_2}\cdots\),其中 \(0\le a_i\le\lambda_i\),每个 \(a_i\) 有 \(\lambda_i+1\) 种选择,互相独立,所以 \(d(m)=\prod_i(\lambda_i+1)\)。同时 \(m^\varepsilon=\prod_i p_i^{\varepsilon\lambda_i}\)。相除得 \[\frac{d(m)}{m^\varepsilon}=\prod_i\frac{\lambda_i+1}{p_i^{\varepsilon\lambda_i}}.\]
- 把因子分两类。对“大素数” \(p_i>2^{1/\varepsilon}\)(即 \(p_i^\varepsilon>2\)),这一项 \(\dfrac{\lambda_i+1}{p_i^{\varepsilon\lambda_i}}\le\dfrac{\lambda_i+1}{2^{\lambda_i}}\le1\)(因为 \(2^{\lambda}\ge\lambda+1\) 对 \(\lambda\ge0\) 恒成立)。所以大素数的因子不会让乘积变大,可以丢掉(\(\le1\))。于是只剩“小素数” \(p_i\le2^{1/\varepsilon}\) 的因子。
- 每个小素数因子有上界。对小素数项 \(\dfrac{\lambda_i+1}{p_i^{\varepsilon\lambda_i}}\le\dfrac{\lambda_i+1}{2^{\varepsilon\lambda_i}}\)(因为 \(p_i\ge2\))。考虑函数 \(g(\lambda)=2^{-\varepsilon\lambda}(\lambda+1)\):当 \(\lambda\to\infty\) 指数衰减压过线性增长,所以 \(g\) 在 \(\lambda\ge0\) 上有最大值,记为 \(M(\varepsilon)\)。于是每个小素数项 \(\le M(\varepsilon)\)。
- 小素数个数有限。满足 \(p\le2^{1/\varepsilon}\) 的素数只有有限个(个数只依赖 \(\varepsilon\),记为 \(N(\varepsilon)\))。于是 \[\frac{d(m)}{m^\varepsilon}\le M(\varepsilon)^{N(\varepsilon)}=:C(\varepsilon),\] 一个只依赖 \(\varepsilon\)、与 \(m\) 无关的常数。即 \(d(m)\le C(\varepsilon)\,m^\varepsilon\),亦即 \(d(m)\ll m^\varepsilon\)。证毕。
- 为什么这个估计“几乎是平凡的却不可缺”:它精确表达了“因子分解的方式不会太多”,把组合爆炸控制在可忽略的 \(m^\varepsilon\) 内,让我们放心地把多重和压缩成单重和。
如上所述把各项合并,我们得到 \[|S_{k}(f)|^{K}\ll P^{K-1}+P^{K-k+\varepsilon}\sum_{m=1}^{k!P^{k-1}}\min(P,\ \|\alpha m\|^{-1}).\]
- 原来的 \((k-1)\) 重和 \(\sum_{y_1,\dots,y_{k-1}}\min(P,\|k!\alpha\,y_1\cdots y_{k-1}\|^{-1})\),被加项只通过乘积 \(m'=y_1\cdots y_{k-1}\)(等价地 \(m=k!\,m'\))起作用。
- 按 \(m\) 合并:每个 \(m\) 值对应的项数 \(\ll m^\varepsilon\le(k!P^{k-1})^\varepsilon\ll P^\varepsilon\)(因为 \(y_i\le P\),乘积 \(\le P^{k-1}\),\(m\le k!P^{k-1}\))。把这个 \(P^\varepsilon\) 提出来。
- \(m\) 的取值范围:\(m=k!\,y_1\cdots y_{k-1}\) 从最小 \(k!\) 到最大 \(k!P^{k-1}\),放宽下界写成 \(m=1\) 到 \(k!P^{k-1}\)(多加的项非负,不影响 \(\ll\))。注意被加项里 \(\|k!\alpha\,y\cdots\|=\|\alpha m\|\)(把 \(k!\) 吸进 \(m\))。于是多重和 \(\ll P^\varepsilon\sum_{m=1}^{k!P^{k-1}}\min(P,\|\alpha m\|^{-1})\)。
- 把这个并入 (3.1) 第二项的前缀,\(P^{K-k}\cdot P^\varepsilon=P^{K-k+\varepsilon}\),即得所示式。现在问题归结为估计单重和 \(\sum_{m}\min(P,\|\alpha m\|^{-1})\)。
剩下的是用题设中提到的对 \(\alpha\) 的有理逼近 \(a/q\) 来估计最后这个和。我们把对 \(m\) 的求和分成若干个由 \(q\) 个连续项构成的块,这样的块的个数是 \(\ll\frac{P^{k-1}}{q}+1\)。
- 动机:逼近条件是 \(|\alpha-a/q|\le1/q^2\)。当 \(m\) 在长为 \(q\) 的一段里变化时,\(\alpha m\) 与 \((a/q)m\) 的差不超过 \(q\cdot1/q^2=1/q\),是个可控的小扰动。而 \((a/q)m\) 在一段长 \(q\) 内会把分母 \(q\) 的各个余数跑一遍,结构清楚。所以以 \(q\) 为块长最自然。
- 总项数约 \(k!P^{k-1}\),每块 \(q\) 项,块数 \(\approx k!P^{k-1}/q\),可能多出一个不满 \(q\) 的零头块,故块数 \(\ll P^{k-1}/q+1\)(\(k!\) 是常数被吸收,“\(+1\)”管那个零头)。
考虑任一个块上的和,它形如 \[\sum_{m=0}^{q-1}\min(P,\ \|\alpha(m_{1}+m)\|^{-1}),\] 其中 \(m_{1}\) 是该块中的第一个数。我们有 \[\alpha(m_{1}+m)=\alpha m_{1}+\frac{am}{q}+O\!\left(\frac{1}{q}\right),\] 这是因为 \(|\alpha-a/q|\le q^{-2}\) 且 \(0\le m\lt q\)。
- 块内第 \(m\) 项的自变量是 \(m_1+m\)(\(m=0,\dots,q-1\))。把 \(\alpha\) 写成 \(\alpha=\dfrac aq+\theta\),其中 \(|\theta|\le1/q^2\)。则 \[\alpha(m_1+m)=\alpha m_1+\alpha m=\alpha m_1+\Big(\frac aq+\theta\Big)m=\alpha m_1+\frac{am}{q}+\theta m.\]
- 误差项 \(\theta m\):\(|\theta m|\le\dfrac1{q^2}\cdot(q-1)<\dfrac1q\),所以 \(\theta m=O(1/q)\)。这就是式中的 \(O(1/q)\)——一个绝对值不超过 \(1/q\) 的小量。
- 意义:在一整块里,\(\alpha m_1\) 是固定常数,真正变化的是 \(\dfrac{am}{q}\)(规整地跑余数)加一个小扰动 \(O(1/q)\)。
当 \(m\) 从 \(0\) 取到 \(q-1\) 时,\(am\) 遍历模 \(q\) 的完全剩余系。令 \(am\equiv r\pmod{q}\),则该和为 \[\sum_{r=0}^{q-1}\min\!\left(P,\ \frac{1}{\left\|(r+b)/q+O(1/q)\right\|}\right),\] 其中我们取 \(b\) 为最接近 \(q\alpha m_{1}\) 的整数。
- 因 \((a,q)=1\),前面预备知识里讲过:\(m\) 跑 \(0,\dots,q-1\) 时 \(am\bmod q\) 也跑遍 \(0,\dots,q-1\)。记 \(r=am\bmod q\),则求和指标可从 \(m\) 换成 \(r\)(双射,不重不漏)。
- 此时 \(\dfrac{am}{q}\equiv\dfrac rq\pmod 1\)(差一个整数,\(\|\cdot\|\) 与 \(e(\cdot)\) 都不在乎整数差)。再把固定的 \(\alpha m_1\) 也按整数拆开:取 \(b=\)“最接近 \(q\alpha m_1\) 的整数”,则 \(\alpha m_1\equiv \dfrac bq+(\text{小数})\),而那点小数已被并进 \(O(1/q)\)。综合得括号里距离参数是 \(\dfrac{r+b}{q}+O(1/q)\)。
- 于是块和 \(=\sum_{r=0}^{q-1}\min\big(P,\ \big\|\tfrac{r+b}{q}+O(1/q)\big\|^{-1}\big)\)。问题变成:当 \(r\) 跑遍余数时,\(\tfrac{r+b}{q}\) 这些点离整数多近。
在和中有 \(O(1)\) 个 \(r\) 值使得最小值中的第二个表达式无用,即那些使得 \(r+b\pmod{q}\) 的绝对最小剩余很小的 \(r\)。对这些 \(r\),我们必须取 \(P\)。对于其余的 \(r\) 值,若 \(s\) 表示 \(r+b\pmod{q}\) 的绝对最小剩余,则有 \[\left\|\frac{r+b}{q}+O\!\left(\frac{1}{q}\right)\right\|\gg\frac{s}{q}.\] 因此上述和为 \[\ll P+\sum_{s=1}^{q/2}\frac{q}{s}\ll P+q\log q.\]
把 \(r+b\) 除以 \(q\) 的余数,调整到 \(-q/2\) 与 \(q/2\) 之间(例如 \(q=10\) 时余数 7 记为 \(-3\)),它的绝对值 \(s=|{\cdot}|\) 就是“\(r+b\) 离最近的 \(q\) 的倍数有多远”。于是 \(\big\|\tfrac{r+b}{q}\big\|=\tfrac sq\)(在 \(0\le s\le q/2\) 时)。\(s\) 从 0(恰是倍数)到约 \(q/2\)。
- 坏的 \(r\)(少数)。当 \(s\) 很小(\(\tfrac sq\) 与误差 \(O(1/q)\) 同量级,即 \(s=O(1)\))时,\(\big\|\tfrac{r+b}{q}+O(1/q)\big\|\) 可能很小甚至为 0,倒数无意义,只能用平凡上界 \(P\)。这样的 \(r\) 只有 \(O(1)\) 个(\(s=0,\pm1,\dots\) 中有限几个),合计贡献 \(\ll P\)。
- 好的 \(r\)(多数)。当 \(s\) 不太小,主项 \(\tfrac sq\) 压过误差 \(O(1/q)\),故 \(\big\|\tfrac{r+b}{q}+O(1/q)\big\|\gg\tfrac sq\),于是该项 \(\min(P,\cdots)\le\big(\tfrac sq\big)^{-1}=\tfrac qs\)。
- 对好 \(r\) 求和。不同 \(r\) 对应不同 \(s\),\(s\) 从 1 到约 \(q/2\)(每个 \(s\) 最多对应正负两个 \(r\),常数无妨)。于是好 \(r\) 部分 \(\ll\sum_{s=1}^{q/2}\dfrac qs=q\sum_{s=1}^{q/2}\dfrac1s\)。
- 调和级数。\(\sum_{s=1}^{N}\tfrac1s\ll\log N\)(调和级数的标准估计:用 \(\int_1^N\tfrac{dt}t=\log N\) 比较)。这里 \(N\approx q/2\),所以 \(\sum_{s=1}^{q/2}\tfrac1s\ll\log q\),好 \(r\) 部分 \(\ll q\log q\)。
- 坏 \(r\) 与好 \(r\) 相加:每块的和 \(\ll P+q\log q\)。
计入块的数目,我们得到 \[|S_{k}(f)|^{K}\ll P^{K-1}+P^{K-k+\varepsilon}\left(\frac{P^{k-1}}{q}+1\right)(P+q\log q).\] 由于可以假设 \(q\le P^{k}\),因子 \(\log q\) 可被吸收进 \(P^{\varepsilon}\) 中。于是右边为 \[\ll P^{K+\varepsilon}\left(P^{-1}+q^{-1}+P^{-k}q\right),\] 这就给出了所要的结果。
- 合并块。单重和 \(=(\text{块数})\times(\text{每块和})\ll\big(\tfrac{P^{k-1}}q+1\big)(P+q\log q)\)。代回上一式得展示的式子。
- 处理 \(\log q\)。若 \(q>P^k\),回看引理结论:括号里 \((P^k/q)^{-1/K}=(q/P^k)^{1/K}>1\),于是右边 \(>P^{1+\varepsilon}\),比平凡上界 \(P\) 还大,结论自动成立(平凡)。所以不妨设 \(q\le P^k\),从而 \(\log q\le\log(P^k)=k\log P\ll P^\varepsilon\)(对数远小于任何正幂)。把 \(\log q\) 并进 \(P^\varepsilon\)。
- 展开乘积。\(\big(\tfrac{P^{k-1}}q+1\big)(P+q\log q)\),吸收 \(\log q\) 进 \(P^\varepsilon\) 后逐项乘开(共四项): \[\frac{P^{k-1}}q\cdot P=\frac{P^k}q,\quad \frac{P^{k-1}}q\cdot q=P^{k-1},\quad 1\cdot P=P,\quad 1\cdot q=q.\] 其中 \(P^{k-1}\le P^{k-1}\) 与 \(P\) 都被更大的项盖过(在 \(q\le P^k\) 下 \(\tfrac{P^k}q\ge1\))。主要留下 \(\tfrac{P^k}q\)、\(P^{k-1}\)、\(q\) 这几类。
- 乘上前缀并整理。第二大项整体 \(\ll P^{K-k+\varepsilon}\big(\tfrac{P^k}q+P^{k-1}+q\big)\)。逐项乘 \(P^{K-k}\): \[P^{K-k}\cdot\frac{P^k}q=\frac{P^{K}}q=P^K q^{-1},\quad P^{K-k}\cdot P^{k-1}=P^{K-1},\quad P^{K-k}\cdot q=P^{K-k}q=P^K\cdot P^{-k}q.\] 再加上第一项 \(P^{K-1}=P^K\cdot P^{-1}\)。三类合起来正是 \[|S_k(f)|^K\ll P^{K+\varepsilon}\big(P^{-1}+q^{-1}+P^{-k}q\big).\]
- 开 \(K\) 次方。两边取 \(1/K\) 次幂。用 \((A+B+C)^{1/K}\le A^{1/K}+B^{1/K}+C^{1/K}\)(次可加性,因 \(1/K\le1\)): \[|S_k(f)|\ll \big(P^{K+\varepsilon}\big)^{1/K}\big(P^{-1}+q^{-1}+P^{-k}q\big)^{1/K}\ll P^{1+\varepsilon'}\big(P^{-1/K}+q^{-1/K}+(P^{-k}q)^{1/K}\big).\] 注意 \((P^{-k}q)^{1/K}=(q/P^k)^{1/K}=(P^k/q)^{-1/K}\)。把 \(\varepsilon'\) 重记为 \(\varepsilon\)。这正是引理 3.1 的结论 \((3.1')\)。∎
第 7 节 注:大 \(k\) 时 Vinogradov 的改进
这一段在讲什么:提醒读者——当 \(k\) 很大时,Weyl 不等式里那个指数 \(K=2^{k-1}\) 增长太快(指数级),效果变差;Vinogradov 用更巧的方法把它换成增长慢得多的 \(4k^2\log k\)。
回忆“最常用”的上界是 \(P^{1-1/K+\varepsilon}\),改进幅度由 \(1/K\) 决定——\(K\) 越小,节省越多。Weyl 的 \(K=2^{k-1}\) 随 \(k\) 指数爆炸(\(k=10\) 已是 512),于是 \(1/K\) 微乎其微,几乎回到平凡上界。Vinogradov 在 1930 年代发明“中值定理”,把有效指数压到 \(\sim 4k^2\log k\)(多项式级增长),\(1/K\) 大得多,节省显著。这是华林问题中 \(G(k)\)(所需 \(k\) 次方个数)估计取得突破的关键,也是为什么大 \(k\) 要换工具。本书选择先讲 Weyl 不等式,是因为它简单、自足、足以处理小 \(k\),符合“先易后难”的取舍。
第 8 节 推论:完全和 \(S_{a,q}\) 的估计
这一段在讲什么:把 Weyl 不等式用到一个特殊但极重要的对象——“完全指数和” \(S_{a,q}=\sum_{z=1}^{q}e(az^k/q)\)。它在后面建立奇异级数时反复出现。
- 在引理 3.1 里取 \(f(z)=\dfrac aq z^k\),即最高次系数 \(\alpha=\dfrac aq\),没有低次项;并取求和长度 \(P=q\)(\(z\) 从 1 到 \(q\))。
- 找 \(\alpha=a/q\) 的有理逼近:它本身就是分数 \(a/q\),取逼近就用 \(a/q\),则 \(|\alpha-a/q|=0\le1/q^2\),且 \((a,q)=1\),条件全部满足,逼近分母正是 \(q\)。
- 代入结论括号 \(P^{-1/K}+q^{-1/K}+(P^k/q)^{-1/K}\),因 \(P=q\):第一项 \(q^{-1/K}\),第二项 \(q^{-1/K}\),第三项 \((q^k/q)^{-1/K}=q^{-(k-1)/K}\le q^{-1/K}\)(\(k\ge2\))。三项都 \(\le q^{-1/K}\)。
- 于是 \(S_{a,q}\ll P^{1+\varepsilon}\cdot q^{-1/K}=q^{1+\varepsilon}\cdot q^{-1/K}=q^{1-1/K+\varepsilon}\)。证毕。
这是引理 3.1 的一个特例,对应于 \(\alpha=a/q\) 且 \(P=q\)。我们以后(引理 6.4)将证明更精确的估计 \(q^{1-1/k}\) 以取代 \(q^{1-1/K+\varepsilon}\),但目前上述结果已足够使用。
解读:这里坦白指出当前结果不是最优——以后第 6 章会把指数从 \(1-1/K+\varepsilon\)(\(K=2^{k-1}\))改进到更好的 \(1-1/k\)(注意 \(1/k>1/K\),所以 \(q^{1-1/k}\) 更小、更强),而且没有 \(\varepsilon\)。但“够用就先用”,体现了写作上的取舍:不在此处提前展开更难的证明。
第 9 节 引理 3.2:华罗庚不等式的陈述
这一段在讲什么:给出本章第二件武器——华罗庚不等式。它不再估计单个 \(\alpha\) 处的和,而是估计 \(|T(\alpha)|\) 的高次幂在整个 \([0,1]\) 上的平均(积分)。
华罗庚(1910–1985)是中国现代数学的奠基人之一,自学成才,在解析数论、矩阵几何、多复变等领域有奠基性贡献。这条以他命名的不等式发表于 1938 年,是华林问题圆法处理中的标准工具。
它为什么重要?圆法要算 \(\int_0^1 T(\alpha)^s e(-N\alpha)\,d\alpha\)(它正好等于 \(N\) 写成 \(s\) 个 \(k\) 次方之和的方法数)。把 \([0,1]\) 分成主弧(贡献主项)和次弧(希望贡献可忽略)。在次弧上要证明积分很小,关键就是要有 \(\int|T|^{\text{某次幂}}\) 的好上界——华罗庚不等式正好提供 \(2^k\) 次幂的均值估计。
平凡上界对照:\(|T(\alpha)|\le P\),所以 \(\int_0^1|T|^{2^k}\le P^{2^k}\cdot\int_0^1 1=P^{2^k}\)。华罗庚不等式把它改进成 \(P^{2^k-k+\varepsilon}\),省下了 \(P^{k-\varepsilon}\) 这么大一个因子。指数里的 \(-k\) 正是“每个变量积分一次省一点”累积的结果。
- \(T(\alpha)\)
- 专指最高次单项 \(f(x)=\alpha x^k\)(没有低次项)的指数和。这是华林问题真正要用的和。
- \(\int_0^1|T(\alpha)|^{2^k}d\alpha\)
- 把 \(|T|\) 升到 \(2^k\) 次方再在 \([0,1]\) 上求平均。为什么偏偏是 \(2^k\) 次?因为证明用“平方降次”,每平方一次幂翻倍,配合 \(k\) 步归纳,自然落到 \(2^k\)。后面的注会讨论其它次幂(如 6 次)能否更好。
第 10 节 引理 3.2 的证明:归纳 + “积分=数解数”
这一段在讲什么:用对 \(\nu\) 的归纳证明一串递增的估计 \(I_\nu\ll P^{2^\nu-\nu+\varepsilon}\),\(\nu=k\) 时正是要证的。核心新思想:这种积分等于某个方程整数解的个数,于是“分析问题”变成“数数问题”。
记 \[I_{\nu}=\int_{0}^{1}|T(\alpha)|^{2^{\nu}}\,d\alpha.\] 我们对 \(\nu\) 作归纳,证明 \[I_{\nu}\ll P^{2^{\nu}-\nu+\varepsilon},\qquad \nu=1,\ldots,k,\tag{3.4}\] 其中 \(\nu=k\) 的情形即为引理所断言的结果。
直接证 \(\nu=k\) 太难,但相邻两步 \(I_\nu\to I_{\nu+1}\) 之间有清晰联系(靠 (3.2) 那条“原始形式”不等式)。于是设一个一般的 \(I_\nu\),证明“前一步成立 \(\Rightarrow\) 后一步成立”,再加一个简单的起点,就能像多米诺骨牌一样推到 \(\nu=k\)。这就是数学归纳法在解析数论里的典型用法。
对 \(\nu=1\),该估计是显然的。我们有 \[I_{1}=\int_{0}^{1}\sum_{x_{1}}e(\alpha x_{1}^{k})\sum_{x_{2}}e(-\alpha x_{2}^{k})\,d\alpha=P,\] 因为当 \(x_{1}=x_{2}\) 时对 \(\alpha\) 的积分为 1,否则为 0。
- \(I_1=\int_0^1|T|^2 d\alpha=\int_0^1 T\bar T\,d\alpha\)。把 \(T=\sum_{x_1}e(\alpha x_1^k)\)、\(\bar T=\sum_{x_2}e(-\alpha x_2^k)\) 乘开: \[I_1=\int_0^1\sum_{x_1}\sum_{x_2}e\big(\alpha(x_1^k-x_2^k)\big)\,d\alpha=\sum_{x_1}\sum_{x_2}\int_0^1 e\big(\alpha(x_1^k-x_2^k)\big)\,d\alpha.\] (先把有限求和与积分交换顺序,合法。)
- 用正交关系(预备知识那条):内层积分 \(\int_0^1 e(n\alpha)d\alpha\) 在 \(n=x_1^k-x_2^k=0\) 时为 1,否则为 0。而 \(x_1^k=x_2^k\)(正整数)\(\iff x_1=x_2\)。
- 所以 \(I_1=\#\{(x_1,x_2):1\le x_1,x_2\le P,\ x_1=x_2\}=\#\{x_1=x_2\}=P\)。
- 对照 (3.4):\(\nu=1\) 时 \(P^{2^1-1+\varepsilon}=P^{1+\varepsilon}\ge P\),成立(其实更强,等于 \(P\))。这一步揭示了全证明的灵魂:\(\int_0^1|T|^{2m}d\alpha\) 恰好数“\(x_1^k+\dots+x_m^k=y_1^k+\dots+y_m^k\) 的解数”。
现在假设 (3.4) 对某个特定的整数 \(\nu\le k-1\) 成立;我们要推出把 \(\nu\) 换成 \(\nu+1\) 时相应的结果。我们回顾前一证明中的不等式 (3.2);将其中的 \(S_{k}(f)\) 换成 \(T(\alpha)\),它表明 \[|T(\alpha)|^{2^{\nu}}\ll P^{2^{\nu}-1}+P^{2^{\nu}-\nu-1}\Re\sum_{y_{1}=1}^{P}\cdots\sum_{y_{\nu}=1}^{P}S_{k-\nu},\] 其中 \[S_{k-\nu}=\sum_{x}e(\alpha\Delta_{y_{1},\ldots,y_{\nu}}(x^{k})).\]
- 把引理 3.1 证明里的一般多项式 \(f\) 取成 \(f(x)=\alpha x^k\)、\(S_k(f)=T(\alpha)\)。(3.2) 给出 \(|T|^{2^\nu}\) 的上界,关键是它保留了 \(\Re S_{k-\nu}\)(带正负号),没有取绝对值。
- 为什么必须保留正负号?下一步要把这个不等式乘 \(|T|^{2^\nu}\) 再积分。\(\Re S_{k-\nu}\) 里的 \(e(\alpha\,\Delta(x^k))\) 与 \(|T|^{2^\nu}=T^{2^{\nu-1}}\bar T^{2^{\nu-1}}\) 里的指数会合并成一个总指数,再用正交关系变成“某方程解数”。若提前取绝对值,指数结构被破坏,正交关系就用不上了。这就是第 4 节末特意留下 (3.2) 的原因——伏笔在此回收。
- 这里 \(S_{k-\nu}=\sum_x e(\alpha\,\Delta_{y_1,\dots,y_\nu}(x^k))\) 是对 \(x^k\) 做 \(\nu\) 次差分后(\(k-\nu\) 次多项式)的指数和,\(x\) 取值范围依赖各 \(y_i\) 但含于 \([1,P]\)。
把不等式两边都乘以 \(|T(\alpha)|^{2^{\nu}}\),并从 0 积到 1,我们得到 \[I_{\nu+1}\ll P^{2^{\nu}-1}I_{\nu}+P^{2^{\nu}-\nu-1}\sum_{y_{1},\ldots,y_{\nu}}\Re\int_{0}^{1}S_{k-\nu}|T|^{2^{\nu}}\,d\alpha.\]
- 左边:\(|T|^{2^\nu}\cdot|T|^{2^\nu}=|T|^{2^{\nu+1}}\),积分得 \(\int_0^1|T|^{2^{\nu+1}}d\alpha=I_{\nu+1}\)。这正是我们想要估计的目标。
- 右边第一项:\(P^{2^\nu-1}\cdot|T|^{2^\nu}\) 积分得 \(P^{2^\nu-1}\int_0^1|T|^{2^\nu}d\alpha=P^{2^\nu-1}I_\nu\)。这里就要用到归纳假设来控制 \(I_\nu\)。
- 右边第二项:\(P^{2^\nu-\nu-1}\sum_{y_1,\dots,y_\nu}\Re\int_0^1 S_{k-\nu}|T|^{2^\nu}d\alpha\)(积分、求和、取实部都是线性运算,可交换次序)。剩下的工作就是搞清楚那个积分 \(\int_0^1 S_{k-\nu}|T|^{2^\nu}d\alpha\) 到底是什么。
最后这个积分为 \[\int_{0}^{1}\sum_{x}e\left(\alpha\Delta_{y_{1},\ldots,y_{\nu}}(x^{k})\right)\sum_{\substack{u_{1},\ldots,u_{2^{\nu-1}}\\ v_{1},\ldots,v_{2^{\nu-1}}}}e(\alpha u_{1}^{k}+\cdots)e(-\alpha v_{1}^{k}-\cdots)\,d\alpha,\] 其中 \(u_{i}\) 与 \(v_{i}\) 从 1 取到 \(P\)。该积分等于 \[\Delta_{y_{1},\ldots,y_{\nu}}(x^{k})+u_{1}^{k}+\cdots-v_{1}^{k}-\cdots=0\tag{3.5}\] 的解的个数。
- 展开 \(|T|^{2^\nu}\)。\(|T|^{2^\nu}=T^{2^{\nu-1}}\cdot\bar T^{2^{\nu-1}}\)。\(T^{2^{\nu-1}}=\big(\sum_u e(\alpha u^k)\big)^{2^{\nu-1}}\) 展开成对 \(u_1,\dots,u_{2^{\nu-1}}\) 的和,指数是 \(\alpha(u_1^k+\dots+u_{2^{\nu-1}}^k)\);同理 \(\bar T^{2^{\nu-1}}\) 给出 \(-\alpha(v_1^k+\dots+v_{2^{\nu-1}}^k)\)。一共 \(2^{\nu-1}+2^{\nu-1}=2^\nu\) 个变量,正好是 \(|T|^{2^\nu}\) 里的 \(2^\nu\) 次幂。
- 合并所有指数。再乘上 \(S_{k-\nu}=\sum_x e(\alpha\Delta(x^k))\),所有 \(e(\cdots)\) 的指数相加,得 \(e\big(\alpha\,[\,\Delta_{y_1,\dots,y_\nu}(x^k)+u_1^k+\cdots-v_1^k-\cdots\,]\big)\)。
- 对 \(\alpha\) 积分,用正交关系。记方括号里的整数为 \(n\)。\(\int_0^1 e(\alpha n)d\alpha=1\) 当 \(n=0\),否则 0。于是积分把每组 \((x,u_i,v_i)\)“筛选”:只有让 \(n=0\)(即方程 (3.5) 成立)的那些组才计 1,其余计 0。
- 所以这个积分 = 方程 (3.5) 的解的个数(在给定 \(y_1,\dots,y_\nu\) 下,对 \(x,u_i,v_i\) 数)。再对 \(y_1,\dots,y_\nu\) 求和,就得到所有变量上的总解数 \(N\)。注意:解数是非负整数,所以这个量本身是实数,\(\Re\) 是多余的、只是形式上保留。
对 \(y_{1},\ldots,y_{\nu}\) 求和,便给出在所有变量上的解的总数。因此 \[I_{\nu+1}\ll P^{2^{\nu}-1}I_{\nu}+P^{2^{\nu}-\nu-1}N,\tag{3.6}\] 其中 \(N\) 表示 (3.5) 在所有变量上的解的个数,这些变量现在都是 \([1,P]\) 中的整数。
解读:到这一步,分析(积分)已经彻底变成组合(数解数)。下一段就专心去估计 \(N\)。
现在重要的是要注意到:由于 \(y_{1},\ldots,y_{\nu}\) 与 \(x\) 都是正的,我们有 \[\Delta_{y_{1},\ldots,y_{\nu}}(x^{k})>0.\] 此外,这个数能被 \(y_{1},\ldots,y_{\nu}\) 中的每一个整除。因此,若我们给定 \(u_{1},\ldots,u_{2^{\nu-1}}\) 与 \(v_{1},\ldots,v_{2^{\nu-1}}\) 任意值,则由 (3.3),\(y_{1},\ldots,y_{\nu}\) 中每一个的可能取法数为 \(\ll P^{\varepsilon}\)。于是 \(x\) 至多有一种可能取法,因为 \(\Delta_{y_{1},\ldots,y_{\nu}}(x^{k})\) 是 \(x\) 的严格递增函数。\(u_{i}\) 与 \(v_{i}\) 的可能取法数为 \(\ll P^{2^{\nu}}\),由此可知 \[N\ll P^{2^{\nu}+\nu\varepsilon}.\]
- 论断 A:\(\Delta_{y_1,\dots,y_\nu}(x^k)>0\)。因为 \(x^k\) 是关于 \(x\) 严格递增且“高阶差分为正”的函数(对 \(\nu\le k-1\),第 \(\nu\) 阶差分仍是 \(x\) 的次数 \(\ge1\) 的多项式,最高次系数 \(k(k-1)\cdots(k-\nu+1)\,y_1\cdots y_\nu>0\),在正整数处取正值)。直观:步长 \(y_i>0\) 时 \(f(x+y)-f(x)>0\) 对递增的 \(f\) 成立,逐次差分保持正。
- 论断 B:\(\Delta_{y_1,\dots,y_\nu}(x^k)\) 被每个 \(y_i\) 整除。看一次差分 \(\Delta_y g(x)=g(x+y)-g(x)\)。对整系数多项式(如 \(x^k\) 及其整数差分),\(g(x+y)\equiv g(x)\pmod y\)(因为 \((x+y)^j\equiv x^j\pmod y\)),所以 \(\Delta_y g(x)\) 能被 \(y\) 整除。对每一步差分用此结论,得 \(\Delta_{y_1,\dots,y_\nu}(x^k)\) 被 \(y_1,\dots,y_\nu\) 中每一个整除。
- 由 A、B 控制 \(y_i\) 的取法。先随便固定 \(u_i,v_i\)(共 \(2^\nu\) 个变量,各 \(\le P\),取法 \(\ll P^{2^\nu}\) 种)。方程 (3.5) 要求 \(\Delta_{y_1,\dots,y_\nu}(x^k)=v_1^k+\cdots-u_1^k-\cdots=:M\),一个由 \(u,v\) 决定的固定数。由 A 这个 \(M>0\)(在有解时),由 B 每个 \(y_i\) 都整除 \(M\)。所以每个 \(y_i\) 只能取 \(M\) 的因子 → 取法 \(\le d(M)\ll M^\varepsilon\ll P^\varepsilon\)(用 (3.3),且 \(M\le\) 若干个 \(P^k\) 之和 \(\ll P^k\),故 \(M^\varepsilon\ll P^{k\varepsilon}\ll P^\varepsilon\))。\(\nu\) 个 \(y_i\) 合计 \(\ll P^{\nu\varepsilon}\) 种。
- \(x\) 至多一种。\(y_i\) 与 \(M\) 都定了之后,\(\Delta_{y_1,\dots,y_\nu}(x^k)=M\) 是关于 \(x\) 的方程;因为左边是 \(x\) 的严格递增函数(论断 A 的加强:导数恒正,注意 \(\nu\le k-1\) 保证它真的还含 \(x\)、不是常数),严格递增函数取定值至多一个解。所以 \(x\) 至多 1 种。
- 汇总。\(N\le(\text{$u,v$ 取法})\times(\text{$y$ 取法})\times(\text{$x$ 取法})\ll P^{2^\nu}\cdot P^{\nu\varepsilon}\cdot1=P^{2^\nu+\nu\varepsilon}\)。这就是所要的 \(N\) 估计。妙处在于:本来 \(y_i\) 和 \(x\) 也各能跑 \(P\) 个值(朴素地 \(N\) 可达 \(P^{2^\nu+\nu+1}\)),但“被整除”和“严格单调”这两条把它们几乎钉死,省下了 \(P^{\nu+1}\) 量级——这正是华罗庚的关键观察。
代入 (3.6) 并利用归纳假设,我们得到 \[I_{\nu+1}\ll P^{2^{\nu}-1}P^{2^{\nu}-\nu+\varepsilon}+P^{2^{\nu}-\nu-1}P^{2^{\nu}+\nu\varepsilon}\ll P^{2^{\nu+1}-(\nu+1)+\nu\varepsilon}.\] 这正是把 \(\nu\) 换成 \(\nu+1\) 后的 (3.4),只是 \(\varepsilon\) 有所改变,而这无关紧要。
- 第一项。归纳假设 \(I_\nu\ll P^{2^\nu-\nu+\varepsilon}\),乘 \(P^{2^\nu-1}\):指数相加 \((2^\nu-1)+(2^\nu-\nu+\varepsilon)=2\cdot2^\nu-\nu-1+\varepsilon=2^{\nu+1}-(\nu+1)+\varepsilon\)。
- 第二项。\(P^{2^\nu-\nu-1}\cdot N\ll P^{2^\nu-\nu-1}\cdot P^{2^\nu+\nu\varepsilon}\):指数相加 \((2^\nu-\nu-1)+(2^\nu+\nu\varepsilon)=2^{\nu+1}-\nu-1+\nu\varepsilon=2^{\nu+1}-(\nu+1)+\nu\varepsilon\)。
- 两项同阶。两个指数都是 \(2^{\nu+1}-(\nu+1)\) 再加一点 \(\varepsilon\) 级的项。取较大者(把 \(\varepsilon\) 与 \(\nu\varepsilon\) 统一重记为 \(\varepsilon\),因 \(\nu\le k\) 固定): \[I_{\nu+1}\ll P^{2^{\nu+1}-(\nu+1)+\varepsilon}.\] 这恰是 (3.4) 中 \(\nu\to\nu+1\) 的形式。
- 归纳收尾。基础 \(\nu=1\) 已验证,归纳步骤成立,故 (3.4) 对 \(\nu=1,\dots,k\) 都成立。取 \(\nu=k\):\(I_k=\int_0^1|T|^{2^k}d\alpha\ll P^{2^k-k+\varepsilon}\),正是引理 3.2。∎
- “\(\varepsilon\) 改变无关紧要”是什么意思?每一步归纳里 \(\varepsilon\) 会增大一点点(比如从 \(\varepsilon\) 变 \(2\varepsilon\))。但因为总共只做 \(k\) 步(\(k\) 固定),最终的 \(\varepsilon\) 仍是某个固定小数。换句话说:先决定最终想要的 \(\varepsilon\),再倒推每步用更小的 \(\varepsilon/k\) 即可。这是解析数论里处理 \(\varepsilon\) 的标准说辞。
第 11 节 注:\(k=3\)(立方)时的含义与“八个立方数”悬案
这一段在讲什么:专门考察 \(k=3\) 时华罗庚不等式说了什么。引入一个函数 \(\lambda(m)\) 记录各次幂均值的最优指数,证明它是凸的,并指出一个至今未解决的问题——若能在中间改进一点,就能把“九个立方数”改进成“八个立方数”。
对每个实数 \(m>0\),问“\(\int_0^1|T|^{2m}d\alpha\) 最小能被 \(P^\lambda\) 控制时,\(\lambda\) 取多小”,这个最小的 \(\lambda\)(下确界)记为 \(\lambda(m)\)。它把“各种次幂的均值估计”浓缩成一条曲线,方便比较好坏。凸是指:图像上任意两点的连线段都在图像上方(像 \(y=x^2\) 那样“向上弯”)。
- 对积分形式的 Cauchy–Schwarz:\(\int fg\le\big(\int f^2\big)^{1/2}\big(\int g^2\big)^{1/2}\)。取 \(f=|T|^{m_1}\),\(g=|T|^{m_2}\),则 \(fg=|T|^{m_1+m_2}\),\(f^2=|T|^{2m_1}\),\(g^2=|T|^{2m_2}\): \[\int_0^1|T|^{m_1+m_2}d\alpha\le\Big(\int_0^1|T|^{2m_1}d\alpha\Big)^{1/2}\Big(\int_0^1|T|^{2m_2}d\alpha\Big)^{1/2}.\]
- 把右边两个积分用各自的最优界 \(\ll P^{\lambda(m_1)}\)、\(\ll P^{\lambda(m_2)}\) 代入: \[\int_0^1|T|^{2\cdot\frac{m_1+m_2}2}d\alpha\ll\big(P^{\lambda(m_1)}\big)^{1/2}\big(P^{\lambda(m_2)}\big)^{1/2}=P^{\frac12(\lambda(m_1)+\lambda(m_2))}.\] 注意左边正是“次幂参数为 \(\tfrac{m_1+m_2}2\)”的均值。
- 按 \(\lambda\) 的定义(最小可行指数),它 \(\le\) 上面这个可行的指数 \(\tfrac12(\lambda(m_1)+\lambda(m_2))\)。即 \[\lambda\Big(\frac{m_1+m_2}2\Big)\le\frac12\big(\lambda(m_1)+\lambda(m_2)\big).\] 这正是“中点处的值不超过两端值的平均”,即凸性。
引理 3.2 告诉我们 \[\lambda(1)\le 1,\qquad \lambda(2)\le 2,\qquad \lambda(4)\le 5,\] 并且可以证明这三处实际上都取等号。于是该图像落在连接 \((1,1),(2,2),(4,5)\) 的两条线段之上或之下。
- \(\lambda(1)\le1\):\(m=1\) 即 \(\int_0^1|T|^2 d\alpha=I_1=P=P^1\)(前面算过,等于 \(P\)),所以 \(\lambda(1)\le1\)。
- \(\lambda(2)\le2\):\(m=2\) 即 \(2m=4=2^2\),正是引理 3.2 取 \(k=2\)?不——这里 \(k=3\) 固定,\(2m=4=2^\nu\) 对应 \(\nu=2\)。由 (3.4) 的 \(\nu=2\) 情形 \(I_2\ll P^{2^2-2+\varepsilon}=P^{2+\varepsilon}\),故 \(\lambda(2)\le2\)。
- \(\lambda(4)\le5\):\(2m=8=2^3=2^k\)(\(k=3\)),正是引理 3.2 本身:\(I_3\ll P^{2^3-3+\varepsilon}=P^{5+\varepsilon}\),故 \(\lambda(4)\le5\)。
- 取等号(即这些指数无法再降)可由“数解数的下界”证明:例如 \(x_1=y_1\) 这种平凡解就贡献了 \(P^{\text{对应幂}}\) 量级,使指数不能更小。于是三点 \((1,1),(2,2),(4,5)\) 都精确落在曲线上。由凸性,曲线在 \(1\le m\le4\) 间夹在“两条连线段”与“图像本身”之间。
看来当 \(2\lt m\lt 4\) 时该图像很可能严格地位于线段之下,但这一点从未被证明。如果能证明它,便能够建立八个立方数(而非九个立方数,\(9=2^{k}+1\))的渐近公式。例如,只要能证明 \[\int_{0}^{1}|T(\alpha)|^{6}\,d\alpha\ll P^{7/2-\delta}\] 对某个正数 \(\delta\) 成立就够了。这等价于断言: \[x_{1}^{3}+x_{2}^{3}+x_{3}^{3}=y_{1}^{3}+y_{2}^{3}+y_{3}^{3}\] (所有变量介于 0 与 \(P\) 之间)的解的总数为 \(\ll P^{7/2-\delta}\)。
- \(|T|^6\) 对应 \(m=3\)(在 \(2\) 与 \(4\) 之间)。折线在 \(m=3\) 处的值是 \((2,2)\) 与 \((4,5)\) 的中点纵坐标 \(\tfrac{2+5}2=3.5=\tfrac72\)。所以折线给的是 \(\lambda(3)\le\tfrac72\),即 \(\int|T|^6\ll P^{7/2}\)。若能改进到 \(P^{7/2-\delta}\)(严格低于折线),就证实了“中间严格在下”的猜测。
- 积分=立方和方程解数。由前面“积分=数解数”的原理,\(\int_0^1|T|^6 d\alpha\)(\(=\int_0^1 T^3\bar T^3\))恰好等于 \[x_1^3+x_2^3+x_3^3=y_1^3+y_2^3+y_3^3,\quad 0\le x_i,y_i\le P\] 的解的总数。所以“积分有更好上界” \(\iff\) “这个对称立方方程解不太多”。这就是文末那句等价表述。
- 九个 vs 八个立方数。\(9=2^k+1\)(\(k=3\))个立方数的渐近公式可由现有的 \(2^k=8\) 次幂均值(即引理 3.2)直接得到——这是华罗庚不等式的标准应用。要把所需个数减到 8,需要一个“半个变量的节省”,恰好就是把 \(|T|^6\) 的均值压低一点点(\(\delta>0\))。难点:这要求精确地知道立方和方程的解数没有“反常聚集”,目前数学家既无法证明也无法否证——这是立方华林问题里著名的未决问题,凸性方法到此为止,再进一步需要全新的想法。
- 取舍说明:Davenport 在此坦诚地标出“方法的边界”——凸性(Cauchy 不等式)只能给到折线,要突破必须引入更强的工具。这种对“已知/未知边界”的清楚交代,是好的数学叙述的标志。
第 12 节 脚注:关于 \(\ll\) 记号
我们使用 Vinogradov 记号 \(\ll\) 来表示一个带有未指定“常数”因子的不等式。在当前情形中,所出现的因子实际上与 \(k\) 无关,但我们无需了解这一点。
解读:再次强调 \(\ll\) 隐含一个常数 \(C\)(见第 0 节)。这里补充一个细节:本章里那个常数其实连 \(k\) 都不依赖(只依赖 \(\varepsilon\)),但作者说“我们不需要知道这一点”——因为在应用中 \(k\) 是固定的,常数依不依赖 \(k\) 都无所谓。这体现了 \(\ll\) 记号的便利:让我们把注意力集中在量级(\(P\) 的幂次)上,不被常数分心。
- Weyl 不等式(点估计):给定一个 \(\alpha\),若它的有理逼近分母 \(q\) 在 \([P,P^{k-1}]\) 间,则 \(|\sum e(f(x))|\ll P^{1-1/K+\varepsilon}\),比平凡的 \(P\) 小。用途:在圆法的次弧上逐点压低指数和。证明套路:平方降次(\(k-1\) 次)→ 几何级数 → 除数函数合并 → 分块用有理逼近。
- 华罗庚不等式(均值估计):\(\int_0^1|T|^{2^k}d\alpha\ll P^{2^k-k+\varepsilon}\),比平凡的 \(P^{2^k}\) 小 \(P^{k-\varepsilon}\)。用途:在整段 \([0,1]\) 上控制高次幂的平均,是次弧贡献可忽略的依据。证明套路:积分=数解数 → 用差分的“被整除+单调”狠狠压制解数 → 对 \(\nu\) 归纳。
- 共同内核:两者都建立在“Weyl 平方降次”这一发动机上,区别只在最后一步取不取绝对值((3.1) vs (3.2))。把握住这个内核,整章就连成了一条线。
返回 全书目录