圆法完整演示:用"五个平方和"从零讲一遍The Hardy–Littlewood circle method, worked end-to-end on sums of five squares (k=2, s=5)
这篇不是翻译某一章,而是把圆法的每一步,针对最简单、最透明的情形 \(k=2,\ s=5\)(把整数写成五个平方之和)从头演示一遍。书里圆法的论证之所以让人觉得"不等式放缩很不自然",是因为一般 \(k\) 的工具(Weyl、Hua)必须照顾最坏情形,把所有具体的东西都藏进了符号里。而 \(k=2\) 时每一个量都能写成你看得见、算得出的具体数:高斯和恰好等于 \(\sqrt q\),"次弧上 \(T\) 很小"是一行因式分解 + 一个等比数列就能看出来的。看完这一篇,再回头看正文那些 \(\le\),就知道每一步在干什么、为什么"刚好够用"。
0. 我们到底要证明什么
问题:给一个很大的整数 \(N\),问它能不能写成五个平方之和 \[ N=x_1^2+x_2^2+x_3^2+x_4^2+x_5^2, \qquad x_i\in\mathbb Z. \] 更进一步,我们想知道有多少种写法。把这个写法个数记作 \(r(N)\)(\(x_i\) 允许取负数和 \(0\),不同顺序算不同写法——这样计数最干净)。
我们的目标是证明一条渐近公式:
这里两个因子各有极其朴素的含义,先认个脸熟(后面会一一兑现):
- 几何主项 \(\frac{4\pi^2}{3}N^{3/2}\)
- 就是半径 \(\sqrt N\) 的五维球面的"表面积"。如果完全不管整除性、把 \(x_i\) 当成连续变量,落在球面 \(\sum x_i^2=N\) 上的点"有多少",答案就是这个表面积。这是"连续世界"的解的个数。
- 算术修正 \(\mathfrak S(N)\)(奇异级数,singular series)
- 真实的 \(x_i\) 是整数,要受"模 \(p\) 同余"的约束。\(\mathfrak S(N)\) 就是把每个素数 \(p\) 处"\(N\) 能否凑成五个平方 \(\bmod\ p^a\)"的难易程度乘起来的修正因子。对五个平方,它永远 \(>0\)——这正是"每个大数都写得出来"的算术原因。
热身:先把机器空转一遍 —— 最简单的 \(k=1,\ s=1\)
在给机器加上 \(k=2,\ s=5\) 的"负载"之前,先让它空转一圈:取 \(k=1,\ s=1\)(把 \(N\) 写成一个一次方)。这是整套圆法最极端的退化情形——所有零件都塌缩成最朴素的样子,正好让你先认全"骨架",再看满载时它们如何一个个变难。(下面要用的记号 \(e(\theta)=\cos2\pi\theta+i\sin2\pi\theta\)、以及"积分挑出傅里叶系数"这件事,第 1 节会从头细讲;这里先借最简单的情形认个脸。)
问题本身:答案显然是 1
\(k=1,\ s=1\) 就是把 \(N\) 写成 \(N=x^1=x\)。解只有 \(x=N\) 这一个,所以表法数 \(r(N)=1\),毫无悬念。有趣的是看圆法怎样把这个 \(1\) 算出来。
圆法在这里 = 一行正交关系
仿照后面的做法,令 \(T(\alpha)=\sum_{x=-P}^{P}e(\alpha x)\)(注意指数里是 \(x\),不是 \(x^2\)),取 \(P\ge N\)。\(s=1\) 时不需要任何五次方、不需要展开,直接:
\[ r(N)=\int_0^1 T(\alpha)e(-N\alpha)\,d\alpha=\sum_{x=-P}^{P}\int_0^1 e\big((x-N)\alpha\big)d\alpha=\sum_{x=-P}^{P}[\,x=N\,]=1. \]最后一步用的,正是第 1 节将记为 \((1)\) 的正交关系(\(\int_0^1 e(m\alpha)d\alpha\) 在 \(m=0\) 时取 \(1\)、否则取 \(0\))。换句话说:
每个零件怎么退化
- ① \(T\) 是等比数列(这正是 \(k\ge2\) 缺的东西)
- \(k=1\) 时 \(T(\alpha)\) 有上面那个封闭式。\(k\ge2\) 起 \(\sum e(\alpha x^2)\) 再没有这种封闭式,只能靠高斯和给"大小"、靠 Weyl 给"上界"——文档里所有"难看的放缩"都从这里来。\(k=1\) 一概不需要。
- ② 高斯和塌成只剩 \(q=1\)
- 文档里 \(S(q,a)=\sum_{r\bmod q}e(ar^2/q)=\sqrt q\)(第 3 节)。换成 \(k=1\):\(S(q,a)=\sum_{r=0}^{q-1}e(ar/q)=q\) 当 \(q=1\)、\(=0\) 当 \(q>1\)。所以除 \(\alpha=\) 整数外没有任何次级尖峰(正是图 0a 的样子)。没有尖峰森林 ⟹ 没有次弧要对付(第 2、5、6 节那一大套全省了)。
- ③ 主项也全部 \(=1\)
- 奇异级数只剩 \(q=1\) 一项:\(\mathfrak S(N)=1\);奇异积分(连续世界里只有 \(x=N\) 一个点)\(=1\)。几何主项的增长指数 \(\dfrac sk-1=\dfrac11-1=0\),故 \(r(N)\sim\text{常数}\cdot N^0=1\)——解数不随 \(N\) 增长,恒为 \(1\),与精确值吻合。
插话:\(k=1\) 的"高斯和"为什么是 \(0\)(而不是 \(\sqrt q\))
上面 ② 那句"\(S(q,a)=0\)(\(q\gt1\))"是 \(k=1\) 全部魔力的来源——它让尖峰森林塌成一根,值得单独讲清。\(k=1\) 的高斯和是
\[ S(q,a)=\sum_{r=0}^{q-1}e\Big(\frac{ar}{q}\Big),\qquad (a,q)=1. \]当 \((a,q)=1\) 时 \(e(a/q)\) 是一个本原 \(q\) 次单位根,于是 \(r=0,1,\dots,q-1\) 让 \(e(ar/q)\) 恰好取遍全部 \(q\) 个 \(q\) 次单位根各一次。所以 \(S(q,a)\) 就是"全部 \(q\) 次单位根之和":
- 几何上:这 \(q\) 个单位根是正 \(q\) 边形的顶点,质心在原点,故它们的和(\(=q\times\)质心)\(=0\)(\(q\ge2\))。
- 代数上:等比数列 \(\sum_{r=0}^{q-1}\zeta^r=\dfrac{\zeta^q-1}{\zeta-1}=0\)(取 \(\zeta=e(a/q)\),\(\zeta^q=1\) 而 \(\zeta\ne1\))。
- \(q=1\) 时只有一个根 \(1\),\(S(1,0)=1\)。
④ 怎么估这条曲线的大小:封闭式直接给界
\(k=1\) 估 \(|T|\) 不需要任何不等式技巧——既然有了封闭式,看分子分母就够了。这正是 \(k=1\) 全部的"轻松"所在。把大小写成分式:
\[ |T(\alpha)|=\frac{\big|\sin\big((2P+1)\pi\alpha\big)\big|}{|\sin(\pi\alpha)|}. \]- 分子永远 \(\le 1\):\(|\sin(\cdot)|\le1\),免费。
- 分母有下界(Jordan 不等式):在 \([0,\tfrac12]\) 上 \(\sin(\pi x)\) 是凹的、落在弦 \(y=2x\) 之上,所以 \[ |\sin(\pi\alpha)|=\sin(\pi\|\alpha\|)\ \ge\ 2\|\alpha\|, \] 其中 \(\|\alpha\|\) 是 \(\alpha\) 到最近整数的距离(端点对得上:\(\|\alpha\|=0\to0\)、\(\|\alpha\|=\tfrac12\to1\))。
怎么读它:
- 靠近整数(\(\|\alpha\|\lesssim\tfrac1P\))
- \(\min\) 取 \(2P+1\),就是那根高 \(2P+1\) 的主峰(图 0a 的尖峰),峰宽约 \(1/P\)。
- 远离整数
- \(\min\) 取 \(\dfrac1{2\|\alpha\|}\),与 \(P\) 无关!哪怕 \(P\) 再大,只要 \(\alpha\) 离整数有固定距离,\(|T|\) 就被一个 \(O(1)\) 常数压住——这就是等比数列的完全相消(单位向量转着圈走、几乎抵消干净),正是图 0a 中间那片矮振荡。
顺带,均方是精确的(不是估计):\(\displaystyle\int_0^1|T(\alpha)|^2 d\alpha=2P+1\)(正交关系一步到位),这是华罗庚不等式在 \(k=1\) 的平凡版。
⑤ 完整空跑一遍:按 §1→§7 把机器开一遍(看它在哪卡住)
有了上界,就能把正文 §1→§7 的整套流程在 \(k=1,\ s=1\) 上"空载试转"一遍。结论早知道是 \(r(N)=1\),但重点是看每个齿轮怎么转、又在哪一个齿轮上诚实地卡住——那个卡点正是 §5、§6 存在的理由。设 \(T(\alpha)=\sum_{x=-P}^{P}e(\alpha x)\),\(P\ge N\)。
(对应 §1)写成积分。 \(r(N)=\int_0^1 T(\alpha)e(-N\alpha)\,d\alpha\)(\(s=1\),不用乘方)。
(对应 §2–§3)切弧,尖峰森林塌成一根。 \(k=1\) 的高斯和 \(S(q,a)=0\)(\(q>1\)),所以只剩 \(q=1\) 一根尖峰(图 0a/0b)。于是主弧 \(\mathfrak M=\{\|\alpha\|\le\delta\}\)(取 \(\delta\sim1/P\),只此一段),次弧 \(\mathfrak m\) 是其余全部。
(对应 §3–§4)主弧 → 主项。 在 \(\mathfrak M\) 上把求和换成它的连续模型(这是 \(k=1\) 版的主弧近似 \((4)\),其中高斯和因子是 \(S(1,0)/1=1\))。即用积分逼近求和:
\[ T(\alpha)=\sum_{x=-P}^{P}e(\alpha x)\ \approx\ I(\alpha):=\int_{-P}^{P}e(\alpha t)\,dt. \]- 为什么只在主弧成立。 \(I\) 来自"求和换积分" \(\sum_x e(\alpha x)\approx\int e(\alpha t)dt\),而它成立的唯一条件是相位每步 \(2\pi\alpha\) 变化要慢——只有 \(\alpha\) 靠近 \(0\)(\(\bmod 1\))才行,即 \(|\alpha|\lesssim 1/P\)(正是主弧)。图 0d 中央两线重合就是这一小段。
- 为什么差得夸张。 \(T\) 周期:\(T(m+\beta)=\sum_x e(mx)e(\beta x)=T(\beta)\),于是它在每个整数都重放同一座峰;\(I\) 不周期,是把那一座峰"摊开不折叠"的连续版,只有 \(\alpha=0\) 一座、其余 \(1/|\alpha|\) 衰减。但 \(\alpha=1\equiv0\,(\bmod1)\) 在圆上就是同一条主弧,那里 \(I\approx T\);图把 \(T\) 的一个周期复制了 21 份给你看,而积分只在 \([0,1]\) 一个周期上做。
- 差异落在哪。 \(I\) 与 \(T\) 差得最凶的地方(整数处的复现峰、中间的振荡背景)全部在次弧——而次弧上圆法根本不用 \(I\),改用 §5 的大小上界 \(1/(2\|\alpha\|)\)。"近似只在主弧、上界只在次弧"正是主弧/次弧二分的全部意义。
实部:用积化和差 \(\sin A\cos B=\tfrac12[\sin(A+B)+\sin(A-B)]\): \[ \text{实部}=\frac12\int_{-\infty}^{\infty}\frac{\sin\big(2\pi(P+N)\alpha\big)+\sin\big(2\pi(P-N)\alpha\big)}{\pi\alpha}\,d\alpha. \] 再用狄利克雷积分(这是这里唯一要借的"已知积分"):\(\displaystyle\int_{-\infty}^{\infty}\frac{\sin(ux)}{x}\,dx=\pi\,\mathrm{sgn}(u)\),取 \(x=\alpha,\ u=2\pi c\) 并除以 \(\pi\) 得 \(\displaystyle\int_{-\infty}^{\infty}\frac{\sin(2\pi c\alpha)}{\pi\alpha}d\alpha=\mathrm{sgn}(c)\)。于是 \[ J=\frac12\big[\,\mathrm{sgn}(P+N)+\mathrm{sgn}(P-N)\,\big]=\frac12[\,1+1\,]=1\qquad(0\lt N\lt P). \] (若 \(N\gt P\) 则 \(\mathrm{sgn}(P-N)=-1\),\(J=0\)——正确地反映"\(N\) 超出范围则无解"。)所以 奇异积分 \(J=\mathbf 1_{[-P,P]}(N)=1\),含义就是"连续世界里满足 \(t=N\) 的解数 = 一个点"。
单条 \(a/q\) 主弧(\(k=1\) 现推):令 \(\alpha=\tfrac aq+\beta\),按 \(x=r+qm\) 分组,因 \(e(\tfrac aq\,qm)=e(am)=1\) 故 \(e(\tfrac aq x)=e(\tfrac aq r)\),于是 \[ T\Big(\tfrac aq+\beta\Big)\approx\Big(\underbrace{\tfrac1q\sum_{r=0}^{q-1}e(\tfrac{ar}{q})}_{=\,S(q,a)/q}\Big)\underbrace{\int e(\beta t)\,dt}_{=\,I(\beta)},\qquad\text{峰高}\ \propto\ \frac{S(q,a)}{q}. \] 再乘 \(e(-N\alpha)=e(-N\tfrac aq)\,e(-N\beta)\) 积分:算术相位 \(e(-Na/q)\) 提出来,解析因子 \(J=\int I(\beta)e(-N\beta)d\beta\)(每条弧都一样)也提出来,得 \[ \int_{a/q\,\text{附近}}T\,e(-N\alpha)\,d\alpha\ \approx\ \frac{S(q,a)}{q}\,e\Big(-\frac{Na}{q}\Big)\cdot J. \] 把所有有理点 \(a/q\) 的算术因子加起来(\(J\) 提到外面),就是下面的奇异级数,主项 \(=\mathfrak S\cdot J\)。所以 \(\mathfrak S\) = "每个有理点那座尖峰(峰高 \(=S(q,a)/q\))贡献的总和":\(J\) 管峰长什么形状(解析),\(\mathfrak S\) 管哪些有理点有峰、各占多重(算术)。
① 拆相位。 \(e(\alpha x)=e\big(\tfrac aq x\big)\,e(\beta x)\):一个算术相位 \(\times\) 一个解析相位。
② 按余数分组。 每个 \(x\) 唯一写成 \(x=r+qm\)(\(r=0,1,\dots,q-1\),\(m\) 为整数,使 \(x\in[-P,P]\))。
③ 算术相位只认 \(r\): \[ e\Big(\tfrac aq x\Big)=e\Big(\tfrac aq(r+qm)\Big)=e\Big(\tfrac aq r\Big)\,\underbrace{e(am)}_{=1}=e\Big(\tfrac{ar}q\Big), \] 因为 \(am\) 是整数 \(\Rightarrow e(am)=1\)。同一余数类里它是常数。
④ 解析相位缓变。 \(e(\beta x)=e\big(\beta(r+qm)\big)\),\(\beta\) 小、随 \(m\) 慢慢变。于是整体重排成
\[ T\Big(\tfrac aq+\beta\Big)=\sum_{r=0}^{q-1}e\Big(\tfrac{ar}q\Big)\sum_{m}e\big(\beta(r+qm)\big). \]⑤ 内层和换成积分(关键,带一个 \(1/q\))。 固定 \(r\),\(m\) 走一步则 \(x=r+qm\) 跳 \(q\) 格,所以内层是把光滑函数 \(e(\beta t)\) 每隔 \(q\) 取一个样本再相加。\(\beta\) 小时它在长度 \(q\) 内几乎不变,黎曼和 \(\approx\dfrac1q\times\)积分(间距为 \(q\) \(\Rightarrow\sum f\approx\frac1{\text{间距}}\int f\)): \[ \sum_{m}e\big(\beta(r+qm)\big)\approx\frac1q\int_{-P}^{P}e(\beta t)\,dt=\frac1q\,I(\beta)\qquad(\text{与 }r\ \text{无关}). \]
⑥ 提出来。 内层与 \(r\) 无关,提到求和号外,外层只剩高斯和: \[ T\Big(\tfrac aq+\beta\Big)\approx\Big(\sum_{r=0}^{q-1}e\big(\tfrac{ar}q\big)\Big)\frac1q\,I(\beta)=\frac{S(q,a)}{q}\,I(\beta). \]
取 \(\beta=0\):峰高 \(=\dfrac{S(q,a)}{q}\,I(0)=\dfrac{S(q,a)}{q}\cdot 2P\),正比于 \(S(q,a)/q\)。检验 \(q=1\):\(S(1,0)=1\),回到 \(T(\beta)\approx I(\beta)\)、峰高 \(2P\),正是 §4.1(新函数①)那一步——可见单条 \(a/q\) 主弧的推导和 \(q=1\) 是同一招,只是按余数分组后多结出一个高斯和 \(S(q,a)\)。- \(q=1\):唯一项 \(a=0\),\(S(1,0)=\sum_{r=0}^{0}e(0)=1\),贡献 \(\dfrac{1}{1}e(0)=1\)。
- \(q\ge2\):\(S(q,a)=\sum_{r=0}^{q-1}\big(e(a/q)\big)^r\) 是公比 \(e(a/q)\) 的等比数列,求和 \(=\dfrac{e(a/q)^q-1}{e(a/q)-1}=\dfrac{e(a)-1}{e(a/q)-1}=\dfrac{0}{\ne0}=0\)(分子 \(e(a)=1\) 因 \(a\) 是整数;分母 \(\ne0\) 因 \((a,q)=1,\ q\ge2\))。所以全部 \(q\ge2\) 的项逐个为零。
它的意义(同余障碍):\(\mathfrak S=\prod_p\beta_p\),\(\beta_p=\) "模 \(p^a\) 的解密度"。\(k=1\) 的方程是 \(x\equiv N\ (\mathrm{mod}\ p^a)\),永远恰好一个解 \(\Rightarrow\beta_p=1\Rightarrow\mathfrak S=1\):没有任何同余障碍、也没有额外加成,故算术修正为 \(1\)。(对照 §4.4 的 \(k=2\):多条主弧"活着",\(\mathfrak S\) 是它们带符号之和 = 素数局部密度之积 \(\ne1\);图 1c 里 \(\tfrac14,\tfrac34\) 那些朝下的尖峰,就是这些活弧的带符号贡献。)
两半相乘得 主项 \(=\mathfrak S\cdot J=1\times1=1\)。验证增长指数 \(\tfrac sk-1=0\),故主项 \(\sim N^0=\) 常数,与 \(r(N)\equiv1\) 吻合。表面上主弧这半给出了正确答案——但慢着,下面要泼一盆冷水。
- 奇异积分 \(J=\int_{-\infty}^{\infty}I\,e(-N\alpha)d\alpha\) 只是条件收敛(因 \(\int|I|\,d\alpha=\infty\));
- 真正的主弧 \(|\alpha|\le\delta\sim1/P\) 只截到 \(J\) 的一部分。把它老实算出来(虚部仍为奇函数 \(=0\),实部用积化和差 + 正弦积分 \(\mathrm{Si}(x)=\int_0^x\frac{\sin u}{u}du\)): \[ \int_{-\delta}^{\delta}I\,e(-N\alpha)d\alpha=\frac1\pi\Big[\mathrm{Si}\big(2\pi(P{+}N)\delta\big)+\mathrm{Si}\big(2\pi(P{-}N)\delta\big)\Big]=1+O(1), \] 因为 \(\delta\sim1/P\) 时宗量 \(2\pi(P\pm N)\delta\) 只是 \(O(1)\),\(\mathrm{Si}\) 离极限 \(\tfrac\pi2\) 还差 \(O(1)\);补到 \(\pm\infty\) 的尾巴同样是 \(O(1)\)。都不小。
(对应 §5–§6)次弧 → 误差:机器在这里卡住。 按正文套路,把次弧积分逐步放缩。第一步用三角不等式 + \(|e(-N\alpha)|=1\)(丢掉相位):
\[ \Big|\int_{\mathfrak m}T(\alpha)\,e(-N\alpha)\,d\alpha\Big|\ \le\ \int_{\mathfrak m}|T(\alpha)|\cdot\underbrace{|e(-N\alpha)|}_{=1}\,d\alpha\ =\ \int_{\mathfrak m}|T(\alpha)|\,d\alpha. \]第二步代入图 0c 的上界 \(|T(\alpha)|\le\dfrac1{2\|\alpha\|}\)。次弧 \(\mathfrak m=\{\delta\le\|\alpha\|\le\tfrac12\}\) 关于 \(\alpha\) 与 \(1-\alpha\) 对称(整数 \(0\) 与 \(1\) 两侧各一份),故
\[ \int_{\mathfrak m}|T|\,d\alpha\ \le\ 2\int_{\delta}^{1/2}\frac{1}{2\alpha}\,d\alpha\ =\ \int_{\delta}^{1/2}\frac{d\alpha}{\alpha}\ =\ \big[\ln\alpha\big]_{\delta}^{1/2}\ =\ \ln\frac{1}{2\delta}. \]取主弧宽度 \(\delta\sim 1/P\)(峰宽),得
\[ \Big|\int_{\mathfrak m}T\,e(-N\alpha)\,d\alpha\Big|\ \le\ \ln\frac{1}{2\delta}\ \sim\ \ln\frac{P}{2}\ \sim\ \log P. \]| 取胜要件 | \(k{=}2,\ s{=}5\)(正文) | \(k{=}1,\ s{=}1\)(这里) |
|---|---|---|
| 主弧:奇异积分绝对收敛(需 \(s\gt k\)) | \(5\gt2\) ✓ | \(s=k=1\) 临界,只条件收敛 ✗ |
| 次弧:比平凡界 \(P\) 小一个幂 | Weyl:\(\sup|T|\ll P^{3/4}\) ✓ | 只有 \(\tfrac1{\|\alpha\|}\),无幂节省(边界 \(\|\alpha\|\sim\tfrac1P\) 处仍 \(\sim P\))✗ |
| 次弧:变量数 \(s\) 够多 | \(s=5\)(§6 门槛)✓ | \(s=1\) 太少,连 \(\int|T|^s\) 都发散 ✗ |
(对应 §7)总账。
\[ r(N)=\underbrace{\int_{\mathfrak M}T e(-N\alpha)}_{\text{主项}=1}+\underbrace{\int_{\mathfrak m}T e(-N\alpha)}_{\text{真值小,但上界只给 }O(\log P)}. \]真相是两块加起来精确 \(=1\),所以次弧的真实贡献确实趋于 \(0\)——但那是 \(e(-N\alpha)\) 在次弧上的相位相消,而 \(|T|\) 的大小上界把相位丢了,于是只看到 \(O(\log P)\)。机器的"主项"半边成立,"误差"半边靠这条上界关不上。
1. 第一步:把"数写法"变成"算积分"
圆法的出发点是一个会让你觉得"凭什么"的操作:把一个计数问题(离散、难)翻译成一个积分问题(连续、可分析)。靠的是一条小学生都能验证的恒等式。
1.1 记号 \(e(\theta)\) 与正交关系
核心引理只有一条,是整个圆法的"开关":
这条恒等式是一台"是不是零"的探测器:你给它一个整数 \(m\),它积分出来告诉你 \(m\) 是不是 \(0\)。我们马上要用它来探测"\(x_1^2+\dots+x_5^2-N\) 是不是 \(0\)"。
1.2 指数和 \(T(\alpha)\),以及把 \(r(N)\) 写成积分
设 \(P=\lfloor\sqrt N\rfloor\)(这样每个 \(|x_i|\le\sqrt N\) 自动成立)。定义这一篇的主角——指数和:
\[ T(\alpha):=\sum_{x=-P}^{P}e(\alpha x^2). \tag{2} \]它把"所有 \(\le N\) 的平方数"打包成一个 \(\alpha\) 的函数。现在做关键一步:把它五次方再乘 \(e(-N\alpha)\) 展开:
\[ T(\alpha)^5 e(-N\alpha)=\sum_{x_1,\dots,x_5}e\big(\alpha(x_1^2+\cdots+x_5^2-N)\big). \]对 \(\alpha\) 在 \([0,1]\) 上积分,用正交关系 \((1)\):每一项里 \(m=x_1^2+\cdots+x_5^2-N\) 是整数,只有当这五个平方真的加起来等于 \(N\) 时那一项才积出 \(1\),否则积出 \(0\)。于是
左边是我们想要的离散计数,右边是一个积分。圆法的全部工作,就是估计右边这个积分。
1.3 先看一眼:取定 \(N=101\),把这三条曲线画出来
公式 \((3)\) 把 \(r(N)\) 写成了"一条曲线在 \([0,1]\) 上围出的面积"。在抽象地谈"主弧 / 次弧"之前,不如先对一个具体的 \(N\) 把曲线画出来,眼见为实。取 \(N=101\)(于是 \(P=\lfloor\sqrt{101}\rfloor=10\),\(T\) 是 \(2P+1=21\) 项之和,\(T(0)=21\))。剧透结论:下面图 1c 那条上下振荡的曲线,它在 \([0,1]\) 上的净面积(正负相抵后)精确等于 \(r(101)=\mathbf{10640}\)——我们要的答案,就整个藏在这块面积里。
2. 全局图景:\(T(\alpha)\) 在哪里大、在哪里小
积分 \((3)\) 看似无从下手,但 \(T(\alpha)\) 的形状其实非常有规律。先把它看明白,后面所有"放缩"就都顺理成章了。
2.1 在整点和简单分数处,\(T\) 会"共振"变大
先看 \(\alpha=0\):每一项 \(e(0)=1\),所以 \(T(0)=2P+1\approx 2\sqrt N\),非常大。这是因为 \(2P+1\) 个单位向量方向完全一致,全加在一起。
再看 \(\alpha\) 接近一个分母小的分数 \(a/q\),比如 \(\alpha=1/4\):此时 \(e(\alpha x^2)=e(x^2/4)\) 只依赖 \(x^2\bmod 4\)。而 \(x^2\bmod4\) 只会是 \(0\) 或 \(1\)(偶数的平方 \(\equiv0\),奇数的平方 \(\equiv1\)),所以一半的项指向 \(e(0)=1\)、一半指向 \(e(1/4)=i\),方向只有两种,又叠加出一个可观的和。分母 \(q\) 越小,"方向种类"越少、叠加越猛,\(T\) 越大。
反过来,\(\alpha\) 若是个"分母很大或干脆无理"的数,\(e(\alpha x^2)\) 的方向杂乱无章地铺满整个圆,正负相消,\(T\) 就很小。这就是平方根抵消(square-root cancellation):\(M\) 个方向随机的单位向量相加,长度典型地只有 \(\sqrt M\) 而不是 \(M\)。这里 \(M\approx 2\sqrt N\),所以"典型"的 \(|T|\) 只有 \(\big(2\sqrt N\big)^{1/2}\approx N^{1/4}\) 量级——比峰值 \(2\sqrt N\) 小得多。
2.2 圆法的中心思想:把积分劈成"信号"和"噪声"
- 主弧 \(\mathfrak M\):所有那些尖峰附近的小区间(\(\alpha\) 离某个分母 \(\le Q\) 的分数 \(a/q\) 很近)。这里 \(T\) 大、有漂亮的近似公式,贡献主项——这是"信号",要算准(用等式)。
- 次弧 \(\mathfrak m\):剩下的所有 \(\alpha\)。这里 \(T\) 小、毫无封闭公式——这是"噪声",算不出也不想算,只需证明它加起来比主项小(用不等式)。
3. 主弧:在尖峰附近,\(T\) 长什么样(高斯和登场)
这一节是 \(k=2\) 最漂亮的地方:尖峰的高度可以精确算出,而且答案出奇地干净。
3.1 把 \(T(a/q+\beta)\) 拆成"算术部分 × 解析部分"
设 \(\alpha=\dfrac aq+\beta\),其中 \(a/q\) 是既约分数、\(\beta\) 很小。按 \(x\bmod q\) 把求和分组:写 \(x=qy+r\)(\(r=0,1,\dots,q-1\))。则 \(x^2=q^2y^2+2qyr+r^2\),于是
\[ e\Big(\tfrac aq x^2\Big)=e\Big(\tfrac aq r^2\Big)\quad(\text{因为含 }q\text{ 的项让 }e\text{ 取整数幂}=1). \]而 \(e(\beta x^2)\) 随 \(x\) 缓慢变化(\(\beta\) 小)。把同余类内的和近似成积分,得到主弧上的近似公式:
这就把尖峰的高度分解成两个独立的零件:一个纯算术的高斯和(Gauss sum) \(S(q,a)\),和一个纯解析的积分。下面分别算。
3.2 高斯和恰好是 \(\sqrt q\) —— 你能亲手验证
这是整篇里最该记住的一个数:\(k=2\) 的高斯和,长度精确等于 \(\sqrt q\)——不多不少,没有任何 \(\le\)、没有任何 \(P^\varepsilon\) 的污染。一般 \(k\) 的"Weyl 和" \(\sum e(ax^k/q)\) 只能放缩到 \(\le C\,q^{1-1/k+\varepsilon}\),正是那些放缩让正文显得"不自然"。\(k=2\) 时它退化成一个干净的等式,所以这里你能看得一清二楚。
| \(r\) | 0 | 1 | 2 | 3 | 4 |
|---|---|---|---|---|---|
| \(r^2\bmod5\) | 0 | 1 | 4 | 4 | 1 |
| \(e(r^2/5)\)方向 | \(1\) | \(72^\circ\) | \(288^\circ\) | \(288^\circ\) | \(72^\circ\) |
把 \((4)\) 取绝对值,尖峰高度就是 \[ \Big|T\big(\tfrac aq+\beta\big)\Big|\approx\frac{|S(q,a)|}{q}\Big|\int e(\beta t^2)dt\Big|=\frac{\sqrt q}{q}\,|\cdots|=\frac{1}{\sqrt q}\,|\cdots|. \] 当 \(\beta=0\) 时积分 \(\approx 2P\approx2\sqrt N\),所以 \[ \Big|T\big(\tfrac aq\big)\Big|\approx \frac{2\sqrt N}{\sqrt q}. \tag{5} \] \(q\) 越大峰越矮——和图 1a 完全吻合。\(q=1\)(即 \(\alpha=0\))时回到峰值 \(2\sqrt N\)。
4. 主项:把所有尖峰的贡献加起来
第 3 节给了主弧近似 \((4)\),但只写了"\(\approx\)"、没说怎么来。这一节把每一步都补上:先把 \((4)\) 真正推出来,再代进积分 \((3)\),看主项怎样一段段长出来,最后把两个常数(\(\tfrac{4\pi^2}{3}\) 和 \(\mathfrak S(N)\))亲手算出来。
4.1 先补上:主弧近似 \((4)\) 是怎么推出来的
设 \(\alpha=\dfrac aq+\beta\)。把 \((2)\) 的求和按 \(x\) 模 \(q\) 的余数分组:每个 \(x\) 唯一写成 \(x=r+qm\),其中 \(r\in\{0,1,\dots,q-1\}\)、\(m\) 是整数。代入 \(x^2\):
\[ \tfrac aq x^2=\tfrac aq(r+qm)^2=\tfrac aq r^2+\underbrace{2arm+aqm^2}_{\text{整数}},\qquad\text{所以}\quad e\big(\tfrac aq x^2\big)=e\big(\tfrac aq r^2\big). \]也就是说,算术相位 \(e(\tfrac aq x^2)\) 只认 \(x\) 的余数 \(r\)——同一余数类里它是常数。于是
\[ T\big(\tfrac aq+\beta\big)=\sum_{r=0}^{q-1}\underbrace{e\big(\tfrac aq r^2\big)}_{\text{随 }r\text{ 跳变}}\;\sum_{m:\,r+qm\in[-P,P]}\underbrace{e\big(\beta(r+qm)^2\big)}_{\text{随 }m\text{ 缓变}}. \]内层和既然与 \(r\) 无关,就能提到求和号外,外层只剩高斯和:
\[ T\big(\tfrac aq+\beta\big)\approx\Big(\sum_{r=0}^{q-1}e\big(\tfrac aq r^2\big)\Big)\cdot\frac1q\int_{-P}^{P}e(\beta t^2)dt=\frac1q\,S(q,a)\int_{-P}^{P}e(\beta t^2)dt. \]这正是 \((4)\)。注意它天生就是"算术零件 \(\times\) 解析零件"的形状——这是后面一切"分家"的根源。
4.2 代入积分:算术与解析"自动分家"
主弧 \(\mathfrak M\) 是一堆互不相交的小区间 \(\mathfrak M(q,a)=\{\alpha:|\alpha-\tfrac aq|\le\tfrac1{qP}\}\)(\(q\le Q\),\(\gcd(a,q)=1\))。在每个小区间上写 \(\alpha=\tfrac aq+\beta\),代 \((4)\)。关键观察是那个负指数也会分家:
\[ e(-N\alpha)=e\big(-N\tfrac aq\big)\,e(-N\beta). \]于是单个小区间的积分裂成"一个纯算术常数 \(\times\) 一个纯解析积分":
\[ \int_{\mathfrak M(q,a)}T^5e(-N\alpha)\,d\alpha\approx\underbrace{\Big(\tfrac{S(q,a)}{q}\Big)^5 e\big(-N\tfrac aq\big)}_{\text{只含 }q,a}\cdot\underbrace{\int_{-1/(qP)}^{1/(qP)}\!\Big(\int_{-P}^{P}e(\beta t^2)dt\Big)^5 e(-N\beta)\,d\beta}_{\text{只含 }\beta}. \]现在对 \(a\)(\(\bmod\,q\))求和、再对 \(q\le Q\) 求和。算术那半攒成一个级数,解析那半(几乎与 \(q,a\) 无关,把积分限放宽到 \(\pm\infty\))提到外面,得
"分家"完成。下面两节分别把 \(J(N)\)(第 4.3 节)和 \(\mathfrak S(N)\)(第 4.4 节)算清楚。
4.3 奇异积分 \(J(N)\):把 \(N\) 抽干,剩一个几何常数
记 \(v(\beta)=\displaystyle\int_{-P}^{P}e(\beta t^2)dt\)。做两步换元,目的就是把所有 \(N\) 都提到积分外面。
所以 \(J(N)=\mathcal J\cdot N^{3/2}\),其中 \(\mathcal J\) 是一个不含 \(N\) 的常数。要算 \(\mathcal J\) 不必硬碰这个复积分——它有一个一眼能懂的几何意思:
- 逐项求和:\(\displaystyle\sum_{N\le X}\tfrac{4\pi^2}{3}N^{3/2}\approx\tfrac{4\pi^2}{3}\int_0^X t^{3/2}dt=\tfrac{4\pi^2}{3}\cdot\tfrac25 X^{5/2}=\tfrac{8\pi^2}{15}X^{5/2}.\)
- 直接数球:\(\displaystyle\sum_{N\le X}r(N)=\#\{\textstyle\sum x_i^2\le X\}\approx V(\sqrt X)=\tfrac{\pi^{5/2}}{\Gamma(7/2)}X^{5/2}=\tfrac{8\pi^2}{15}X^{5/2}\)(\(\Gamma(\tfrac72)=\tfrac{15}{8}\sqrt\pi\)).
4.4 奇异级数 \(\mathfrak S(N)\):拆成每个素数的"局部解密度"
解析那半已经给出几何主项。现在轮到算术那半 \(\mathfrak S(N)\)——它修正"整数不像实数那么自由"。三步走。
第一步:拆成素数乘积(Euler 乘积)。 记 \(A(q)=\sum_{(a,q)=1}\big(\tfrac{S(q,a)}{q}\big)^5 e(-N\tfrac aq)\)。用中国剩余定理可证 \(A\) 是积性的:\(A(q_1q_2)=A(q_1)A(q_2)\)(\(q_1,q_2\) 互素)。积性函数求和就能拆成每个素数的"几何级数":
\[ \mathfrak S(N)=\sum_{q\ge1}A(q)=\prod_{p}\Big(1+A(p)+A(p^2)+A(p^3)+\cdots\Big)=\prod_p\beta_p(N). \]第二步:把 \(\beta_p\) 翻译成"数同余解"。 用 \((1)\) 的离散版(在 \(\mathbb Z/p^J\mathbb Z\) 上 \(\tfrac1{p^J}\sum_{a\bmod p^J}e(\tfrac aq m)=[\,p^J\mid m\,]\))可证:
\[ 1+A(p)+\cdots+A(p^J)=\frac{M(p^J)}{p^{4J}},\qquad M(p^J):=\#\{\mathbf x\bmod p^J:\ x_1^2+\cdots+x_5^2\equiv N\}. \]所以 \(\beta_p(N)=\lim_{J\to\infty}\dfrac{M(p^J)}{p^{4J}}\) 就是"模 \(p^J\) 的世界里,五个平方凑出 \(N\) 的解所占的比例"(分母 \(p^{4J}\) 是五个自由变量去掉一个方程约束后的总数 \(p^{5J}/p^{J}\))。这就把抽象的高斯和级数变回了能用手数的同余方程。
第三步:奇素数处把 \(M(p)\) 数出来。 对奇素数 \(p\),五个平方的同余方程有一条经典计数公式(用勒让德符号 \(\big(\tfrac{\cdot}{p}\big)\)):
\[ M(p)=\#\{x_1^2+\cdots+x_5^2\equiv N \ (\mathrm{mod}\ p)\}=p^4+\Big(\tfrac Np\Big)\,p^2,\qquad\text{于是}\quad \beta_p(N)=1+\Big(\tfrac Np\Big)\frac1{p^2}. \](奇素数处密度从 \(J=1\) 起就稳定,故 \(\beta_p=M(p)/p^4\)。\(p\mid N\) 时 \(\big(\tfrac Np\big)=0\),\(\beta_p=1\)。)这个 \(\pm p^{-2}\) 就是算术对几何主项的毫厘修正。
| \(N\bmod3\) | 需要 \(k\equiv\) | \(k\) 取值 | \(M(3)=\sum\binom5k2^k\) | 对照 \(81+(\tfrac N3)9\) |
|---|---|---|---|---|
| \(1\) | \(1\) | \(1,4\) | \(\binom51 2+\binom54 2^4=10+80=90\) | \((\tfrac13)=+1\Rightarrow90\) ✓ |
| \(2\) | \(2\) | \(2,5\) | \(\binom52 2^2+\binom55 2^5=40+32=72\) | \((\tfrac23)=-1\Rightarrow72\) ✓ |
| \(0\) | \(0\) | \(0,3\) | \(\binom50+\binom53 2^3=1+80=81\) | \(3\mid N\Rightarrow81\) ✓ |
正性与下界(这才是我们真正要的)。 把上面拼起来:
- ① 每个因子都 \(>0\)
- \(\beta_p=1\pm p^{-2}\),而 \(p\ge3\) 时 \(p^{-2}\le\tfrac19<1\),所以 \(\beta_p\ge1-\tfrac19=\tfrac89>0\)。素数 \(2\) 处要单独算(模 \(8\) 的平方只能是 \(0,1,4\)),结果同样是一个确定的正数。没有任何素数把解数掐成 \(0\)——这正是"五个变量足够多,模每个 \(p^a\) 都解得开"。
- ② 乘积收敛、有正下界
- 把奇素数因子连乘,因 \(\big(\tfrac Np\big)=\pm1\),每个因子夹在 \(1-p^{-2}\) 与 \(1+p^{-2}\) 之间,于是 \[ \prod_{p\ \text{odd}}\big(1-\tfrac1{p^2}\big)\ \le\ \prod_{p\ \text{odd}}\beta_p\ \le\ \prod_{p\ \text{odd}}\big(1+\tfrac1{p^2}\big). \] 左边 \(\ge\prod_{p}(1-p^{-2})=\dfrac1{\zeta(2)}=\dfrac6{\pi^2}\approx0.61\),右边 \(\le\prod_p(1+p^{-2})=\dfrac{\zeta(2)}{\zeta(4)}=\dfrac{15}{\pi^2}\approx1.52\)。两个端点都是正常数。
注意我们没有用到平方根抵消的精细估计,只用了"每个因子 \(=1\pm p^{-2}\)"——但若只想要"收敛",连这点都不必,高斯和的粗界 \(|S(q,a)|=\sqrt q\) 已给出 \(|A(p)|\le p\cdot p^{-5/2}=p^{-3/2}\),\(\sum_p p^{-3/2}<\infty\) 即可。这里 \(5\) 个变量带来的 \(q^{-5/2}\) 是收敛的关键:变量太少(如 \(s=3\))这个级数就微妙得多(三平方和真的有例外 \(N=4^a(8b+7)\)),这是 \(s\) 不能太小的第一个信号;真正卡死下界的要求来自次弧,见第 6 节。
5. 次弧:为什么 \(T\) 在这里一定很小(全篇核心)
到这里"信号"已经算清楚了。剩下唯一的活,是证明"噪声"——次弧上的积分——比信号小。这就是你觉得"放缩不自然"的那些步骤的家。我们就 \(k=2\) 把它从因式分解一路推到底,让每个 \(\le\) 都有名有姓。
5.1 一行因式分解 + 一个等比数列:看穿 \(|T|^2\)
不要直接碰 \(T\)(它的相位没法控制),而是看 \(|T|^2=T\overline T\):
\[ |T(\alpha)|^2=\sum_{x}\sum_{y}e\big(\alpha(x^2-y^2)\big). \]关键一步——\(k=2\) 专属的因式分解:令 \(h=x-y\),则 \(x^2-y^2=(x-y)(x+y)=h(2y+h)\)。于是
\[ |T|^2=\sum_{h}e(\alpha h^2)\sum_{y}e(2\alpha h\,y). \tag{6} \]内层 \(\sum_{y}e(2\alpha h\,y)\) 是公比 \(e(2\alpha h)\) 的等比数列,项数约 \(2P\)。等比数列求和给出
\[ \Big|\sum_{y=-P}^{P}e(2\alpha h\,y)\Big|=\Big|\frac{\sin(2\pi(2P+1)\alpha h)}{\sin(2\pi\alpha h)}\Big|\le\min\Big(2P+1,\ \frac{1}{2\|2\alpha h\|}\Big), \tag{7} \]其中 \(\|\theta\|\) 表示 \(\theta\) 到最近整数的距离。这个 \(\min\) 的含义非常具体:
- 若 \(2\alpha h\) 很接近整数(\(\|2\alpha h\|\) 小)——等比数列各项几乎同向,求和接近最大值 \(2P\);
- 否则——各项转着圈相消,求和被 \(\dfrac1{2\|2\alpha h\|}\) 死死压住。
对 \((6)\) 取绝对值、用 \(|e(\alpha h^2)|=1\) 扔掉外层相位(这一步只丢相位、不丢大小),得
5.2 在尖峰附近"数一数"这个和(把分块过程写全)
现在要估 \((8)\) 右边的和。记 \(\theta=2\alpha\approx\dfrac{2a}{q}\)。被加项是 \(\min\big(2P,\ \tfrac1{2\|\theta h\|}\big)\),关键全在 \(\|\theta h\|\)(\(\theta h\) 到最近整数的距离)何时小。这一步在正文里总被一句话带过,下面把它掰成分块来数。
- 最靠近整数的那一两个 \(h\)(即 \(\|\theta h\|\) 几乎为 \(0\))触顶,贡献被 \(\min\) 截在 \(2P\);
- 其余 \(h\) 的 \(\|\theta h\|\approx\tfrac jq\)(\(j=1,2,\dots\)),贡献 \(\dfrac1{2\|\theta h\|}\approx\dfrac q{2j}\),把它们加起来: \[ \sum_{j=1}^{q/2}\frac{q}{2j}\approx\frac q2\sum_{j=1}^{q/2}\frac1j\approx\frac q2\ln q\ \ll\ q\log q. \]
把约 \(\dfrac{2P}{q}+1\) 段的贡献乘起来("每段 \(\ll 2P+q\log q\)" 乘以"段数 \(\tfrac{2P}q+1\)"):
\[ \sum_{|h|\le 2P}\min\Big(2P,\frac1{2\|\theta h\|}\Big)\ \ll\ \Big(\frac{2P}{q}+1\Big)\big(2P+q\log q\big)\ \ll\ \frac{P^2}{q}+P+q\log q. \]这三项里中间的 \(P\) 总会被另外两项盖住:\(q\le P\) 时 \(\tfrac{P^2}q\ge P\),\(q>P\) 时 \(q>P\)。把 \(\log\) 吸进 \(P^\varepsilon\),就并成干净的两项,代回 \((8)\):
\[ |T(\alpha)|^2\;\ll\;\underbrace{\frac{P^2}{q}}_{\text{近共振段:}\frac{2P}q\text{ 段}\times 2P}+\underbrace{q}_{\text{每段余项 }q\log q\text{ 累计}}\ \ll\ \Big(\frac{P^2}{q}+q\Big)P^{\varepsilon}. \tag{9} \]5.3 次弧上 \(q\) 必然不小,于是 \(T\) 必然小
主弧只收了 \(q\le Q\) 的尖峰。取 \(Q=\sqrt P\)。由狄利克雷逼近定理,次弧上的 \(\alpha\) 总能写成 \(|\alpha-a/q|\le1/q^2\) 且 \(q\) 落在 \(Q< q\le P^2/Q\),即 \(\sqrt P< q\le P^{3/2}\)。代进 \((10)\):
\[ \frac{P}{\sqrt q}<\frac{P}{P^{1/4}}=P^{3/4},\qquad \sqrt q\le P^{3/4}, \]记住 \(T\) 的峰值是 \(2P\)。在次弧上它被压到了 \(P^{3/4}\)——从 \(P^1\) 掉到了 \(P^{3/4}\),这 \(P^{1/4}\) 的差距,就是我们要拿去赢比赛的本钱。
6. 决胜局:为什么"刚好"需要 \(s=5\)
这是回答你最初问题的高潮:"那些指数 5、\(3/2\) 不是随便定的,而是'刚好够赢'所需的最小代价"。我们来数一遍指数。
6.1 一个免费的均值估计
除了"次弧上 \(T\) 小",我们还有一个对所有 \(\alpha\) 都成立的平均估计,而且它有纯组合意义:
\[ \int_0^1|T(\alpha)|^4\,d\alpha=\#\{\,x_1^2+x_2^2=x_3^2+x_4^2:\ |x_i|\le P\,\}\ll P^{2+\varepsilon}. \tag{12} \](左边按正交关系 \((1)\) 正是这个方程的解数;解数 \(\approx P^2\),主要来自"对角线" \(\{x_1,x_2\}=\{x_3,x_4\}\)。)这步是等式,不丢任何东西,免费。
6.2 把次弧积分"一拆为二"
这是圆法最经典的一招:在次弧上把 \(|T|^5\) 拆成"一个 \(\sup\) × 四个放进平均"——一半用 \((11)\) 的逐点小,一半用 \((12)\) 的平均小:
\[ \Big|\int_{\mathfrak m}T^5 e(-N\alpha)d\alpha\Big|\le\int_{\mathfrak m}|T|^5 d\alpha\le\Big(\sup_{\mathfrak m}|T|\Big)\cdot\int_0^1|T|^4 d\alpha\ll P^{3/4+\varepsilon}\cdot P^{2+\varepsilon}=P^{11/4+\varepsilon}. \tag{13} \]而主项的大小是 \[ \frac{4\pi^2}{3}N^{3/2}\,\mathfrak S(N)\asymp N^{3/2}=P^{3}. \]
\(\dfrac{11}{4}=2.75<3\),次弧严格小于主项,差距 \(P^{1/4}\)。信号赢了!🎉
6.3 为什么 \(s=4\) 会输,\(s=5\) 才赢
把同样的拆法用到 \(s=4\)(四个平方)上,主项变成 \(N^{4/2-1}=N^{1}=P^{2}\),而次弧
\[ \int_{\mathfrak m}|T|^4\le\Big(\sup_{\mathfrak m}|T|\Big)^2\int_0^1|T|^2 d\alpha\ll \big(P^{3/4}\big)^2\cdot P=P^{5/2}. \](用了 \(\int_0^1|T|^2=\#\{x_1^2=x_2^2\}\approx 2P\ll P\)。)于是 \(s=4\) 时
| \(s\) | 主项 \(=P^{s-2}\) | 次弧上界 | 谁赢 |
|---|---|---|---|
| 3 | \(P^{1}\) | \(\gg P^{1}\) | 噪声(远输) |
| 4 | \(P^{2}\) | \(P^{2.5}\) | 噪声(输) |
| 5 | \(P^{3}\) | \(P^{2.75}\) | 信号(赢) |
| 6 | \(P^{4}\) | \(P^{3.75}\) | 信号(更稳) |
7. 收官:拼出渐近公式
把三件事拼起来:
- 主弧 \(=\dfrac{4\pi^2}{3}\,\mathfrak S(N)\,N^{3/2}\,(1+o(1))\),且 \(\mathfrak S(N)\ge c_1>0\);
- 次弧 \(\ll P^{11/4+\varepsilon}=o\big(N^{3/2}\big)\)。
因为主项是正的、误差严格更小,所以对充分大的 \(N\),\(r(N)>0\):每个充分大的整数都是五个平方之和,而且写法数精确到 \(N^{3/2}\) 的主阶。圆法的机器,转完了一整圈。
8. 回看:那些"不自然的放缩",其实步步必然
- "为什么从等式退化成不等式?"
- 只在次弧上退化,因为那里没有公式、也只需要"小"这一个结论。主弧自始至终是等式(第 3–4 节)。
- "为什么放掉那么多东西(相位、Cauchy–Schwarz)?"
- 每次丢的都是相位(角度)——那是对一般 \(\alpha\) 我们唯一控制不了的东西;而且每次只丢得起一个常数或 \(P^\varepsilon\),绝不丢一个 \(P\) 的幂。\((6)\to(8)\) 丢外层相位、\((8)\to(11)\) 数 \(\min\),都是如此。
- "为什么指数是 \(\tfrac34,\tfrac{11}4,3\) 这些怪数?"
- \(\tfrac34\) 来自高斯和的 \(q^{-1/2}\) 配上次弧的 \(q\) 范围;\(3\) 是几何主项 \(N^{3/2}=P^3\);\(\tfrac{11}4\) 是"一个 \(\sup\) + 四次均值"的和。它们是算出来的,不是凑的——而 \(\tfrac{11}4<3\) 这道窄缝,就是定理成立的全部理由。
- "为什么 \(k=2\) 看着比正文清爽?"
- 因为 \(k=2\) 时高斯和是精确等式 \(|S|=\sqrt q\)、降次一次到位。正文为一般 \(k\) 写的 Weyl/Hua 不等式要把这两件事都换成"放缩版"(\(\le q^{1-1/k+\varepsilon}\)、\(k-1\) 次差分),所以才层层 \(\le\)。本质是同一台机器,只是 \(k=2\) 的零件透明。
带着这张全景图,再回去读正文第 3–6 章那些一般 \(k\) 的不等式,它们就不再"难看"——只是同一招在看不见具体数字时的样子。