Waring 问题的渐近公式Waring's problem: the asymptotic formula
问题:把一个很大的整数 \(N\) 写成 \(s\) 个正整数的 \(k\) 次幂之和 \[x_1^k+x_2^k+\cdots+x_s^k=N,\qquad x_1,\dots,x_s\ge 1,\] 一共有多少种写法?把写法的个数记作 \(r(N)\)。本章要证明:当 \(s\) 足够大(\(s\ge 2^k+1\))时,\(r(N)\) 有一个非常精确的"渐近公式" \[r(N)=C_{k,s}\,N^{s/k-1}\,\mathfrak S(N)+(\text{小误差}).\]
读完你能掌握:(1) 圆法(Hardy–Littlewood circle method)把"数解的个数"变成"算一个积分"的全套思路;(2) 把积分区间 \([0,1]\) 切成主弧与次弧的技术;(3) 三个核心新对象——指数和 \(T(\alpha)\)、奇异级数 \(\mathfrak S(N)\)、奇异积分 \(J\)——分别是什么、为什么要造它们;(4) 公式里每一个常数 \(C_{k,s}\)、每一处误差估计是怎么一步步算出来的。本讲解对原文每一段都逐句展开,凡是原文写"显然""容易看出"的地方,都补成一步一句的完整推导。
阅读方式:黑色叙述跟着 Davenport 原文的段落顺序走;彩色框(预备知识 / 分步推演 / 符号说明 / 配图)是为只有高中知识的同学补的"脚手架"。本章用到大量超出高中的记号,我们先用一节把它们从零讲清,再进入正文。
第 0 节 先把"看不懂的符号"全部讲清楚
正文第一行就会出现 \(e(-N\alpha)\)、\(\displaystyle\int_0^1\)、\(\sum\)、\(\ll\)、\(O(\cdot)\) 这些记号。它们都不在高中课本里。我们先一个一个讲,之后正文里再遇到就不重复了。
- 它的模长永远是 \(1\):\(|e(\theta)|=\sqrt{\cos^2+\sin^2}=1\)。
- 它以 1 为周期:\(\theta\) 增加 \(1\) 就是多转一整圈,回到原点,\(e(\theta+1)=e(\theta)\)。更一般地,若 \(m\) 是整数则 \(e(m)=1\)。
- 指数法则照样成立:\(e(\theta_1)e(\theta_2)=e(\theta_1+\theta_2)\),\(\overline{e(\theta)}=e(-\theta)\)(共轭就是反向转)。
- 当 \(m=0\):被积函数 \(e(0)=1\),于是 \(\int_0^1 1\,d\alpha=1\)。
- 当 \(m\neq 0\)(整数):\(e(m\alpha)=e^{2\pi i m\alpha}\),它对 \(\alpha\) 的原函数是 \(\dfrac{e^{2\pi i m\alpha}}{2\pi i m}\)。
- 代入上下限:\(\displaystyle\int_0^1 e(m\alpha)d\alpha=\frac{e^{2\pi i m}-e^{0}}{2\pi i m}=\frac{1-1}{2\pi i m}=0\),因为 \(e^{2\pi i m}=e(m)=1\)(\(m\) 是整数,转整数圈回到 \(1\))。
- \(f=O(g)\) 读作"\(f\) 是大 O 的 \(g\)",意思是:存在一个与变量无关的常数 \(C>0\),使得 \(|f|\le C\,|g|\) 对所有充分大的 \(N\)(或 \(P\))成立。例如 \(N-P^k=O(P^{k-1})\) 就是说 \(|N-P^k|\) 至多是 \(P^{k-1}\) 的常数倍。
- \(f\ll g\)(Vinogradov 记号)与 \(f=O(g)\) 完全同义,只是写起来顺手:\(f\ll g\iff |f|\le C|g|\)。
- \(\varepsilon\)(epsilon)表示"任意小的正数"。式子里出现 \(P^{\varepsilon}\) 一般意思是"差一点点、可以忽略的放大",因为对任何固定正数它都比 \(P\) 的任何正次幂小。
- 引理 3.1(Weyl 不等式型估计):若 \(\alpha\) 有有理逼近 \(|\alpha-a/q|
推论给出完全和的估计 \(q^{-1}S_{a,q}\ll q^{-1/K+\varepsilon}\)。
- 引理 3.2(Hua 不等式): \[\int_0^1|T(\alpha)|^{2^k}\,d\alpha\ll P^{2^k-k+\varepsilon}.\] 直觉:\(2^k\) 次幂的积分(数的是"\(2^k\) 个 \(k\) 次幂相减抵消"的方程解数)有一个很好的上界。它专门用来吸收次弧上 \(|T|\) 的一个 \(2^k\) 次方因子。
第 1 节 起点:把"解的个数"写成一个积分(对应 (4.1))
原文这一段在讲什么:回到上一章的出发点公式 (4.1),说明 \(r(N)\) 就是某个积分,并确定 \(P\) 该取多大、主项应该是什么量级。
原文写道:我们回到 Waring 问题工作的起点,即第 2 章的 (2.7):
\[ r(N)=\int_0^1 \big(T(\alpha)\big)^s\, e(-N\alpha)\,d\alpha. \tag{4.1} \]- 先把 \(T(\alpha)\) 的 \(s\) 次方展开。\(T(\alpha)=\sum_{x=1}^P e(\alpha x^k)\),所以 \[\big(T(\alpha)\big)^s=\Big(\sum_{x_1=1}^{P}e(\alpha x_1^k)\Big)\cdots\Big(\sum_{x_s=1}^{P}e(\alpha x_s^k)\Big).\] 按乘法分配律,这是把"每个括号里挑一项"的所有方式相乘再相加: \[\big(T(\alpha)\big)^s=\sum_{x_1=1}^{P}\cdots\sum_{x_s=1}^{P}e\big(\alpha(x_1^k+x_2^k+\cdots+x_s^k)\big),\] 这里用了指数法则 \(e(\alpha x_1^k)\cdots e(\alpha x_s^k)=e(\alpha(x_1^k+\cdots+x_s^k))\)。
- 乘上 \(e(-N\alpha)\),再用指数法则合并: \[\big(T(\alpha)\big)^s e(-N\alpha)=\sum_{x_1,\dots,x_s}e\big(\alpha\,(x_1^k+\cdots+x_s^k-N)\big).\]
- 对 \(\alpha\) 在 \([0,1]\) 上积分,把积分搬进求和号里(有限和可以逐项积): \[\int_0^1\big(T(\alpha)\big)^s e(-N\alpha)d\alpha=\sum_{x_1,\dots,x_s}\int_0^1 e\big(\alpha\,(x_1^k+\cdots+x_s^k-N)\big)d\alpha.\]
- 用正交关系 (★):括号里的 \(m=x_1^k+\cdots+x_s^k-N\) 是整数。只有当 \(m=0\)(即 \(x_1^k+\cdots+x_s^k=N\))时这一项的积分等于 \(1\),否则等于 \(0\)。
- 于是右边 = "使 \(x_1^k+\cdots+x_s^k=N\) 成立的 \((x_1,\dots,x_s)\) 组数"。这正是 \(r(N)\) 的定义。证毕。
原文接着说:其中 \(T(\alpha)\) 是 (2.5) 中那个从 \(1\) 到 \(P\) 求和的指数和,且 \(P\ge[N^{1/k}]\)。没有必要把 \(P\) 取得比所需更大,所以取 \(P=[N^{1/k}]\)。
- 每个 \(x_i\ge1\),且 \(x_i^k\le N\)(因为 \(s\) 个正项之和等于 \(N\),单独一项不会超过 \(N\))。所以 \(x_i\le N^{1/k}\)。两边取整:\(x_i\le[N^{1/k}]\)。
- 这说明:求和上限只要取到 \(P=[N^{1/k}]\) 就足够了——再大的 \(x\) 根本不可能出现在任何一组解里,它们对应的项在 (4.1) 里贡献为 \(0\),是白加的。
- 取 \([N^{1/k}]\)(向下取整)保证 \(P\) 是整数(求和上限必须是整数),并且是"刚好够用"的最小上限。这就是"没必要取更大"的含义。
原文:渐近公式中的主项将被证明具有 \(N^{s/k-1}\),亦即 \(P^{s-k}\) 的量级;事实上,只要任何简单的渐近公式成立,它就必须如此,因为这是 \(P\) 的唯一一个与下述事实相容的幂次:\(x_1,\dots,x_s\) 各有 \(P^s\) 种取法,而和 \(x_1^k+\cdots+x_s^k\) 表示的是至多 \(P^k\) 量级的数。
- \(s\) 个变量,每个 \(x_i\) 在 \(1\) 到 \(P\) 间取值,一共有 \(P\times P\times\cdots\times P=P^s\) 组取法。
- 每一组取法算出的和 \(x_1^k+\cdots+x_s^k\) 是一个介于 \(s\) 与 \(sP^k\) 之间的整数,也就是落在一个长度约为 \(sP^k\)、即量级 \(P^k\) 的范围内。
- 如果这些和"大致均匀地"散布在这 \(P^k\) 个量级的整数上,那么平均每个整数 \(N\) 被命中的次数约为 \[\frac{\text{取法总数}}{\text{落点范围}}=\frac{P^s}{P^k}=P^{s-k}.\]
- 于是 \(r(N)\) 的"应有量级"就是 \(P^{s-k}\)。又因 \(P\approx N^{1/k}\),把 \(P=N^{1/k}\) 代入得 \(P^{s-k}=N^{(s-k)/k}=N^{s/k-1}\)。两种写法 \(P^{s-k}\) 与 \(N^{s/k-1}\) 是同一回事。
第 2 节 哪些 \(\alpha\) 可以扔掉:次弧的判据(对应第 2 段)
这一段在讲什么:既然主项是 \(P^{s-k}\) 量级,那么凡是对积分贡献"严格更小"的 \(\alpha\) 区域都可以归进误差、扔掉不算。这一段给出"扔掉的判据"。
原文:于是,凡是对积分 (4.1) 的贡献能被证明严格低于 \(P^{s-k}\) 量级的那些 \(\alpha\) 取值集合,我们都可以略去。我们假设 \(s\ge 2^k+1\),若把被积表达式的绝对值看作 \[ |T(\alpha)|^{s-2^k}\,|T(\alpha)|^{2^k}, \] 那么由引理 3.2 可知:凡是满足 \(|T(\alpha)|\ll P^{1-\delta}\)(其中 \(\delta>0\) 为某固定数)的任何 \(\alpha\) 集合都可以略去。为得到这样一个 \(\alpha\) 集合,我们将使用引理 3.1。
- 设在某个 \(\alpha\) 集合 \(E\) 上,逐点都有 \(|T(\alpha)|\ll P^{1-\delta}\)(这是"\(T\) 很小"的假设,待会儿用引理 3.1 在次弧上验证它)。
- 对 \(|T|^{s-2^k}\) 这部分,逐点代入上界:\(|T(\alpha)|^{s-2^k}\ll \big(P^{1-\delta}\big)^{s-2^k}=P^{(s-2^k)(1-\delta)}\)。这是一个与 \(\alpha\) 无关的常数上界,可以提到积分外面。
- 对剩下的 \(|T|^{2^k}\),整体在 \(E\)(甚至整个 \([0,1]\))上积分,用 Hua 引理 3.2:\(\displaystyle\int_E|T|^{2^k}d\alpha\le\int_0^1|T|^{2^k}d\alpha\ll P^{2^k-k+\varepsilon}\)。
- 两部分相乘: \[\int_E|T|^s\,d\alpha\ll P^{(s-2^k)(1-\delta)}\cdot P^{2^k-k+\varepsilon}.\] 把指数加起来:\((s-2^k)(1-\delta)+(2^k-k)+\varepsilon=(s-2^k)-(s-2^k)\delta+2^k-k+\varepsilon=(s-k)-(s-2^k)\delta+\varepsilon\)。
- 因为 \(s\ge2^k+1\),有 \(s-2^k\ge1\),所以 \(-(s-2^k)\delta\le-\delta\)。只要 \(\varepsilon\) 选得比 \(\delta\) 小(\(\varepsilon\) 可任意小,\(\delta\) 固定),指数就 \(\le s-k-\delta'\),其中 \(\delta'=\delta-\varepsilon>0\)。于是 \[\int_E|T|^s\,d\alpha\ll P^{s-k-\delta'},\] 比主项 \(P^{s-k}\) 小了一个正次幂 \(P^{-\delta'}\)。∎
第 3 节 总体方案:主弧与次弧(对应第 3 段)
这一段在讲什么:介绍圆法处理 Waring 类问题的通用战略——把 \([0,1]\) 切成"主弧"和"次弧",并说明两者的分工和取舍。
原文:处理 Waring 问题及类似问题的工作中,一般性方案是把 \(\alpha\) 的取值分为两个集合:主弧(major arcs),它对渐近公式中的主项有贡献;以及次弧(minor arcs),它的贡献按上面所述方式估计,归入误差项。两个集合之间精确的分界线,在很大程度上取决于手头有哪些可用的辅助结果,并且在某种程度上可能因人的偏好而异。一般而言,处理主弧有一些强有力的(虽然略嫌繁复的)方法可用,而问题的关键在于次弧。在任何具体问题中,一旦找到了一种能成功处理次弧的方法,人们通常会发现:在该方法所允许的范围内尽可能扩大次弧是方便的,这样可以减少处理主弧所需的工作量(尽管这部分工作可能相对直接)。在本章的处理中,与本课题其他场合常见的情形相比,我们可以把主弧取得数目较少且长度较短。
分工:
- 主弧 \(\mathfrak M\):那些 \(\alpha\) 非常靠近"分母小的既约分数 \(a/q\)"的小区间。在这里 \(T(\alpha)\) 很大(接近 \(P\)),贡献了渐近公式的主项。这部分计算繁但有套路。
- 次弧 \(\mathfrak m\):主弧之外剩下的全部 \(\alpha\)。在这里 \(\alpha\) 远离一切分母小的分数,\(T(\alpha)\) 因为相位错乱而很小(\(\ll P^{1-\delta}\)),整段贡献被第 2 节的方法压进误差项。这部分是真正的难点。
第 4 节 主弧的精确定义(对应 (4.2)(4.3) 那段)
这一段在讲什么:把上面"围绕 \(a/q\) 的小区间"写成精确的数学定义,并验证这些区间互不重叠、基本落在 \([0,1]\) 内。
原文:围绕每个有理数 \(a/q\)(既约形式),我们放置一个区间
\[ \mathfrak{M}_{a,q}:\quad |\alpha-a/q|\lt P^{-k+\delta}, \tag{4.2} \]并且对下述 \(q,a\) 都这样做:
\[ 1\le q\le P^{\delta},\quad 1\le a\le q,\quad (a,q)=1. \tag{4.3} \]
- 取两个不同的既约分数中心 \(a/q\) 与 \(a'/q'\),都满足 (4.3)。它们的差 \[\Big|\frac{a}{q}-\frac{a'}{q'}\Big|=\frac{|aq'-a'q|}{qq'}.\]
- 分子 \(|aq'-a'q|\) 是整数。若两个分数不相等,则 \(aq'-a'q\neq0\)(否则交叉相乘相等就是同一个分数),所以 \(|aq'-a'q|\ge1\)。
- 分母 \(qq'\le P^\delta\cdot P^\delta=P^{2\delta}\)(因为各自 \(q,q'\le P^\delta\))。于是 \[\Big|\frac{a}{q}-\frac{a'}{q'}\Big|\ge\frac{1}{qq'}\ge\frac{1}{P^{2\delta}}=P^{-2\delta}.\] 这就是"中心间距至少 \(P^{-2\delta}\)"。
- 每个区间半长是 \(P^{-k+\delta}\),两个相邻区间各伸出半长,要想重叠就需中心距 \(<2P^{-k+\delta}\)。比较两个量级:\(P^{-2\delta}\) 与 \(2P^{-k+\delta}\)。因为 \(k\ge2\),指数 \(-2\delta\) 比 \(-k+\delta\) 大得多(\(-2\delta>-k+\delta\) 等价于 \(k>3\delta\),对小 \(\delta\) 当然成立),所以 \(P^{-2\delta}\) 远大于 \(2P^{-k+\delta}\)。
- 中心间距远大于两区间半长之和,故任何两个主弧不可能相交。∎
原文:此外,除右端的 \(1/1\) 处那个区间的右半部分外,这些区间都包含在 \(0\le\alpha\le 1\) 内;为方便起见,我们设想把那个区间向左平移一个量 \(1\),使它落到 \(\alpha=0\) 的右侧。区间 \(\mathfrak{M}_{a,q}\) 就是主弧,它们关于 \([0,1]\) 的补集构成次弧,其全体记作 \(\mathfrak{m}\)。在这些定义中,\(\delta\) 是某个固定的小正数。
- 满足 (4.3) 且 \(q=1\) 的中心只有一个:因 (4.3) 要求 \(1\le a\le q\),当 \(q=1\) 时只能取 \(a=1\),给出 \(a/q=1/1=1\)(注意 \(a=0\) 不被允许)。所以在右端点 \(\alpha=1\) 处恰有一个主弧,其中心就是 \(1\)。
- 围绕 \(\alpha=1\)(即 \(1/1\))的区间 \(|\alpha-1|
1\) 去了,超出 \([0,1]\)。
- 但被积函数 \(T(\alpha)^s e(-N\alpha)\) 以 \(1\) 为周期(因为 \(T,\ e(-N\alpha)\) 都以 \(1\) 为周期,整数处复指数回到 \(1\))。所以把超出 \([0,1]\) 那半段向左平移 \(1\),它就接到 \(\alpha=0\) 的右边,和围绕 \(\alpha=0\) 的左半段拼成一个完整区间,积分值不变。这就是"想象平移一个量 1"。
- 处理好端点后:所有主弧的并记作 \(\mathfrak M\),\([0,1]\) 里剩下的部分(补集)就是次弧 \(\mathfrak m\)(花体小写 m)。
原文末尾的备注:可以指出,在 Hardy–Littlewood 方法的许多应用中,(4.2) 中 \(\mathfrak{M}_{a,q}\) 的长度会带有一个因子 \(q^{-1}\) 以及 \(P\) 的某个负幂;但此处不需要这个因子,省略它是一个轻微的简化。
第 5 节 引理 4.1:次弧的贡献确实小
这一段在讲什么:正式证明"次弧 \(\mathfrak m\) 上 \(\int|T|^s\) 比主项 \(P^{s-k}\) 小一个正次幂",从而次弧整体可以归入误差。
第一步:Dirichlet 逼近定理给每个 \(\alpha\) 一个好分数。原文:"由 Dirichlet 关于丢番图逼近的经典结果,每个 \(\alpha\) 都有一个有理逼近 \(a/q\) 满足 \[1\le q\le P^{k-\delta},\quad |\alpha-a/q|\lt q^{-1}P^{-k+\delta}.\tag{4.4}\] 此外,当 \(0\lt\alpha\lt1\) 时我们总有 \(1\le a\le q\)。"
- 它为什么对?(鸽笼原理)考虑 \(Q+1\) 个数 \(0,\{\alpha\},\{2\alpha\},\dots,\{Q\alpha\}\)(\(\{\cdot\}\) 是小数部分),它们都落在 \([0,1)\)。把 \([0,1)\) 等分成 \(Q\) 个小段,\(Q+1\) 个数放进 \(Q\) 个段,必有两个落在同一段(鸽笼原理),设是 \(\{i\alpha\}\) 与 \(\{j\alpha\}\)(\(i>j\)),则 \(|(i-j)\alpha-(\text{某整数 }a)|<1/Q\)。取 \(q=i-j\le Q\) 即得 \(|q\alpha-a|<1/Q\),除以 \(q\) 得 \(|\alpha-a/q|<1/(qQ)\)。
- 怎么得到 (4.4)?在本章里取 \(Q=P^{k-\delta}\)。代入:存在 \(a/q\),\(1\le q\le P^{k-\delta}\),且 \[|\alpha-a/q|<\frac{1}{q\,P^{k-\delta}}=q^{-1}P^{-(k-\delta)}=q^{-1}P^{-k+\delta}.\] 这正是 (4.4)。
- 为何 \(0<\alpha<1\) 时 \(1\le a\le q\)?因 \(\alpha\in(0,1)\) 且 \(a/q\) 离 \(\alpha\) 很近,故 \(a/q\) 也大致在 \((0,1)\) 内,于是分子 \(a\) 介于 \(1\) 与 \(q\) 之间(必要时调整 \(a\) 取最靠近的那个)。
第二步:在次弧上分母 \(q\) 必大。原文:"由于 (4.4) 中最后一个不等式比 (4.2) 中的更强,若 \(q\le P^\delta\),则 \(\alpha\) 应当落在某个 \(\mathfrak M_{a,q}\) 中。因此,若 \(\alpha\) 落在 \(\mathfrak m\) 中,我们必有 \(q>P^\delta\)。"
- (4.4) 给的逼近误差是 \(|\alpha-a/q|
更小(更强)。换句话说,(4.4) 的 \(a/q\) 离 \(\alpha\) 比"落入主弧所需"还近。
- 假设 \(q\le P^\delta\)。那么这个 \(a/q\) 满足 (4.3) 的全部条件(\(1\le q\le P^\delta,\ 1\le a\le q,\ (a,q)=1\)),它就是一个合法的主弧中心;而 \(\alpha\) 离它 \(
- 但 \(\alpha\) 在次弧 \(\mathfrak m\) 里,按定义不在任何主弧里——矛盾。所以假设错误,必有 \(q>P^\delta\)。
第三步:分母大 ⟹ \(T\) 小(用引理 3.1)。原文:"由于 \(|\alpha-a/q|
- 验证引理 3.1 的前提 \(|\alpha-a/q|
由 (4.4) 与 \(q\le P^{k-\delta}\): \[|\alpha-a/q|
- 引理 3.1 给的上界。它是 \(|T(\alpha)|\ll P^{1+\varepsilon}\big(\tfrac1q+\tfrac1P+\tfrac{q}{P^k}\big)^{1/K}\),\(K=2^{k-1}\)。我们要说明括号里的三项都 \(\ll P^{-\delta}\):
- \(\tfrac1q
P^\delta\));
- \(\tfrac1P=P^{-1}\le P^{-\delta}\)(因 \(\delta<1\));
- \(\tfrac{q}{P^k}\le\tfrac{P^{k-\delta}}{P^k}=P^{-\delta}\)(因 \(q\le P^{k-\delta}\),即原文说的 \(P^k/q\ge P^\delta\))。
- 三项都 \(\ll P^{-\delta}\),故括号 \(\ll P^{-\delta}\),取 \(1/K\) 次方得括号\(^{1/K}\ll P^{-\delta/K}\)。代回: \[|T(\alpha)|\ll P^{1+\varepsilon}\cdot P^{-\delta/K}=P^{1+\varepsilon-\delta/K}.\] 这就是原文的 \(|T(\alpha)|\ll P^{1+\varepsilon-\delta/K}\)。
- 由于 \(\varepsilon\) 可任意小、\(\delta/K\) 固定为正,这个指数 \(1+\varepsilon-\delta/K\) 严格小于 \(1\),正是第 2 节需要的"\(|T|\ll P^{1-\delta_0}\)"形式(这里 \(\delta_0=\delta/K-\varepsilon>0\))。
- 引理 3.1 给的上界。它是 \(|T(\alpha)|\ll P^{1+\varepsilon}\big(\tfrac1q+\tfrac1P+\tfrac{q}{P^k}\big)^{1/K}\),\(K=2^{k-1}\)。我们要说明括号里的三项都 \(\ll P^{-\delta}\):
第四步:拼起来。原文:"按前面指出的方式把它与引理 3.2 结合,我们推出 \[\int_{\mathfrak m}|T(\alpha)|^s\,d\alpha\ll P^{(s-2^k)(1+\varepsilon-\delta/K)}\int_0^1|T(\alpha)|^{2^k}\,d\alpha\ll P^{s-k-\delta'},\] 其中 \(\delta'>0\) 依赖于 \(\delta\)。这就证明了引理 4.1。"
- 在 \(\mathfrak m\) 上把 \(|T|^s=|T|^{s-2^k}\cdot|T|^{2^k}\)。逐点代第三步的上界处理前一半:\(|T|^{s-2^k}\ll P^{(s-2^k)(1+\varepsilon-\delta/K)}\),提到积分外。
- 剩下的 \(|T|^{2^k}\) 在 \(\mathfrak m\subseteq[0,1]\) 上积分,用 Hua 引理 3.2:\(\le\int_0^1|T|^{2^k}\ll P^{2^k-k+\varepsilon}\)。
- 相乘,指数相加: \[(s-2^k)(1+\varepsilon-\delta/K)+(2^k-k+\varepsilon).\] 展开第一项:\((s-2^k)+(s-2^k)\varepsilon-(s-2^k)\delta/K\)。全部相加: \[\underbrace{(s-2^k)+(2^k-k)}_{=\,s-k}+\underbrace{(s-2^k+1)\varepsilon}_{\text{可任意小}}-\underbrace{(s-2^k)\tfrac{\delta}{K}}_{\ge\,\delta/K\,>\,0}.\]
- 因 \(s\ge2^k+1\Rightarrow s-2^k\ge1\),那项负贡献至少是 \(-\delta/K\)。选 \(\varepsilon\) 充分小,使 \((s-2^k+1)\varepsilon<\tfrac{\delta}{2K}\),则总指数 \(\le s-k-\tfrac{\delta}{2K}\)。取 \(\delta'=\tfrac{\delta}{2K}>0\) 即得 \[\int_{\mathfrak m}|T|^s\,d\alpha\ll P^{s-k-\delta'}.\]∎
原文补充:可以指出,除了诉诸 Dirichlet 定理之外,也可以利用连分数的一个简单性质:若取 \(a/q\) 为满足 \(q\le P^{k-\delta}\) 的 \(\alpha\) 的最后一个渐近分数,同样得到 (4.4)。
第 6 节 走向主弧:\(T(\alpha)\) 在主弧上几乎不变(对应"现在我们把注意力转向主弧"那段)
这一段在讲什么:动机铺垫。说明在如此短的主弧上,\(T(\alpha)\) 变化很平缓,为下面引理 4.2 把 \(T\) 近似成"完全和 × 积分"做准备。
原文:现在我们把注意力转向主弧 \(\mathfrak M_{a,q}\)。这里 \(\alpha\) 非常接近 \(a/q\),且 \(q\) 相对较小。如果 (4.2) 中 \(P\) 的指数取的是 \(-k-\delta\) 而非 \(-k+\delta\),则 \(T(\alpha)\) 在 \(\mathfrak M_{a,q}\) 上将几乎是常数,因为那时我们应有 \[\left|\alpha x^k-\frac{a}{q}x^k\right|\lt P^{-k-\delta}P^k=P^{-\delta}.\] 当然,情形并非如此,但尽管如此,弧 \(\mathfrak M_{a,q}\) 是如此之短,以至于 \(T(\alpha)\) 在该区间上的变化相对平缓。它究竟如何变化,可由下面的引理看出。
- 把 \(\alpha\) 写成 \(\alpha=\dfrac aq+\beta\),\(\beta\) 是"\(\alpha\) 偏离中心 \(a/q\) 的小量"。则 \(T\) 的每一项相位 \(\alpha x^k=\dfrac aq x^k+\beta x^k\)。其中 \(\dfrac aq x^k\) 只依赖 \(x\bmod q\)(因 \(e(\tfrac aq x^k)\) 以 \(q\) 为周期),是"主结构";\(\beta x^k\) 是"扰动"。
- 扰动的大小:\(|\beta x^k|\le|\beta|P^k\)(因 \(x\le P\))。假如区间半长是 \(P^{-k-\delta}\)(即 \(|\beta|
几乎是常数。
- 但实际半长是 \(P^{-k+\delta}\)(指数是 \(+\delta\) 不是 \(-\delta\)),于是 \(|\beta x^k|\) 可达 \(P^{+\delta}\to\infty\),扰动不可忽略,\(T\) 并非常数。
- 不过区间仍然极短,扰动是"缓慢、有规律"的——\(\beta x^k\) 随 \(x\) 平滑变化。这提示我们:可以把"对 \(x\) 求和"近似成"对连续变量积分",扰动部分恰好变成积分 \(I(\beta)=\int_0^P e(\beta\xi^k)d\xi\)。这正是引理 4.2 要做的。
第 7 节 引理 4.2:在主弧上把 \(T(\alpha)\) 拆成"完全和 × 积分"
- \(\beta\)(beta):\(\alpha\) 相对主弧中心 \(a/q\) 的偏移量,\(\beta=\alpha-a/q\),满足 \(|\beta|
- \(S_{a,q}\)(完全指数和 / 高斯型和):把 \(z\) 取遍模 \(q\) 的一组完全剩余 \(1,\dots,q\),对 \(e(az^k/q)\) 求和。它只依赖算术信息(\(a,q,k\)),与 \(P\)、与 \(\alpha\) 的精细位置无关,捕捉了"\(k\) 次幂模 \(q\) 的分布"。后面奇异级数就由它搭成。
- \(I(\beta)\)(积分 / 连续模型):把求和 \(\sum e(\beta x^k)\) 换成积分 \(\int_0^P e(\beta\xi^k)d\xi\)。它只依赖分析信息(实数 \(k\) 次幂的均匀分布),是"把整数换成实数"的连续逼近。后面奇异积分由它搭成。
第一步:按剩余类合并。原文:"我们把定义 \(T(\alpha)\) 的和中那些位于同一剩余类(模 \(q\))的 \(x\) 值收集到一起……令 \(x=qy+z\),\(1\le z\le q\)……得到 \[T(\alpha)=\sum_{z=1}^{q}e(az^k/q)\sum_{y}e(\beta(qy+z)^k).\]"
- 动机:相位 \(\alpha x^k=\tfrac aq x^k+\beta x^k\)。第一块 \(e(\tfrac aq x^k)\) 关于 \(x\) 以 \(q\) 为周期(把 \(x\) 加 \(q\),\(\tfrac aq(x+q)^k\) 与 \(\tfrac aq x^k\) 相差整数倍 \(a\),\(e\) 不变)。所以按 \(x\bmod q\) 分类,每类内第一块取相同值,自然该合并。
- 代换:每个 \(1\le x\le P\) 唯一写成 \(x=qy+z\),其中 \(z\in\{1,\dots,q\}\) 是类代表,\(y\ge0\) 是"第几圈"。代入相位: \[\alpha x^k=\frac aq(qy+z)^k+\beta(qy+z)^k.\]
- 看第一块 \(\dfrac aq(qy+z)^k\)。把 \((qy+z)^k\) 二项展开,除了末项 \(z^k\),其余每项都含因子 \(q\),乘上 \(\tfrac aq\) 后是整数倍。所以 \(e\big(\tfrac aq(qy+z)^k\big)=e\big(\tfrac aq z^k\big)\)——只剩 \(z\),与 \(y\) 无关。这步是关键化简。
- 于是 \[T(\alpha)=\sum_{x=1}^P e(\alpha x^k)=\sum_{z=1}^q e\Big(\frac{a z^k}{q}\Big)\sum_{y}e\big(\beta(qy+z)^k\big),\] 内层 \(y\) 取遍使 \(1\le qy+z\le P\) 的整数(范围依赖 \(z\))。外层那个 \(\sum_{z=1}^q e(az^k/q)\) 正是 \(S_{a,q}\) 的"积木",但注意此处它还乘着内层依赖 \(z\) 的和,尚未完全分离。
第二步:把内层求和换成积分(理想情形)。原文:把离散 \(y\) 换成连续 \(\eta\),再换元 \(\xi=q\eta+z\),\(\xi\) 跑遍 \([0,P]\),得 \[\sum_y e(\beta(qy+z)^k)\approx q^{-1}\int_0^P e(\beta\xi^k)\,d\xi=q^{-1}I(\beta),\] 因子 \(q^{-1}\) 来自 \(d\eta/d\xi\)。这恰好给出 (4.5) 的主项。
- 把内层和 \(\sum_y f(y)\)(\(f(y)=e(\beta(qy+z)^k)\))近似为 \(\int f(\eta)d\eta\)。
- 换元 \(\xi=q\eta+z\),则 \(\eta=(\xi-z)/q\),\(d\eta=\dfrac{d\xi}{q}\)。当 \(\eta\) 跑使 \(0
- 代回第一步: \[T(\alpha)\approx\sum_{z=1}^q e\Big(\frac{az^k}{q}\Big)\cdot q^{-1}I(\beta)=q^{-1}\Big(\sum_{z=1}^q e(az^k/q)\Big)I(\beta)=q^{-1}S_{a,q}\,I(\beta).\] 注意 \(I(\beta)\) 与 \(z\) 无关,可提出求和号外,外层求和就恰好凑成 \(S_{a,q}\)。这就是 (4.5) 的主项 \(q^{-1}S_{a,q}I(\beta)\)。剩下要做的,是证明"求和换积分"造成的误差确实只有 \(O(P^{2\delta})\)。
第三步:估计"求和 − 积分"的误差。原文用了一个粗糙但够用的引理:若 \(f\) 可微,则当 \(|\eta-y|\le\tfrac12\) 时 \(|f(\eta)-f(y)|\le\tfrac12\max|f'|\);从而对任意区间 \(A<\eta
- 为什么"和−积分"的误差是 \((B-A)\max|f'|+\max|f|\)?把 \([A,B]\) 切成长度 \(1\) 的小段。在每个长度 \(1\) 的小段上,整数点 \(y\) 处的 \(f(y)\) 与该段积分 \(\int f\) 的差,至多是 \(f\) 在段内的波动 \(\le\max|f'|\)(中值定理:\(f\) 在长 \(1\) 区间变化不超过其导数最大值)。共约 \(B-A\) 段,累计 \(\ll(B-A)\max|f'|\);两端不完整的"残段"再补一个 \(\max|f|\)。合起来就是该式。
- 算 \(\max|f'|\)。\(f(\eta)=e(\beta(q\eta+z)^k)=e^{2\pi i\beta(q\eta+z)^k}\),链式法则求导: \[f'(\eta)=2\pi i\,\beta\cdot k(q\eta+z)^{k-1}\cdot q\cdot f(\eta).\] 取模(\(|f|=1,\ |2\pi i|=2\pi,\ |q\eta+z|\le P\)):\(|f'(\eta)|\le 2\pi k\,q\,|\beta|\,P^{k-1}\ll q|\beta|P^{k-1}\)。
- 算 \(B-A\)。\(y\) 的范围由 \(0
- 代入合并。 \[(B-A)\max|f'|+\max|f|\ll\frac Pq\cdot q|\beta|P^{k-1}+1=|\beta|P^{k}+1.\] 由主弧定义 \(|\beta|
- 外层对 \(z\) 求和。外面有 \(q\) 个 \(z\)(\(z=1,\dots,q\)),每个带 \(\ll P^\delta\) 的误差,且 \(|e(az^k/q)|=1\) 不放大。总误差 \(\ll q\cdot P^\delta\le P^\delta\cdot P^\delta=P^{2\delta}\)(用了 \(q\le P^\delta\))。这正是 (4.5) 里的 \(O(P^{2\delta})\)。∎
- 代入合并。 \[(B-A)\max|f'|+\max|f|\ll\frac Pq\cdot q|\beta|P^{k-1}+1=|\beta|P^{k}+1.\] 由主弧定义 \(|\beta|
原文补充:稍后在引理 9.1 中,我们将遇到一种更有效的、用对应积分替换求和的方法。(这里用的是最粗糙够用的版本,足以得到 \(O(P^{2\delta})\)。)
第 8 节 引理 4.3:把主弧的积分整体算成"奇异级数 × 奇异积分"
- \(\mathfrak S(P^\delta,N)\)(截断奇异级数,花体 S):把每个主弧贡献的算术因子 \((q^{-1}S_{a,q})^s e(-Na/q)\) 对所有 \(q\le P^\delta\)、所有与 \(q\) 互素的 \(a\) 求和。它是"算术信息"的总和。"截断"指 \(q\) 只加到 \(P^\delta\)(真正的奇异级数 (4.12) 加到 \(\infty\))。
- \(J(P^\delta)\)(截断奇异积分):把分析因子整理成一个对 \(\gamma\)(\(=\beta P^k\) 的标准化变量)在 \(|\gamma|
第一步:把 (4.5) 提到 \(s\) 次幂。原文:由 \(|q^{-1}S_{a,q}I(\beta)|\le P\) 平凡成立, \[(T(\alpha))^s=(q^{-1}S_{a,q})^s(I(\beta))^s+O(P^{s-1+2\delta}).\tag{4.11}\]
- 记 \(A=q^{-1}S_{a,q}I(\beta)\)(主项),\(T=A+E\),其中 \(E=O(P^{2\delta})\) 是 (4.5) 的误差。要估计 \(T^s-A^s=(A+E)^s-A^s\)。
- 用二项式:\((A+E)^s-A^s=\binom s1 A^{s-1}E+\binom s2 A^{s-2}E^2+\cdots\)。每一项都含至少一个 \(E\),最大的一项是 \(s A^{s-1}E\)。
- "平凡上界" \(|A|=|q^{-1}S_{a,q}I(\beta)|\le P\):因为 \(|q^{-1}S_{a,q}|\le1\)(\(S_{a,q}\) 是 \(q\) 个模长 \(1\) 的项之和,\(|S_{a,q}|\le q\),除以 \(q\) 得 \(\le1\)),且 \(|I(\beta)|=|\int_0^P e(\beta\xi^k)d\xi|\le\int_0^P1\,d\xi=P\)。故 \(|A|\le P\)。
- 于是主误差项 \(\ll P\cdot|A|^{s-1}\cdot|E|\)?更直接:\(|T^s-A^s|\ll|A|^{s-1}|E|\ll P^{s-1}\cdot P^{2\delta}=P^{s-1+2\delta}\)(高次 \(E\) 项更小,被吸收)。这就是 (4.11) 的误差 \(O(P^{s-1+2\delta})\)。
第二步:取主项,乘 \(e(-N\alpha)\) 在单个主弧上积分。因为 \(\alpha=a/q+\beta\),\(e(-N\alpha)=e(-Na/q)e(-N\beta)\),主项给出 \[(q^{-1}S_{a,q})^s e(-Na/q)\int_{|\beta|
与 \(q,a\) 无关,故对满足 (4.3) 的 \(q,a\) 求和,算术因子凑成 \(\mathfrak S(P^\delta,N)\): \[\mathfrak S(P^\delta,N)\int_{|\beta|
- 主弧 \(\mathfrak M_{a,q}\) 上积分即对 \(\beta\) 在 \(|\beta|
- 被积主项 \((q^{-1}S_{a,q})^s(I(\beta))^s e(-Na/q)e(-N\beta)\) 中,\((q^{-1}S_{a,q})^s e(-Na/q)\) 与 \(\beta\) 无关,提到积分外。剩下 \(\int_{|\beta|
- 这个 \(\beta\)-积分里没有 \(a,q\)(\(I(\beta)\) 只含 \(\beta\)),对所有主弧都一模一样。所以把所有主弧加起来时,它作为公因子提出,前面剩下 \(\sum_{q\le P^\delta}\sum_{(a,q)=1}(q^{-1}S_{a,q})^se(-Na/q)=\mathfrak S(P^\delta,N)\)。算术求和与分析积分就此分离成两个独立因子。
第三步:把 \(N\) 换成 \(P^k\),并标准化得 \(P^{s-k}J(P^\delta)\)。原文:因 \(N-P^k\ll P^{k-1}\),故 \(|e(-\beta N)-e(-\beta P^k)|\ll|\beta|P^{k-1}\ll P^{-1+\delta}\),从而把 \(N\) 换 \(P^k\) 在积分中产生的误差 \(\ll P^{-k+\delta}P^sP^{-1+\delta}\);配上 \(|\mathfrak S|\ll P^{2\delta}\) 的粗估,最终误差 \(P^{s-k-1+4\delta}\) 可忽略。换好后再令 \(\xi=P\xi',\ \beta=P^{-k}\gamma\),积分变成 \(P^{s-k}J(P^\delta)\)。
- \(N-P^k\ll P^{k-1}\) 为什么?\(P=[N^{1/k}]\) 是 \(N^{1/k}\) 向下取整,故 \(P\le N^{1/k}
- 替换误差。\(e(-\beta N)-e(-\beta P^k)=e(-\beta P^k)\big(e(-\beta(N-P^k))-1\big)\)。用 \(|e(\theta)-1|=|e^{2\pi i\theta}-1|\le2\pi|\theta|\)(单位圆上弦长 \(\le\) 弧长):
\[|e(-\beta N)-e(-\beta P^k)|\le2\pi|\beta||N-P^k|\ll|\beta|P^{k-1}.\]
再用 \(|\beta|
- 这误差在整段积分里的累积。被积的 \((I(\beta))^s\) 模 \(\le P^s\),积分区间长 \(\ll P^{-k+\delta}\),所以换 \(N\to P^k\) 在 \(\beta\)-积分里造成的误差 \(\ll P^{-k+\delta}\cdot P^s\cdot P^{-1+\delta}=P^{s-k-1+2\delta}\)。再乘上算术因子的粗估 \(|\mathfrak S(P^\delta,N)|\ll P^{2\delta}\),总误差 \(\ll P^{s-k-1+4\delta}\)。因含 \(P^{-1}\)(再减小 \(1\) 次幂),比主项 \(P^{s-k}\) 小,可忽略。
- 为什么 \(|\mathfrak S(P^\delta,N)|\ll P^{2\delta}\)?项数:\(q\le P^\delta\) 有 \(\le P^\delta\) 个,每个 \(q\) 的 \(a\) 有 \(\le q\le P^\delta\) 个,共 \(\ll P^{2\delta}\) 项;每项 \(|(q^{-1}S_{a,q})^se(-Na/q)|\le1\)(因 \(|q^{-1}S_{a,q}|\le1\))。故总和 \(\ll P^{2\delta}\)。
- 标准化换元。现在积分是 \(\int_{|\beta|
第四步:误差项 (4.11) 的总影响。原文:(4.11) 的误差 \(O(P^{s-1+2\delta})\) 在 \(|\beta|
- 单个主弧上误差 \(O(P^{s-1+2\delta})\) 是逐点上界,乘以积分区间长度 \(\ll P^{-k+\delta}\):\(P^{s-1+2\delta}\cdot P^{-k+\delta}=P^{s-k-1+3\delta}\)。
- 对所有主弧求和,主弧个数 \(\ll P^{2\delta}\)(上条数过):\(P^{s-k-1+3\delta}\cdot P^{2\delta}=P^{s-k-1+5\delta}\)。
- 关键是出现了 \(-1\)(来自 \(s-1\) 的那个 \(-1\)),它代表"比主项少一个 \(P\) 的一次幂"。只要 \(\delta\) 取得足够小(使 \(5\delta<1\)),就有 \(s-k-1+5\delta
0\)),故误差 \(\ll P^{s-k-\delta'}\)。引理 4.3 证毕。∎
第 9 节 奇异级数的定义与收敛(对应"定义"与其后一段)
- 为什么引入?引理 4.3 的主项里含 \(\mathfrak S(P^\delta,N)\),但它依赖 \(P\)(随 \(N\) 变),不是一个干净的、只跟 \(N\) 有关的量。我们希望主项写成"常数 × \(N\) 的幂 × 一个纯算术量"。把上限推到无穷得到的 \(\mathfrak S(N)\),就是那个不依赖 \(P\) 的纯算术量,它只编码"\(k\) 次幂在各模 \(q\) 下的分布信息"。
- "奇异"二字(singular)的来历:这是 Hardy–Littlewood 的历史命名,指它来自圆周上靠近有理点("奇点")的贡献之和,并非"奇怪"之意。
- 它的算术意义(下节正文会点明、下一章详证):\(\mathfrak S(N)\) 等于一串"局部密度"之积,反映方程 \(x_1^k+\cdots+x_s^k\equiv N\pmod{q}\) 在各 \(q\) 下有多少解。整数受同余约束,故 \(\mathfrak S(N)\) 充当对"实数密度"的修正因子。
原文:这称为将 \(N\) 表示为 \(s\) 个正整数 \(k\) 次幂之和这一问题的奇异级数。若 \(s\ge2^k+1\),则该级数绝对收敛,且关于 \(N\) 一致收敛;因为由引理 3.1 的推论我们有(其中 \(K=2^{k-1}\)): \[|(q^{-1}S_{a,q})^s e(-Na/q)|\ll q^{-s/K+\varepsilon}\ll q^{-2-1/K+\varepsilon}.\] 稍后我们将证明:在更宽松的条件 \(s\ge 2k+1\) 下,同样的结论也成立。
- 单项的大小。引理 3.1 的推论给出完全和的估计 \(|q^{-1}S_{a,q}|\ll q^{-1/K+\varepsilon}\)(\(K=2^{k-1}\))。取 \(s\) 次方:\(|(q^{-1}S_{a,q})^s|\ll q^{-s/K+s\varepsilon}\)。又 \(|e(-Na/q)|=1\) 不影响大小。把 \(s\varepsilon\) 重新记成 \(\varepsilon\)(仍任意小),得每项 \(\ll q^{-s/K+\varepsilon}\)。
- 代入 \(s\ge2^k+1\)。注意 \(2^k=2\cdot2^{k-1}=2K\),故 \(s\ge2^k+1=2K+1\),于是 \[\frac sK\ge\frac{2K+1}{K}=2+\frac1K.\] 所以每项 \(\ll q^{-s/K+\varepsilon}\le q^{-2-1/K+\varepsilon}\)。这正是原文那行。
- 对 \(a\) 求和。固定 \(q\),内层 \(a\) 至多 \(q\) 个,每个 \(\ll q^{-2-1/K+\varepsilon}\),故内层和 \(\ll q\cdot q^{-2-1/K+\varepsilon}=q^{-1-1/K+\varepsilon}\)。
- 对 \(q\) 求和。剩下 \(\sum_{q=1}^\infty q^{-1-1/K+\varepsilon}\)。这是一个 \(p\)-级数 \(\sum q^{-p}\),指数 \(p=1+\tfrac1K-\varepsilon\)。只要 \(\varepsilon<\tfrac1K\),就有 \(p>1\),\(p\)-级数收敛(高中数学/微积分基本事实:\(\sum q^{-p}\) 当 \(p>1\) 时收敛)。
- 故整个双重级数绝对收敛。又因每项上界 \(q^{-2-1/K+\varepsilon}\) 与 \(N\) 无关,按 Weierstrass M-判别法,收敛关于 \(N\) 是一致的(这保证下一节可以把 \(\mathfrak S(P^\delta,N)\) 安全换成 \(\mathfrak S(N)\))。∎
第 10 节 主定理 4.1 及其证明
- \(C_{k,s}\):一个只依赖 \(k,s\) 的正常数,由 Gamma 函数给出("连续密度常数")。
- \(N^{s/k-1}\):主项的量级(第 1 节已猜到)。
- \(\mathfrak S(N)\):奇异级数,编码同余约束的修正。
第一步:合并主弧与次弧。由 (4.1) 把积分拆成主弧与次弧两块,分别用引理 4.3 与 4.1: \[\begin{aligned}r(N)&=\Big\{\int_{\mathfrak M}+\int_{\mathfrak m}\Big\}(T(\alpha))^se(-N\alpha)d\alpha\\&=P^{s-k}\mathfrak S(P^\delta,N)J(P^\delta)+O(P^{s-k-\delta'}).\end{aligned}\tag{4.15}\]
- \([0,1]=\mathfrak M\cup\mathfrak m\)(主弧并次弧),且两者不交,故 \(\int_0^1=\int_{\mathfrak M}+\int_{\mathfrak m}\)。
- 主弧块 \(=P^{s-k}\mathfrak S(P^\delta,N)J(P^\delta)+O(P^{s-k-\delta'})\)(引理 4.3)。
- 次弧块:\(\big|\int_{\mathfrak m}(T)^se(-N\alpha)d\alpha\big|\le\int_{\mathfrak m}|T|^sd\alpha\ll P^{s-k-\delta'}\)(引理 4.1;用了 \(|e(-N\alpha)|=1\)),整块归入误差。
- 相加即 (4.15)。下面把 \(\mathfrak S(P^\delta,N)\to\mathfrak S(N)\)、\(J(P^\delta)\to J\)、\(P\to N^{1/k}\),并算出 \(J\)。
第二步:把奇异积分 \(J(P^\delta)\) 的积分上限推到无穷。原文:先把内层积分用三种方式改写: \[\int_0^1 e(\gamma\xi^k)d\xi=k^{-1}\int_0^1\zeta^{-1+1/k}e(\gamma\zeta)d\zeta=k^{-1}\gamma^{-1/k}\int_0^{\gamma}\zeta^{-1+1/k}e(\zeta)d\zeta\quad(\gamma>0).\]
- 第一个等号(令 \(\zeta=\xi^k\))。在 \(\int_0^1 e(\gamma\xi^k)d\xi\) 中令 \(\zeta=\xi^k\),则 \(\xi=\zeta^{1/k}\),\(d\xi=\tfrac1k\zeta^{1/k-1}d\zeta=\tfrac1k\zeta^{-1+1/k}d\zeta\);\(\xi:0\to1\) 对应 \(\zeta:0\to1\)。代入: \[\int_0^1 e(\gamma\xi^k)d\xi=\int_0^1 e(\gamma\zeta)\cdot\tfrac1k\zeta^{-1+1/k}d\zeta=k^{-1}\int_0^1\zeta^{-1+1/k}e(\gamma\zeta)d\zeta.\]
- 第二个等号(令 \(\zeta=t/\gamma\) 把 \(\gamma\) 提出,\(\gamma>0\))。在上式里令 \(\zeta=t/\gamma\)(即 \(t=\gamma\zeta\)),\(d\zeta=dt/\gamma\),\(\zeta:0\to1\) 对应 \(t:0\to\gamma\): \[k^{-1}\int_0^1\zeta^{-1+1/k}e(\gamma\zeta)d\zeta=k^{-1}\int_0^{\gamma}\Big(\tfrac t\gamma\Big)^{-1+1/k}e(t)\frac{dt}{\gamma}=k^{-1}\gamma^{-1/k}\int_0^{\gamma}t^{-1+1/k}e(t)dt,\] 其中把 \(\gamma^{1-1/k}\cdot\gamma^{-1}=\gamma^{-1/k}\) 提出。换回字母 \(\zeta\) 即原文第三式。
- 看第三式 \(k^{-1}\gamma^{-1/k}\int_0^\gamma\zeta^{-1+1/k}e(\zeta)d\zeta\)。要证 \(\int_0^\gamma\zeta^{-1+1/k}e(\zeta)d\zeta\) 是 \(\gamma\) 的有界函数(不随 \(\gamma\to\infty\) 爆掉)。
- 在 \(0\) 附近:被积 \(\zeta^{-1+1/k}\) 的指数 \(-1+1/k>-1\)(因 \(k\ge2\Rightarrow1/k>0\)),而 \(\int_0\zeta^{-1+1/k}d\zeta\) 在 \(0\) 处收敛(\(p\)-积分判据:指数 \(>-1\) 则可积)。故积分在 \(0\) 处绝对收敛,没问题。
- 在 \(\infty\) 方向:\(e(\zeta)=e^{2\pi i\zeta}\) 是振荡的,配合单调衰减权 \(\zeta^{-1+1/k}\)(递减趋 0),由 Dirichlet 收敛判别法(振荡有界 × 单调趋零 ⟹ 积分收敛),\(\int_0^\gamma\) 当 \(\gamma\to\infty\) 收敛,故对一切 \(\gamma\) 一致有界。
- 因此 \(\big|\int_0^1 e(\gamma\xi^k)d\xi\big|=k^{-1}|\gamma|^{-1/k}\big|\int_0^\gamma\cdots\big|\ll|\gamma|^{-1/k}\)。即内层积分随 \(|\gamma|\) 以 \(|\gamma|^{-1/k}\) 衰减。
- 扩到无穷的误差。把 \(J(P^\delta)\)(\(|\gamma|
P^\delta\) 部分:被积 \(\big|(\int_0^1 e(\gamma\xi^k)d\xi)^s\big|\ll|\gamma|^{-s/k}\),故尾巴 \(\ll\int_{P^\delta}^\infty\gamma^{-s/k}d\gamma\)。因 \(s\ge2^k+1>k\)(实际 \(s/k>1\)),积分收敛且等于 \(\dfrac{(P^\delta)^{1-s/k}}{s/k-1}\ll P^{-(s/k-1)\delta}\)。于是 \[J(P^\delta)=J+O\big(P^{-(s/k-1)\delta}\big),\] 其中 \[J=\int_{-\infty}^{\infty}\Big(k^{-1}\int_0^1\zeta^{-1+1/k}e(\gamma\zeta)d\zeta\Big)^s e(-\gamma)d\gamma.\tag{4.16}\]
第三步:替换并得到 (4.13)(暂缺 \(J=C_{k,s}\))。由 \(\mathfrak S(N)\) 的绝对(且一致)收敛,可把 (4.15) 里 \(\mathfrak S(P^\delta,N)\) 换成 \(\mathfrak S(N)\);由刚证的 \(J(P^\delta)=J+O(\cdots)\) 把 \(J(P^\delta)\) 换成 \(J\);再把 \(P\) 换成 \(N^{1/k}\)。所有替换误差都可忽略,得 \[r(N)=J\cdot N^{s/k-1}\mathfrak S(N)+O(N^{s/k-1-\delta'}).\] 只差证明 \(J=C_{k,s}\)。原文强调:"\(J\) 的确切值或许并不重要,但我们需要知道 \(J>0\)。"
- \(\mathfrak S(P^\delta,N)\to\mathfrak S(N)\):两者之差是 \(q>P^\delta\) 的尾巴,由第 9 节每项 \(\ll q^{-2-1/K+\varepsilon}\),尾和 \(\ll\sum_{q>P^\delta}q^{-1-1/K+\varepsilon}\ll(P^\delta)^{-1/K+\varepsilon}=P^{-\delta/K+\varepsilon\delta}\),是 \(P\) 的负次幂,乘上主项 \(P^{s-k}J\) 后并入误差。
- \(J(P^\delta)\to J\):差 \(O(P^{-(s/k-1)\delta})\)(上一框已证),同样是负次幂,乘主项后并入误差。
- \(P\to N^{1/k}\):因 \(P^k\le N<(P+1)^k\),\(P=N^{1/k}(1+O(N^{-1/k}\cdot\text{...}))\),把 \(P^{s-k}\) 换成 \(N^{(s-k)/k}=N^{s/k-1}\) 的相对误差是 \(N\) 的负次幂,也可忽略。
第 11 节 求出奇异积分 \(J=C_{k,s}\)(对应"为求出 J……"那几段)
这几段在讲什么:用 Fourier 积分定理把 \(J\) 算成一个 Dirichlet/Beta 型多重积分,得到漂亮的 Gamma 函数闭式,并验证定理可用(有界变差)。
第一步:写出 \(k^sJ\) 的多重积分形式。原文从 \[\int_{-\lambda}^{\lambda}e(\mu\gamma)d\gamma=\frac{\sin2\pi\lambda\mu}{\pi\mu}\] 出发,得到 \[k^sJ=\lim_{\lambda\to\infty}\int_0^1\!\!\cdots\!\!\int_0^1(\zeta_1\cdots\zeta_s)^{-1+1/k}\frac{\sin2\pi\lambda(\zeta_1+\cdots+\zeta_s-1)}{\pi(\zeta_1+\cdots+\zeta_s-1)}d\zeta_1\cdots d\zeta_s.\]
- 先证那条 sin 公式。\(\int_{-\lambda}^\lambda e(\mu\gamma)d\gamma=\int_{-\lambda}^\lambda e^{2\pi i\mu\gamma}d\gamma=\Big[\dfrac{e^{2\pi i\mu\gamma}}{2\pi i\mu}\Big]_{-\lambda}^{\lambda}=\dfrac{e^{2\pi i\mu\lambda}-e^{-2\pi i\mu\lambda}}{2\pi i\mu}=\dfrac{2i\sin2\pi\mu\lambda}{2\pi i\mu}=\dfrac{\sin2\pi\lambda\mu}{\pi\mu}\),用了 \(e^{i\theta}-e^{-i\theta}=2i\sin\theta\)。
- 把 \(J\) 的 \(\gamma\)-积分截断成 \([-\lambda,\lambda]\),取极限。由 (4.16),\(J=\lim_{\lambda\to\infty}\int_{-\lambda}^\lambda(\text{内层})^s e(-\gamma)d\gamma\)。把内层 \(k^{-1}\int_0^1\zeta^{-1+1/k}e(\gamma\zeta)d\zeta\) 的 \(s\) 次方展开成 \(s\) 重积分(变量 \(\zeta_1,\dots,\zeta_s\)),并提出 \(k^{-s}\)(故左边写 \(k^sJ\)): \[k^sJ=\lim_{\lambda\to\infty}\int_{-\lambda}^\lambda\!\Big(\int_0^1\!\!\cdots\!\!\int_0^1(\zeta_1\cdots\zeta_s)^{-1+1/k}e(\gamma(\zeta_1+\cdots+\zeta_s))d\vec\zeta\Big)e(-\gamma)d\gamma.\]
- 交换积分次序,先积 \(\gamma\)。把对 \(\gamma\) 的积分挪到最里层,合并指数 \(e(\gamma(\zeta_1+\cdots+\zeta_s))e(-\gamma)=e(\gamma(\zeta_1+\cdots+\zeta_s-1))\)。令 \(\mu=\zeta_1+\cdots+\zeta_s-1\),用第 1 条的 sin 公式:\(\int_{-\lambda}^\lambda e(\mu\gamma)d\gamma=\dfrac{\sin2\pi\lambda\mu}{\pi\mu}\)。代回即原文式子。
第二步:换变量 \(u=\zeta_1+\cdots+\zeta_s\),引入 \(\phi(u)\)。原文把 \(\zeta_s\) 换成 \(u\): \[k^sJ=\lim_{\lambda\to\infty}\int_0^s\phi(u)\frac{\sin2\pi\lambda(u-1)}{\pi(u-1)}du,\] 其中 \[\phi(u)=\int\!\!\cdots\!\!\int\{\zeta_1\cdots\zeta_{s-1}(u-\zeta_1-\cdots-\zeta_{s-1})\}^{-1+1/k}d\zeta_1\cdots d\zeta_{s-1},\] 积分取遍 \(u-1<\zeta_1+\cdots+\zeta_{s-1}
- 动机:上式的核 \(\dfrac{\sin2\pi\lambda(u-1)}{\pi(u-1)}\) 只依赖 \(u=\zeta_1+\cdots+\zeta_s\),所以应先把"固定 \(u\) 那张超平面上的积分"做掉,再对 \(u\) 积。\(\phi(u)\) 就是固定 \(\zeta_1+\cdots+\zeta_s=u\) 时被积函数 \((\zeta_1\cdots\zeta_s)^{-1+1/k}\) 在那张超平面上的积分(一个截面积分)。
- 怎么换的:把 \(\zeta_s\) 用 \(u\) 表示,\(\zeta_s=u-(\zeta_1+\cdots+\zeta_{s-1})\)。于是 \((\zeta_1\cdots\zeta_s)^{-1+1/k}=\{\zeta_1\cdots\zeta_{s-1}\cdot(u-\zeta_1-\cdots-\zeta_{s-1})\}^{-1+1/k}\),对前 \(s-1\) 个变量积分即 \(\phi(u)\)。约束 \(0<\zeta_s<1\) 翻译成 \(u-1<\zeta_1+\cdots+\zeta_{s-1}
- 为什么 \(u\) 从 \(0\) 到 \(s\)?每个 \(\zeta_i\in(0,1)\),故和 \(u=\zeta_1+\cdots+\zeta_s\) 介于 \(0\) 与 \(s\) 之间。所以外层 \(\int_0^s\)。
第三步:Fourier 积分定理取出 \(\phi(1)\)。原文回忆有限区间上的 Fourier 积分定理:在一定条件下
\[\lim_{\lambda\to\infty}\int_A^B\phi(u)\frac{\sin2\pi\lambda(u-C)}{\pi(u-C)}du=\phi(C),\quad A
- 核 \(\dfrac{\sin2\pi\lambda(u-C)}{\pi(u-C)}\) 当 \(\lambda\to\infty\) 是一个集中在 \(u=C\) 的"采样尖峰",且它在整条线上的积分恒为 \(1\)。所以拿它去乘任何(足够规则的)函数 \(\phi(u)\) 再积分,效果就是读出 \(\phi\) 在 \(u=C\) 处的值 \(\phi(C)\)。这是 (★) 正交关系的连续模拟(Dirichlet 核 → 单点采样)。
- 这里 \(C=1\),正好对应原方程"\(s\) 个 \(k\) 次幂之和 \(=1\)(标准化后)"那张超平面。于是 \(k^sJ=\phi(1)\):把和恰为 \(1\) 的那张超平面上的截面积分取出来。
- 为什么把 \(N\) 标准化成 \(1\)?前面换元 \(\xi=P\xi'\) 把 \(x_i\le P\) 缩成 \(\xi'_i\le1\),把 \(N\) 缩成 \(1\)。所以"和 \(=N\)"变成"和 \(=1\)"。\(\phi(1)\) 正是这个连续化、标准化后的"超平面截面体积"。
第四步:用 Dirichlet(Euler Beta 的推广)积分算出 \(\phi(1)\)。原文指出最后这个 \(s-1\) 重积分是 Dirichlet 求出的一类积分,是 Euler 积分 \[B(p,q)=\int_0^1 x^{p-1}(1-x)^{q-1}dx=\frac{\Gamma(p)\Gamma(q)}{\Gamma(p+q)}\] 的直接推广,结果 \[\phi(1)=\frac{\Gamma(1/k)^s}{\Gamma(s/k)},\quad\text{从而}\quad J=\Big(\frac1k\Big)^s\frac{\Gamma(1/k)^s}{\Gamma(s/k)}=\frac{\Gamma(1+1/k)^s}{\Gamma(s/k)}.\]
- Gamma 函数 \(\Gamma\):\(\Gamma(t)=\int_0^\infty x^{t-1}e^{-x}dx\),对正整数 \(\Gamma(n)=(n-1)!\),且 \(\Gamma(t+1)=t\Gamma(t)\)。它是"阶乘的连续版"。
- Beta 函数 \(B(p,q)\):\(\int_0^1 x^{p-1}(1-x)^{q-1}dx=\dfrac{\Gamma(p)\Gamma(q)}{\Gamma(p+q)}\)。这是 \(s=2\)(一个内变量)时的本步特例。
- Dirichlet 推广(多变量 Beta):对单纯形 \(\{t_i>0,\ \sum t_i<1\}\), \[\int\cdots\int t_1^{p_1-1}\cdots t_{n}^{p_n-1}\Big(1-\sum t_i\Big)^{p_{n+1}-1}d\vec t=\frac{\Gamma(p_1)\cdots\Gamma(p_{n+1})}{\Gamma(p_1+\cdots+p_{n+1})}.\]
- 套用。本步积分是 \(n=s-1\) 个变量 \(\zeta_1,\dots,\zeta_{s-1}\) 在 \(\sum\zeta_i<1\) 上,被积 \(\{\zeta_1\cdots\zeta_{s-1}(1-\sum\zeta_i)\}^{-1+1/k}\)。对照公式:每个 \(p_i-1=-1+1/k\),即 \(p_i=1/k\),共 \(s\) 个这样的指数(前 \(s-1\) 个变量加上 \(1-\sum\) 那项,合计 \(s\) 个)。所以 \[\phi(1)=\frac{\Gamma(1/k)^s}{\Gamma(s\cdot1/k)}=\frac{\Gamma(1/k)^s}{\Gamma(s/k)}.\]
- 得 \(J\)。\(k^sJ=\phi(1)\Rightarrow J=k^{-s}\dfrac{\Gamma(1/k)^s}{\Gamma(s/k)}=\dfrac{(k^{-1}\Gamma(1/k))^s}{\Gamma(s/k)}\)。再用 \(\Gamma(t+1)=t\Gamma(t)\) 于 \(t=1/k\):\(\Gamma(1+1/k)=\tfrac1k\Gamma(1/k)\),即 \(k^{-1}\Gamma(1/k)=\Gamma(1+1/k)\)。代入: \[J=\frac{\Gamma(1+1/k)^s}{\Gamma(s/k)}=C_{k,s}.\] 这正是 (4.14)。且因 Gamma 在正实轴恒正,\(C_{k,s}>0\),故 \(J>0\)——这是我们真正需要的(保证主项不为零,\(N\) 确实有大量表示)。∎
第五步:验证 Fourier 积分定理可用(\(\phi\) 有界变差)。原文:充分条件是 \(\phi(u)\) 有界变差。令 \(\zeta_j=ut_j\),则
\[\phi(u)=u^{s/k-1}\int_0^{1/u}\!\!\cdots\!\!\int_0^{1/u}\{t_1\cdots t_{s-1}(1-t_1-\cdots-t_{s-1})\}^{-1+1/k}dt_1\cdots dt_{s-1},\]
积分取遍 \(1-1/u
- 有界变差(bounded variation):粗略说,一个函数若"上上下下波动的总幅度有限"(不会无限次剧烈抖动),就叫有界变差。单调函数(一路增或一路减)自动有界变差;两个有界变差函数之积仍有界变差。这正是 Fourier 积分定理"采样出 \(\phi(C)\)"所需的规则性。
- 换元 \(\zeta_j=ut_j\) 的效果。每个 \(\zeta_j\) 缩放 \(u\) 倍变成 \(t_j\)。被积 \(\{\zeta_1\cdots\zeta_{s-1}(u-\sum\zeta_i)\}^{-1+1/k}\) 中,每个因子提出一个 \(u\):共 \(s\) 个因子(\(s-1\) 个 \(\zeta\) 加 \((u-\sum)\)),每个贡献 \(u^{-1+1/k}\),合计 \(u^{s(-1+1/k)}=u^{-s+s/k}\);又 \(d\zeta_1\cdots d\zeta_{s-1}=u^{s-1}dt_1\cdots dt_{s-1}\)。两者相乘的 \(u\) 幂:\(u^{-s+s/k}\cdot u^{s-1}=u^{s/k-1}\)。这就是提出的 \(u^{s/k-1}\)。
- 剩下的积分是 \(u\) 的单调递减函数。换元后被积函数完全不含 \(u\),\(u\) 只出现在积分上限/区域 \(1-1/u<\sum t_i<1\)、\(t_j<1/u\) 里。当 \(u\) 增大,\(1/u\) 减小,积分区域收缩,正被积函数在更小区域上积分只会更小——故该积分是 \(u\) 的正、单调递减函数。
- 于是 \(\phi(u)=u^{s/k-1}\times(\text{正单减函数})\)。\(u^{s/k-1}\) 是幂函数(单调,有界变差),单减函数也有界变差,乘积有界变差。定理前提满足,第三步合法。∎
第 12 节 注记:方法的来源与替代(对应"注记"段)
原文:在我们对奇异积分的处理中,我们遵循了 Landau 的一篇论文 [54]。关于略为更一般的处理,参见 Kestelman 的一篇论文 [52]。有若干手段可以避免使用 Fourier 积分定理;例如,可以把 \(I(\beta)\) 换成有限和 \[k^{-1}\sum_{0\lt m\lt P^k}m^{-1+1/k}e(\beta m),\] 或者也可以像 Vinogradov [93, 第 3 章] 那样间接地求出 \(J\)。但总的来说,引用 Fourier 积分定理似乎是自然而恰当的。
- 人物与脉络:Waring 问题源自 1770 年 E. Waring 的断言"每个正整数都是不超过若干个 \(k\) 次幂之和"。Hilbert 在 1909 年证明了"个数有限"的存在性,但没有渐近计数。真正给出渐近公式的是 Hardy 与 Littlewood 在 1920 年代用圆法完成的系列工作;本章正是这套方法的现代精简版。Landau、Kestelman 关于奇异积分的处理,Vinogradov 对次弧估计(Weyl 和)的革命性改进,都是这条线上的关键节点。
- 为什么这项工作重要:它第一次把"有多少种表示"这种定量问题,从纯组合/同余的死胡同里解放出来,变成可计算的解析问题(积分 + 级数),并清晰地分离出"连续密度"\(C_{k,s}N^{s/k-1}\) 与"算术修正"\(\mathfrak S(N)\) 两种独立机制。这一"主项 = 奇异积分 × 奇异级数"的范式,后来成为整个解析数论(圆法)的标准模板。
- 避免 Fourier 积分定理的替代:(1) 把连续积分 \(I(\beta)\) 换回离散和 \(k^{-1}\sum_m m^{-1+1/k}e(\beta m)\),用初等求和处理;(2) Vinogradov 用间接方式定出 \(J\)。Davenport 选择直接引用 Fourier 积分定理,理由是它"自然而恰当"——概念上最透明,代价是要核验有界变差(第 11 节第五步已做)。这是一处典型的方法取舍:透明性 vs. 自足性。
第 13 节 渐近公式的意义:密度 × 修正(对应最后一段)
原文:在渐近公式 (4.13) 中,可以把第一个因子 \(C_{k,s}N^{s/k-1}\) 看作度量了方程 \(x_1^k+\cdots+x_s^k=N\)(\(x_i>0\))在实数中解的"密度";它是某超曲面这一部分的 \((s-1)\) 维测度。换一种说法,它(在可忽略的误差范围内)是区域
\[N-\tfrac12
- 考虑 \(s\) 维空间中"薄壳" \(N-\tfrac12
实数解去近似整点解"的连续模型——把每个整点 \((x_1,\dots,x_s)\) 想成单位体积的小盒子,薄壳的体积≈落在其中的整点数。 - 而这个体积可由超曲面 \(\sum x_i^k=N\) 的 \((s-1)\) 维面积乘以薄壳厚度(沿法向 \(\approx1\))得到,故称"\((s-1)\) 维测度"。
- 用第 11 节标准化的语言:把 \(x_i=N^{1/k}t_i\) 缩放,体积里提出 \(N^{s/k}\)(\(s\) 个变量各 \(N^{1/k}\)),薄壳厚度 \(1\) 相对缩成 \(N^{-1}\cdot(\text{...})\),净得 \(N^{s/k-1}\) 量级;前面的比例常数经第 11 节算得正是 \(C_{k,s}=\Gamma(1+1/k)^s/\Gamma(s/k)\)(这就是奇异积分 \(J\) 的几何身份)。所以 \(C_{k,s}N^{s/k-1}\) = 薄壳体积 = 实数解密度。
原文:第二个因子 \(\mathfrak{S}(N)\) 可以看作一个补偿因子,用以反映这样一个事实:整数的 \(k\) 次幂并不像实数的 \(k\) 次幂那样均匀分布,因为前者受到同余限制的约束。(\(\mathfrak S(N)\) 与同余之间的关系将在下一节中浮现。)于是,渐近公式的结论用略嫌含糊的话说就是:把一个大数表示为 \(s\) 个正整数 \(k\) 次幂之和的表示数,渐近地由这两种影响所主导,前提是 \(s\) 大于 \(k\) 的某个函数。
- "实数密度" \(C_{k,s}N^{s/k-1}\) 默认 \(k\) 次幂在数轴上均匀铺开。但整数的 \(k\) 次幂不均匀:它们受同余约束。例如 \(k=2\) 时,平方数模 \(4\) 只能是 \(0\) 或 \(1\),绝不会是 \(2,3\)。
- 于是若 \(N\) 落在某些剩余类里,可表示性会被增强或削弱。\(\mathfrak S(N)\) 正是把"对每个模 \(q\) 的解数相对均匀情形的偏差"全部乘起来的修正:\(\mathfrak S(N)>1\) 表示比均匀情形更易表示,\(<1\) 表示更难,\(=0\) 表示根本无解(局部障碍)。
- 这就是为什么 \(r(N)=(\text{实数密度})\times(\text{算术修正})\)。两个因子分别来自圆法的两半:奇异积分 \(J=C_{k,s}\)(分析/连续)与奇异级数 \(\mathfrak S(N)\)(算术/离散)。\(\mathfrak S(N)\) 与同余的精确关系(写成各素数处"局部密度"之积)将在下一章展开。
- "\(s\) 大于 \(k\) 的某个函数":本章要求 \(s\ge2^k+1\) 才让所有估计成立;这是渐近公式成立的代价——项数要足够多,主项才稳稳压过误差。后续工作把这个门槛从指数级 \(2^k\) 一路降到线性级。
返回 全书目录