大家的AI
机器学习Playground 试玩
加载中…

学习

Ch.11

泰勒级数:用多项式近似复杂函数

按章节的数学图示

选择章节后,下方图示会切换为该章节内容。可一览中级数学的脉络。

复杂曲线在一点附近放大后,也会像直线(一阶)或抛物线(二阶)一样。请看下方动画:次数越高,越贴近原函数。
泰勒级数把该点处函数如何变化写入微分值,并在附近区间用多项式代替原曲线。
一阶:沿切线追随二阶:像抛物线一样弯曲贴合三阶:更远也相似
지금 보는 단계

一阶:沿切线追随

원함수1차 근사핵심: 중심에서 멀수록 오차 큼

핵심: 차수가 올라갈수록 보통 더 정확해집니다.

紫色为原函数,橙、绿、蓝为一、二、三阶泰勒近似。离中心越远误差越大。

泰勒级数是在“当前所在点”附近,把复杂函数改写成多项式的方法。一阶近似像切线一样用直线追随,二阶、三阶则越来越贴合曲线。在人工智能中,它用于近似损失函数或激活函数,也是理解牛顿法和二阶优化的核心。

泰勒级数:用多项式追随复杂函数

泰勒级数是什么? 它是在单点 aaa 附近,把难函数 f(x)f(x)f(x) 换成多项式的公式。组合该点的值、斜率、曲率,使附近的 xxx 与原函数几乎相同。
放大地图时,弯曲线段也会像直线。泰勒级数同理:在 aaa 附近放大,复杂函数就像 1+x+x2/2+⋯1 + x + x^2/2 + \cdots1+x+x2/2+⋯ 这样的简单多项式。
正式写法:Tn(x)=f(a)+f′(a)(x−a)+f′′(a)2!(x−a)2+⋯+f(n)(a)n!(x−a)nT_n(x)=f(a)+f^{\prime}(a)(x-a)+\frac{f^{\prime\prime}(a)}{2!}(x-a)^2+\cdots+\frac{f^{(n)}(a)}{n!}(x-a)^nTn​(x)=f(a)+f′(a)(x−a)+2!f′′(a)​(x−a)2+⋯+n!f(n)(a)​(x−a)n。f(k)(a)f^{(k)}(a)f(k)(a) 是 aaa 处 kkk 阶导数,k!k!k! 是阶乘。麦克劳林级数是 a=0a=0a=0 的特例。
机器学习中,在参数附近把损失函数二次近似,就连接到牛顿法与 Hessian(第10章)。激活函数在小区间也可线性或二次近似,帮助理解学习率与误差。
泰勒级数在特定点附近用多项式近似复杂函数。一阶连梯度,二阶连 Hessian 与牛顿;次数越高通常越准。与第08章梯度、第10章 Hessian 共同构成优化数学的主线。
仅有微分只知道当前斜率,难知整段曲线。泰勒级数用同一点的高阶导数把局部形状汇总为一个多项式。
第10章 Hessian 把二次项 f′′(a)2(x−a)2\frac{f^{\prime\prime}(a)}{2}(x-a)^22f′′(a)​(x−a)2 推广到矩阵。理解二阶泰勒,就自然理解二阶导数为何决定曲率与牛顿步长。
1. 在梯度下降里怎么用?(一阶近似)
梯度下降的核心是:在当前点朝“损失下降最快”的方向小步移动。这正是一阶泰勒近似的思想。也就是在当前点附近,把损失函数看成切线(线性)来决定下一步。
实战流程通常是:
- 在当前参数处计算损失和梯度;
- 用一阶近似判断下降方向;
- 乘学习率执行一步更新。
这个视角很重要,因为更新公式不是机械记忆,而是“基于一阶近似的决策”。因此也更容易理解:学习率过大为何会震荡,过小为何会很慢。
2. 在牛顿法与 Hessian 里怎么用?(二阶近似)
牛顿类方法不仅看一阶信息(斜率),还使用二阶信息(曲率)。从二阶泰勒角度看,就是把局部损失面近似为抛物面,再根据这个形状决定更高效的步长。
可直观比较为:
- 一阶近似(梯度下降):擅长找方向;
- 二阶近似(牛顿法):方向和步长都更聪明。
Hessian 是承载曲率信息的核心工具。它告诉你哪些方向更陡、哪些方向更平,从而按方向调整移动尺度。条件合适时,牛顿系方法往往收敛更快。
3. 在数值计算与深度学习实现里怎么用?
工程中我们常常不会每次都精确计算复杂函数,而是在需要的区间里做近似来降低计算量。泰勒级数正是这类方法的代表。
常见场景包括:
- 在小区间用多项式近似 exe^xex、sin⁡x\sin xsinx、log⁡(1+x)\log(1+x)log(1+x) 等函数以加速计算;
- 将激活函数或损失函数在特定工作区间内简化,便于分析;
- 在优化算法设计中,用“当前附近地形”的近似来选择更稳定的更新步。
在深度学习里,很多时候比起全局精确解析,更关键的是读懂“当前参数附近”的行为。泰勒视角既能减轻计算,也能提升对更新原因的可解释性。它不是只在课堂里使用的理论,而是训练流水线中的实用判断工具。
下表仅整理解题所需的公式与符号。请参见表下例题的步骤。
  • 公式Tn(x)=∑k=0nf(k)(a)k!(x−a)kT_n(x)=\sum_{k=0}^{n}\frac{f^{(k)}(a)}{k!}(x-a)^kTn​(x)=∑k=0n​k!f(k)(a)​(x−a)k
  • 符号含义nnn 阶泰勒多项式。f(k)(a)f^{(k)}(a)f(k)(a) = kkk 阶导数。
  • 公式T1(x)=f(a)+f′(a)(x−a)T_1(x)=f(a)+f^{\prime}(a)(x-a)T1​(x)=f(a)+f′(a)(x−a)
  • 符号含义一阶(线性)近似 = 切线。对应梯度一步。
  • 公式T2(x)=f(a)+f′(a)(x−a)+f′′(a)2(x−a)2T_2(x)=f(a)+f^{\prime}(a)(x-a)+\frac{f^{\prime\prime}(a)}{2}(x-a)^2T2​(x)=f(a)+f′(a)(x−a)+2f′′(a)​(x−a)2
  • 符号含义二阶近似。牛顿法·Hessian。
  • 公式a=0a=0a=0(麦克劳林)
  • 符号含义中心在原点。
  • 公式nnn 阶项数
  • 符号含义n+1n+1n+1 个。
  • 公式xnx^nxn 系数
  • 符号含义低次多项式的麦克劳林系数。
  • 公式余项
  • 符号含义约为 (x−a)n+1(x-a)^{n+1}(x−a)n+1 阶。
  • 公式ML
  • 符号含义一阶→SGD;二阶→牛顿·Hessian。
公式符号含义
Tn(x)=∑k=0nf(k)(a)k!(x−a)kT_n(x)=\sum_{k=0}^{n}\frac{f^{(k)}(a)}{k!}(x-a)^kTn​(x)=∑k=0n​k!f(k)(a)​(x−a)knnn 阶泰勒多项式。f(k)(a)f^{(k)}(a)f(k)(a) = kkk 阶导数。
T1(x)=f(a)+f′(a)(x−a)T_1(x)=f(a)+f^{\prime}(a)(x-a)T1​(x)=f(a)+f′(a)(x−a)一阶(线性)近似 = 切线。对应梯度一步。
T2(x)=f(a)+f′(a)(x−a)+f′′(a)2(x−a)2T_2(x)=f(a)+f^{\prime}(a)(x-a)+\frac{f^{\prime\prime}(a)}{2}(x-a)^2T2​(x)=f(a)+f′(a)(x−a)+2f′′(a)​(x−a)2二阶近似。牛顿法·Hessian。
a=0a=0a=0(麦克劳林)中心在原点。
nnn 阶项数n+1n+1n+1 个。
xnx^nxn 系数低次多项式的麦克劳林系数。
余项约为 (x−a)n+1(x-a)^{n+1}(x−a)n+1 阶。
ML一阶→SGD;二阶→牛顿·Hessian。

例题

例1 — definition(判断题)
“麦克劳林级数就是中心 a=0a=0a=0 的泰勒级数。”
① 真
② 假
麦克劳林正是中心为0的特殊泰勒形式。→ 答案 1

例2 — definitionChoice(概念选择题)
“下列哪个是一阶泰勒近似的正确形式?”
① T1(x)=f(a)+f′(a)(x−a)T_1(x)=f(a)+f^{\prime}(a)(x-a)T1​(x)=f(a)+f′(a)(x−a)
② T1(x)=f(a)+f′′(a)2(x−a)2T_1(x)=f(a)+\frac{f^{\prime\prime}(a)}{2}(x-a)^2T1​(x)=f(a)+2f′′(a)​(x−a)2
③ 一阶近似总与原函数完全相同
一阶近似对应切线形式,因此选
①。→ 答案 1

例3 — linearApprox(一阶近似计算)
“f(x)=2x+1f(x)=2x+1f(x)=2x+1,中心 a=0a=0a=0 时,T1(3)T_1(3)T1​(3) 等于多少?”
线性函数的一阶近似与原函数相同,2⋅3+1=72\cdot3+1=72⋅3+1=7。→ 答案 7

例4 — quadraticApprox(二阶近似计算)
“f(x)=x2+2x+1f(x)=x^2+2x+1f(x)=x2+2x+1,中心 a=0a=0a=0 时,T2(2)T_2(2)T2​(2) 等于多少?”
该函数本身就是二次多项式,所以二阶近似与原函数一致:22+2⋅2+1=92^2+2\cdot2+1=922+2⋅2+1=9。→ 答案 9

例5 — maclaurinCoeff(读系数)
“f(x)=5x3f(x)=5x^3f(x)=5x3 的麦克劳林展开里,x3x^3x3 的系数是多少?”
直接读取 x3x^3x3 前面的系数即可。→ 答案 5

例6 — derivativeAtCenter(中心点导数值)
“当 f(x)=x3f(x)=x^3f(x)=x3 时,f(3)(0)f^{(3)}(0)f(3)(0) 是多少?”
x3x^3x3 连续求三次导数得到 6,常数在 x=0x=0x=0 仍为 6。→ 答案 6

例7 — termCount(项数)
“4阶泰勒多项式有几项?”
从0阶到4阶,共 4+1=54+1=54+1=5 项。→ 答案 5

例8 — remainderOrder(余项阶数)
“做完 n=2n=2n=2 阶泰勒近似后,余项典型阶数是?”
① (x−a)n(x-a)^n(x−a)n
② (x−a)n+1(x-a)^{n+1}(x−a)n+1
③ (x−a)n+2(x-a)^{n+2}(x−a)n+2
余项通常从高一阶开始。→ 答案 2

例9 — mlConcept(ML 对应概念)
“哪一个最接近一阶泰勒近似在机器学习中的含义?”
① 根据当前梯度做一步更新
② 总是乘 Hessian 逆矩阵更新
③ 定义批归一化
一阶近似对应“基于梯度的一步更新”直觉。→ 答案 1

문제

若陈述为真选 1,假选 0。
一阶泰勒多项式在 aaa 处等于切线。
1 / 5