Wirtinger导数

  1. 矩阵与多实变量实值函数的微分

Wirtinger导数的定义

在相位恢复与数字全息成像问题中,我们的目标通常可以统一表述为一个优化问题:\(\mathop {\min }\limits_{{\bf{z}} \in {\mathbb{C}^n}} f\left( {\bf{z}} \right)\),

其中z表示待恢复光场的复振幅或物体函数,\(f\left( {\bf{z}} \right)\)是由测量数据构建的损失函数,例如强度误差\(\left\| {{\bf{y}} - {{\left| {\bf{z}} \right|}^2}} \right\|_2^2\)。在实际应用中,我们希望求解上述优化问题时具备如下性质:

(1)计算效率高,适用于大规模成像问题;

(2)收敛稳定,对噪声和模型误差鲁棒;

(3)易于融合先验信息,如稀疏性、物理约束等。

比之下,传统的如 Gerchberg–Saxton 或 Fienup 算法等相位恢复方法属于基于投影的方法,它们本质上是在不同约束集合之间反复投影,具有实现简单的有点,但是收敛速度慢、难以引入复杂先验,且缺乏统一优化框架。因此,一个自然的想法是:将相位恢复问题转化为一个连续优化问题,并使用梯度下降、牛顿法等标准优化工具求解,并且可以无缝接入现代自动微分等深度学习框架中。

典型损失函数可以写为:\(f\left( {\bf{z}} \right) = \left\| {{{\left| {{\bf{Az}}} \right|}^2} - {\bf{y}}} \right\|_2^2\),

其中A为成像的线性算子,y为测量的强度图像。然而,当我们尝试应用传统微分方法计算梯度时,会遇到一个根本性问题:函数\(f\left( {\bf{z}} \right)\)是复变量上的实值函数,即

即\(f:{\mathbb{C}^n} \to \mathbb{R}\)。

在标准复分析中,函数只有在全纯时才可导,而全纯函数必须满足极为严格的柯西黎曼条件。但在相位恢复中,场景的函数如\(f\left( {\bf{z}} \right) = {\left| {\bf{z}} \right|^2}\),\(\left| {{\bf{Az}}} \right|\),\({\mathop{\rm Re}\nolimits} \left( {\bf{z}} \right)\)等,都不是全纯函数,这意味着这些函数的标准复导数不存在,梯度下降无法直接定义。

一种直接的方法是将复变量拆分为实部和虚部,即\(z = x + iy\),从而将问题转化为

\[f\left( {\bf{z}} \right) = g\left( {{\bf{x}},{\bf{y}}} \right),{\rm{ }}g:{\mathbb{R}^n} \times {\mathbb{R}^n} \to \mathbb{R}\]
(1)

然后在实数空间,利用矩阵求导数中计算梯度。这种方法在理论上是完全成立的,并且在许多工作中被采用,但它存在明显问题:(1)表达不紧凑,变量翻倍;(2)推导复杂,不符合复数结构;(3)不利于物理解释,因为光场本身是复数。

更理想的方式就是直接在复数域中进行优化,同时保留复数结构。这就引出了一个关键问题:如何定义“复数上的梯度”?

在引入新的导数定义之前,我们先给出一个基本结论:实值复函数几乎不可导。

引理:设\(f\left( z \right)\)是复变量z的实值函数,除非\(f\left( z \right)\)为常数函数,否则他不可能是全纯函数。

证明:设\(z = x + iy\),\(f\left( z \right) = u\left( {x,y} \right) + iv\left( {x,y} \right)\),其中uv均为实函数。由于\(f\left( z \right)\)是实值函数,因此\(v\left( {x,y} \right) \equiv 0\)。若\(f\left( z \right)\)是全纯函数,则必须满足柯西–黎曼方程:

\[\frac{{\partial u}}{{\partial x}} = \frac{{\partial v}}{{\partial y}},{\rm{ }}\frac{{\partial u}}{{\partial y}} = - \frac{{\partial v}}{{\partial x}}\]
(2)

由于\(v\left( {x,y} \right) \equiv 0\),得到式 (2) 的两项都等于 0。因此\(f\left( z \right)\)为常数函数。任何非常数的实值复函数都不可全纯,这意味着相位恢复中的损失函数无法使用传统复导数计算,且经典梯度下降优化方法在复数域中没有直接定义。

为了在复数域中继续进行优化,我们需要引入一种新的导数定义。将复函数写为\(z\)与它的共轭\(\bar z\)的函数。设\(f\left( z \right) = h\left( {z,\bar z} \right) = u\left( {x,y} \right) + iv\left( {x,y} \right)\),其中

\[z = x + iy,{\rm{ }}\bar z = x - iy\]
(3)

此时,我们可以将\(z\)与\(\bar z\)形式上视为两个独立变量,并独立分析f关于它们的偏导。

将\(z\)与\(\bar z\)在形式上视为相互独立的变量,初看之下可能会令人感到困惑。事实上,当\(z\)的实部或虚部发生变化时,其共轭\(\bar z\)也必然随之发生对应变化,因此二者在真实意义上并非独立变量。然而,在复数优化与导数计算中,将\(z\)与\(\bar z\)视为独立变量是一种合理且极为有用的数学处理方式。其根本原因在于,这种处理并不是对变量关系的物理假设,而是一种坐标变换下的形式独立性,即\(z\)和\(\bar z\)可以写成xy的可逆线性变换:

\[\left( {\begin{array}{*{20}{c}}z\\{\bar z}\end{array}} \right) = \left( {\begin{array}{*{20}{c}}1&i\\1&{ - i}\end{array}} \right)\left( {\begin{array}{*{20}{c}}x\\y\end{array}} \right)\]
(4)

由于该变换时可逆的,因此\((z,\bar z)\)和\((x,y)\)本质上只是同一空间的两种不同参数化方式。在\((x,y)\)坐标系中,xy显然是相互独立的实变量;而通过一一对应的线性变换,可以将导数从\((x,y)\)坐标转换到坐标中。在这一意义下,将\(z\)与\(\bar z\)视为“独立变量”,只是为了在新的坐标系中方便地表达导数结构。

这一思想可以通过一个更直观的类比来理解。如图 1所示,在平面直角坐标系中,点的位置可以用 \((x,y)\)表示,也可以用极坐标\((\rho ,\theta )\)表示,其中\(\rho = \sqrt {{x^2} + {y^2}} \),\(\theta = \arctan (y/x)\)。显然,\(\rho \)与\(\theta \)在数值上依赖于xy,但在进行偏导数计算时,我们仍然可以将\(\rho \)与\(\theta \)视为相互独立的变量。这是因为它们只是对同一几何空间的另一种坐标描述方式。\((z,\bar z)\)

图 1 不同表示复平面的参数方式

有了上述基础后,定义如下两个偏导数:

\[\begin{array}{l}\frac{{\partial f}}{{\partial z}} = \frac{1}{2}\left( {\frac{{\partial f}}{{\partial x}} - i\frac{{\partial f}}{{\partial y}}} \right)\\\frac{{\partial f}}{{\partial \bar z}} = \frac{1}{2}\left( {\frac{{\partial f}}{{\partial x}} + i\frac{{\partial f}}{{\partial y}}} \right)\end{array}\]
(5)

这两个导数可以理解为\(\partial /\partial z\)是沿着\(z\)方向的变化,而\(\partial /\partial \bar z\)是沿着共轭方向的变化。它们共同编码了\((x,y)\)的梯度信息。

若函数\(f\left( z \right)\)是全纯的,则有

\[\frac{\partial }{{\partial \bar z}}f\left( z \right) = 0\]
(6)

这正是柯西黎曼条件的另一种表达形式。

式 (5) 即是 Wirtinger 导数,它通过对实变量偏导数进行线性组合,构造出关于复变量\(z\)和\(\bar z\)的两类偏导数。其核心意义在于:虽然一般的实值复函数并不满足全纯条件,无法使用传统复分析中的复导数,但仍然可以借助Wirtinger导数,在保持复数表示形式不变的前提下,对函数的局部变化进行描述。

从本质上看,Wirtinger 导数并没有引入新的信息,而是将实平面\((x,y)\)中的微分信息,重新组织为\((z,\bar z)\)坐标系下的表示形式。由于

\[z = x + iy,{\rm{ }}\bar z = x - iy\]
(7)

因此\((z,\bar z)\)与\((x,y)\)之间只是一个可逆线性变换。换言之,Wirtinger 导数可以视为实梯度在复数坐标系中的等价表达。这种表达方式尤其适合数字全息成像、相位恢复和复数优化问题,因为这些问题中的待估计变量本身往往就是复数光场,而非实部和虚部的简单拼接。

单复变量实值函数的Wirtinger导数

设\(L(z,\bar z) = L(x,y)\)为单复变量实值函数,在以\((x,y)\)为自变量的实数域视角下,函数的全微分表示为

\[{\rm{d}}L = \frac{{\partial L}}{{\partial x}}{\rm{d}}x + \frac{{\partial L}}{{\partial y}}{\rm{d}}y\]
(8)

该表达式可以写成向量内积的形式

\[{\rm{d}}L = \left\langle {{\nabla _{\bf{x}}}L,{\rm{d}}{\bf{x}}} \right\rangle ,{\rm{ }}{\nabla _{\bf{x}}}L = \left( {\begin{array}{*{20}{c}}{{\partial _x}L}\\{{\partial _y}L}\end{array}} \right),{\rm{ d}}{\bf{x}} = \left( {\begin{array}{*{20}{c}}{{\rm{d}}x}\\{{\rm{d}}y}\end{array}} \right)\]
(9)

由此可得:

其中\(\left\langle { \cdot ,{\rm{ }} \cdot } \right\rangle \)表示标准内积。式说明梯度本质上是全微分对应的线性映射的向量表示。全微分刻画了函数在局部的线性变化,而梯度则是该线性映射在内积空间中的向量表示。因此,在复变量情形下,必须先通过全微分建立函数变化的表达形式,才能在新的坐标系中正确定义梯度。

在以\((x,y)\)为自变量的实数域角度下,对函数L做梯度下降的更新式为

\[{{\bf{x}}_{k + 1}} = {{\bf{x}}_k} - \eta \nabla L\left( {\bf{x}} \right) \Leftrightarrow \left\{ {\begin{array}{*{20}{c}}{{x_{k + 1}} = {x_k} - \eta \cdot {\partial _x}L}\\{{y_{k + 1}} = {y_k} - \eta \cdot {\partial _y}L}\end{array}} \right.\]
(10)

当我们从\((x,y)\)的视角切换为\((z,\bar z)\)的视角下时,式的xy两部分的更新可以通过复数关系\(z = x + iy\)合并到一项中,从而得到

\[\begin{array}{c}{z_{k + 1}} = {x_{k + 1}} + i{y_{k + 1}} = \left( {{x_k} - \eta \cdot {\partial _x}L} \right) + i\left( {{y_k} - \eta \cdot {\partial _y}L} \right)\\ = {x_k} + i{y_k} - \eta \cdot \left( {{\partial _x}L + i{\partial _y}L} \right)\\ = {z_k} - \eta \cdot \left( {{\partial _x}L + i{\partial _y}L} \right)\end{array}\]
(11)

式可以根据Wirtinger导数进一步化简为

\[{z_{k + 1}} = {z_k} - 2\eta \cdot \frac{{\partial L}}{{\partial \bar z}}\]
(12)

对比式 (11) 和式 (12) 可见,当把\(2\eta \)视为更新步长时,在在实变量坐标系\((x,y)\)视角下对函数实值L做梯度下降,等价于在复变量坐标系\((z,\bar z)\)的视角下,对变量z沿着2\(\partial L/\partial \bar z\)做更新。换句话说,在实变量坐标系\((x,y)\)下,函数L的梯度\(\nabla L\)表示为\({\nabla _{\bf{x}}}L = {\left( {{\partial _x}L,{\partial _y}L} \right)^T}\),而在复变量坐标系\((z,\bar z)\)下,同一梯度可以表示为

\[\nabla L\left( z \right) = 2{\nabla _{\bar z}}L = 2\frac{{\partial L}}{{\partial \bar z}}\]
(13)

根据式 (13) 和 Wirtinger 导数,可以将全微分重新改写为内积形式

\[{\rm{d}}L = 2{\mathop{\rm Re}\nolimits} \left( {\frac{{\partial L}}{{\partial \bar z}}{\rm{d}}z} \right) = {\mathop{\rm Re}\nolimits} \left\langle {\nabla L,{\rm{d}}z} \right\rangle\]
(14)

从上述结果可以看出,将实变量梯度转换为 Wirtinger 导数形式,并非引入新的优化方向,而是对同一梯度信息的重新表达。其优势在于:在如相位恢复、波前重建等复变量建模问题中,变量天然以复数形式存在,使用 Wirtinger 导数可以避免显式拆分实部与虚部,从而使得模型表达更加紧凑且符合物理意义。

多变量实值标量函数的Wirtinger梯度

在单变量情形中,我们已经建立了\(\nabla L\left( z \right) = 2\frac{{\partial L}}{{\partial \bar z}}\),接下来将这一结果推广至多变量复空间。

设\(f\left( {\bf{z}} \right):{\mathbb{C}^n} \to \mathbb{R}\),其中\({\bf{z}} = {\left( {{z_1},{z_2} \cdots {z_n}} \right)^T}\)。在实变量视角下\(f\left( {\bf{x}} \right):{\mathbb{R}^{2n}} \to \mathbb{R}\),其中多变量\({\bf{x}} = {\left( {{x_1},{y_1}, \cdots ,{x_n},{y_n}} \right)^T}\)。函数\(f\left( {\bf{x}} \right)\)其全微分为\({\rm{d}}f = \left\langle {{\nabla _{\bf{x}}}f,{\rm{ d}}{\bf{x}}} \right\rangle \)。

另一方面,由 Wirtinger 导数的定义,函数\(f\left( {\bf{z}} \right)\)可以视为关于\({\bf{z}}\)和其共轭\({\bf{\bar z}}\)的函数,从而复变量视角下的全微分可以表示为\({\rm{d}}f = {\left( {{\nabla _{\bf{z}}}f} \right)^T}{\rm{d}}{\bf{z}} + {\left( {{\nabla _{{\bf{\bar z}}}}f} \right)^T}{\rm{d}}{\bf{\bar z}}\),

其中

\[{\nabla _{\bf{z}}}f = \left( {\begin{array}{*{20}{c}}{\partial f/\partial {z_1}}\\{\partial f/\partial {z_z}}\\ \vdots \\{\partial f/\partial {z_n}}\end{array}} \right),{\rm{ }}{\nabla _{{\bf{\bar z}}}}f = \left( {\begin{array}{*{20}{c}}{\partial f/\partial {{\bar z}_1}}\\{\partial f/\partial {{\bar z}_z}}\\ \vdots \\{\partial f/\partial {{\bar z}_n}}\end{array}} \right).\]

由于\(f:{\mathbb{C}^n} \to \mathbb{R}\)为实值函数,可以利用Wirtinger导数的基本性质得到\(\overline {{\nabla _{\bf{z}}}f} = {\nabla _{{\bf{\bar z}}}}f\)。

将式带入式,并结合\({\rm{d}}{\bf{\bar z}} = \overline {{\rm{d}}{\bf{z}}}\)可以得到微分的等价表达

\[{\rm{d}}f = {\left( {{\nabla _{\bf{z}}}f} \right)^T}{\rm{d}}{\bf{z}} + \overline {{{\left( {{\nabla _{\bf{z}}}f} \right)}^T}{\rm{d}}{\bf{z}}} = 2{\mathop{\rm Re}\nolimits} \left[ {{{\left( {{\nabla _{{\bf{\bar z}}}}f} \right)}^T}{\rm{d}}{\bf{z}}} \right]\]
(15)

根据内积的定义,式可以改写为内积形式

\[{\rm{d}}f = {\mathop{\rm Re}\nolimits} \left\langle {2{\nabla _{{\bf{\bar z}}}}f,{\rm{d}}{\bf{z}}} \right\rangle\]
(16)

将式 (15) 与式 (16) 比对可得到显式的复数梯度表达式

\[\nabla f\left( {\bf{z}} \right) = 2{\nabla _{{\bf{\bar z}}}}f\]
(17)

与单变量情形完全一致,多变量 Wirtinger 梯度仍然不是新的数学对象,而是实变量梯度在复坐标系下的向量化表达。不同之处在于,此时梯度由标量推广为向量,其结构更适合描述高维复空间中的优化问题。

在上述推导中可以看到,函数的一阶微分既可以表示为关于\(z\)和\(\bar z\)的线性组合,也可以写为关于复梯度的内积形式。这一过程中,一个容易引起疑问的问题是:既然微分表达式中同时包含\(\partial f/\partial z\)和\(\partial f/\partial \bar z\),那么这两个量是否分别提供了关于函数变化的“独立信息”?换言之,在优化过程中,是否需要同时考虑这两个方向?

事实上,对于实值函数\(f:{\mathbb{C}^n} \to \mathbb{R}\),上述两个导数并不是相互独立的,而是满足如下共轭关系:\(\partial f/\partial z = \overline {\partial f/\partial \bar z}\),而由于实值函数\(f:{\mathbb{C}^n} \to \mathbb{R}\),其对实变量xy的梯度均为实向量。根据Wirtinger导数的定义式,\(\partial f/\partial z\)和\(\partial f/\partial \bar z\)本质上包含的是同一组实梯度信息的两种等价表达。

从几何角度来看,这一现象可以理解为:函数的变化本质上由实空间中的两个方向 \((x,y)\)所决定,而\((z,\bar z)\)只是这两个方向的一种复线性重组。因此,在复数坐标系中,虽然形式上出现了两个导数算子,但它们并不会增加自由度。

从优化的角度看,梯度的定义要求我们找到使函数增长最快的方向,而这一方向应当是唯一的。如果\(\partial f/\partial z\)与\(\partial f/\partial \bar z\)提供独立信息,则意味着存在两个不同的“梯度方向”,这将导致优化问题本身的不确定性。上述共轭关系恰好保证了:复数域中的梯度方向仍然是唯一的,其本质仍然对应于实空间中的梯度。

因此,在实际算法中,仅需保留其中一项即可,通常选择式 (17) 作为梯度的表达,另一项\(\partial f/\partial z\)则可以视为冗余信息,其作用仅在于维持表达式的对称性,而不影响优化方向的确定。

定理:复数域驻点条件

设\(f:{\mathbb{C}^n} \to \mathbb{R}\)为复向量的实值函数,并可表示为\(f\left( {\bf{z}} \right) = h\left( {{\bf{z}},{\bf{\bar z}}} \right)\),其中\(h:{\mathbb{C}^n} \times {\mathbb{C}^n} \to \mathbb{R}\)关于\({\bf{z}}\)和\({\bf{\bar z}}\)可微。则函数\(f\left( {\bf{z}} \right)\)在点z处为驻点,当且仅当\({\nabla _{\bf{z}}}f = 0\),或等价地\({\nabla _{{\bf{\bar z}}}}f = 0\)。

证明:

将复变量写为实变量形式\({z_k} = {x_k} + i{y_k}\),则函数可以写为\(f\left( {\bf{z}} \right) = u\left( {{\bf{x}},{\bf{y}}} \right)\),其中\(u:{\mathbb{R}^{2n}} \to \mathbb{R}\)。根据实变量优化理论,函数在点z处为驻点,当且仅当\(\frac{{\partial u}}{{\partial {x_k}}} = 0\),\(\frac{{\partial u}}{{\partial {y_k}}} = 0\),\(\forall k\)。

另一方面,由 Wirtinger 导数式定义,得到上述等式等价于\(\frac{{\partial u}}{{\partial {x_k}}} = 0\),\(\frac{{\partial u}}{{\partial {{\bar z}_k}}} = 0\),从而得到\({\nabla _{\bf{z}}}f = 0\)或等价地\({\nabla _{{\bf{\bar z}}}}f = 0\)。

该定理表明在复数域中,驻点条件与实数域完全一致,只是通过Wirtinger导数进行表达。

定理:复数梯度地最陡上升性质

设\(f:{\mathbb{C}^n} \to \mathbb{R}\)为复向量的实值函数,其梯度定义为\(\nabla f\left( {\bf{z}} \right) = 2{\nabla _{{\bf{\bar z}}}}f\),则\(\nabla f\left( {\bf{z}} \right)\)给出了函数在点z处的最大上升方向。

证明:

由前文梯度定义,有\({\rm{d}}f = {\mathop{\rm Re}\nolimits} \left\langle {\nabla f,{\rm{ d}}{\bf{z}}} \right\rangle \),带入\(\nabla f\left( {\bf{z}} \right) = 2{\nabla _{{\bf{\bar z}}}}f\)得到\({\rm{d}}f = {\mathop{\rm Re}\nolimits} \left\langle {2{\nabla _{{\bf{\bar z}}}}f,{\rm{ d}}{\bf{z}}} \right\rangle \),因此有不等式

\[\left| {{\rm{d}}f} \right| = \left| {{\mathop{\rm Re}\nolimits} \left\langle {2{\nabla _{{\bf{\bar z}}}}f,{\rm{ d}}{\bf{z}}} \right\rangle } \right| \le \left| {\left\langle {2{\nabla _{{\bf{\bar z}}}}f,{\rm{ d}}{\bf{z}}} \right\rangle } \right|.\]

利用柯西施瓦茨不等式\(\left| {\left\langle {{\bf{v}},{\bf{w}}} \right\rangle } \right| \le \left\| {\bf{v}} \right\|\left\| {\bf{w}} \right\|\)得到

\[\left| {\left\langle {2{\nabla _{{\bf{\bar z}}}}f,{\rm{ d}}{\bf{z}}} \right\rangle } \right| \le \left\| {2{\nabla _{{\bf{\bar z}}}}f} \right\|\left\| {{\rm{d}}{\bf{z}}} \right\|.\]

当且仅当\({\rm{d}}{\bf{z}} = \alpha 2{\nabla _{{\bf{\bar z}}}}f,{\rm{ }}\alpha > 0\)时等号成立。这表明\(\nabla f\left( {\bf{z}} \right) = 2{\nabla _{{\bf{\bar z}}}}f\)是函数的最陡上升方向,而其反方向则对应最陡下降方向。

常用的复变量实值函数导数

表 1 总结了若干常用复变量函数在 Wirtinger 意义下的导数形式。从中可以看出,复变量函数的导数结构可以自然划分为两类:一类是解析函数(如z),其导数仅依赖于z而与\(\bar z\)无关;另一类则是更为常见的实值函数,如\(\left| z \right|\)、\({\left| z \right|^2}\)等,其导数同时依赖于z和\(\bar z\),反映了其非解析性本质。

表 1 常用复变量实值函数导数表

函数\(f\left( z \right)\) \({\partial _z}f\) \({\partial _{\bar z}}f\) 备注
\(z\) 1 0 解析函数
\(\bar z\) 0 1 共轭变量
\({\mathop{\rm Re}\nolimits} \left( z \right)\) 1/2 1/2 线性
\({\mathop{\rm Im}\nolimits} \left( z \right)\) \( - i/2\) \(i/2\) 线性
\({\left| z \right|^2}\) \(\bar z\) \(z\) 链式法则
\(\left| z \right|\) \(\frac{{\bar z}}{{2\left| z \right|}}\) \(\frac{z}{{2\left| z \right|}}\) 链式法则
\(\angle z\) \( - \frac{i}{{2z}}\) \(\frac{i}{{2\bar z}}\)
\(\log \left| z \right|\) \(\frac{1}{{2z}}\) \(\frac{1}{{2\bar z}}\)

特别地,对于实值函数,Wirtinger 导数呈现出明显的共轭对称结构,即\({\partial _z}f\)与\({\partial _{\bar z}}f\)互为共轭。这一性质表明,这两组导数并不提供独立信息,而是对同一实梯度的不同表示。因此,在优化问题中,仅需利用\({\partial _{\bar z}}f\)即可完整刻画梯度方向。

从结构上看,诸如\(\left| z \right|\)、\({\left| z \right|^2}\)等函数均可归结为\(z\bar z\)的函数形式,其导数均可通过链式法则统一推导。这种统一性揭示了复变量实值函数导数的本质来源:所有梯度信息均来自实空间中对\(\left( {x,z} \right)\)的变化,只是在复坐标系中进行了重新组织。

需要注意的是,部分函数如\(\left| z \right|\)、\(\log \left| z \right|\)、和\(\angle z\)在\(z = 0\)处不可导,或在复平面上存在分支不连续性。因此,在实际优化问题中,应避免在这些奇异点附近直接使用上述表达,或通过引入平滑近似来保证数值计算的稳定性。

该表不仅为后续推导提供了基础工具,也揭示了一个重要事实:Wirtinger 导数并未引入新的微分信息,而是将实变量梯度以复变量形式进行表达。这一表达方式在数字全息成像与相位恢复问题中尤为重要,因为待优化变量天然定义在复数域中,采用该形式可以显著简化推导并增强物理一致性。

跨域函数的Wirtinger导数

在前文中,我们主要讨论了复变量到实值函数的情形,即\(f:{\mathbb{C}^n} \to \mathbb{R}\)。而在实际问题中,函数的结构往往更加复杂,变量与函数值可能分布在不同空间中。例如在相位恢复与数字全息成像中,复数光场经过物理传播与强度测量后,会被映射为光强或振幅等实值数据;而传播距离、波长等实值参数又是先被映射为复值函数,再被映射为实值数据。此外,在优化过程中,实值量又被进一步组合成目标函数。因此,一个更一般的问题是:当函数在复数域与实数域之间“跨域”映射时,其导数应如何计算?

为此,我们考虑如下典型结构:复变量z先通过某个函数映射为中间变量s,再由实值函数L作用其上,即

\[z \to s\left( {z,\bar z} \right) \to L\left( s \right)\]
(18)

其中s可以是实值或复值,而L通常为实值函数。这样的结构在计算成像问题中极为常见,例如,例如..,\(L = {\left\| {\left| s \right| - y} \right\|^2}\)。

在这种复合关系下,导数的计算仍然遵循链式法则。首先考虑最常见的情形,即s为实值函数。由于L是关于s的实函数,其变化可以写为

\[{\rm{d}}L = \frac{{\partial L}}{{\partial s}}{\rm{d}}s\]
(19)

s又依赖于z与\(\bar z\),因此其微分为

\[{\rm{d}}s = \frac{{\partial s}}{{\partial z}}{\rm{d}}z + \frac{{\partial s}}{{\partial \bar z}}{\rm{d}}\bar z\]
(20)

将其代入上式,并整理关于\({\rm{d}}\bar z\)的项,可以得到

\[\frac{{\partial L}}{{\partial \bar z}}{\rm{ = }}\frac{{\partial L}}{{\partial s}}\frac{{\partial s}}{{\partial \bar z}}\]
(21)

这一结果具有非常清晰的结构:外层函数提供一个标量权重\(\partial L/\partial s\),内层函数提供关于变量的局部变化\(\partial s/\partial \bar z\)。从形式上看,这正是“梯度乘以局部导数”的结构,也就是我们在实变量中熟悉的反向传播机制。因此,可以将\(\partial L/\partial s\)理解为从后向前传递的梯度信息。

进一步利用复变量梯度与 Wirtinger 导数之间的关系

\[\nabla L = 2\frac{{\partial L}}{{\partial \bar z}}\]
(22)

便得到完整的梯度表达式。这说明,在复数域中进行优化时,虽然变量是复数,但梯度的传播方式与实变量情形在本质上是一致的,只是通过 Wirtinger 导数实现了对复数结构的适配。

接下来考虑另一类情况,即中间变量s为复值,而自变量为实数x。例如,在某些模型中,实参数经过复指数或传播算子后生成复信号。此时,目标函数L仍为实值,但其依赖于\(s\) 和\(\bar s\)。因此,函数的微分应写为

\[{\rm{d}}L = \frac{{\partial L}}{{\partial s}}{\rm{d}}s + \frac{{\partial L}}{{\partial \bar s}}{\rm{d}}\bar s\]
(23)

由于自变量x为实数,且\({\rm{d}}\bar s = \overline {{\rm{d}}s} \),带入式中,整理得到

\[\frac{{\partial L}}{{\partial x}}{\rm{ = 2Re}}\left( {\frac{{\partial L}}{{\partial \bar s}}\frac{{\partial s}}{{\partial x}}} \right)\]
(24)

这一表达式揭示了一个重要特征:当最终梯度作用在实变量上时,其结果必须为实数。因此,在复数乘积中需要显式取实部。这一操作并非额外约束,而是由函数值为实数这一基本要求所决定的。

综上可以看出,跨域函数的导数计算本质上仍然遵循统一的原则:函数的一阶变化由“梯度信息”与“局部变化”共同决定,而 Wirtinger 导数提供了一种在复数域中表达这一结构的自然方式。无论是复变量到实值函数,还是实变量到复值中间变量,这种链式传播关系始终成立。

从更广泛的角度来看,这一结果具有重要意义。在计算成像问题中,物理模型通常在复数域中描述,而测量与优化目标则定义在实数域中。跨域导数正是连接这两个空间的桥梁,使得我们能够在保持物理模型结构的同时,构建标准的梯度下降与反向传播算法。因此,可以说,Wirtinger 导数不仅是一种数学工具,更是复数域优化方法能够实际应用的基础。