5 Ecuaciones diferenciales estocásticas.
5.1 Formulación y Teoremas de Existencia y Unicidad
Definición 5.1 Un proceso \(Y = \{Y_t\}_{t \geq 0}\) es una semimartingala si admite la descomposición canónica \[Y_t = Y_0 + Y_t^c + \sum_{s \leq t} \Delta Y_s,\] donde:
\(Y_0\) es \(\mathcal{F}_0\)-medible.
\(Y^c = (Y_t^c)_{t \geq 0}\) es decir, la parte continua de la descomposición de Itô.
\(\Delta Y_s := Y_s - Y_{s-}\) es el salto de \(Y\) en el instante \(s\); por convención, \(Y_{s-} = \lim_{r \uparrow s} Y_r\).
\(\sum_{s \leq t} |{\Delta Y_s}|^2 < \infty\) c.s. en compactos ( Protter (2005) Cap. II).
5.1.1 Teorema de existencia y unicidad global de una solución fuerte para la EDE con difusión y saltos
Definición 5.2 \(\{x_t\}_{t\geq0}\) es una solución \((\mathcal{F}_t-)\) de
\[\begin{split}
x_t = x_0 &+ \int_0^t b(s,x_s,\omega)\,ds
+ \int_0^t \sigma(s,x_s,\omega)\,dw_s \\
& \ \ \ \ \ \ \ \ \ \ \ + \int_0^t\int_Z R(s,x_{s-},z,\omega)\,\tilde{N}_t(ds,dz),
\qquad t\geq 0
\end{split} \tag{5.1}\]
si y solo si \(\{x_t\}_{t\geq}0\) satisface la Ecuación 5.1. en el caso que \(x_t\in \mathcal{F}_t^{\omega_s}, \forall t \geq 0,\) donde \(\mathcal{F}_t^{\omega_s}\) es la \(\sigma\)-álgebra generada por \(\omega_s, s\leq t\), es una solución fuerte
Consideramos el espacio:
\[ S_{\mathcal{F}}^{2,loc}(R) = \left\{ \begin{array}{c} f(t,\omega) : f(t,\omega) \text{ es } \mathcal{F}_t\text{-adaptada, de valor real, tal que} \\ \mathbb{E}\left[\sup_{t\in[0,T]}|f(t,\omega)|\right]^2 < \infty, \; \forall\, T < \infty \end{array} \right\} \tag{5.2}\]
Teorema 5.1 ( Existencia y unicidad global de una solución fuerte (condiciones de Lipschitz y crecimiento lineal global).). Suponga que:
\(b\) y \(\sigma : [0,\infty) \times \mathbb{R} \times \Omega \to \mathbb{R}\),\(R : [0,\infty) \times \mathbb{R}\times Z \times \Omega \to \mathbb{R}\) son conjuntamente medibles y \(\mathcal{F}_t\) -adaptadas, donde además \(R\) es \(\mathcal{F}_t\)-predecible, tales que \(P\)-c.s.: \[|b(t,x,\omega)| \leq \widetilde{c} (t)(1 + |x|),\] \[|\sigma(t,x,\omega)|^2 + \int_Z |R(t,x,z,\omega)|^2 \pi(dz) \leq \widetilde{c}(t)(1 + |x|^2),\]
\[|b(t,x_1,\omega) - b(t,x_2,\omega)| \leq \widetilde{c}(t) |x_1 - x_2|,\] \[|\sigma(t,x_1,\omega) - \sigma(t,x_2,\omega)|^2 + \int_Z |R(t,x_1,z,\omega) - R(t,x_2,z,\omega)|^2 \pi(dz) \leq \widetilde{c}(t) |x_1 - x_2|^2,\] donde \(\widetilde{c}(t)\) satisface las mismas condiciones que en 1°;
\[x_0 \in \mathcal{F}_0, \quad E|x_0|^2 < \infty.\] Entonces la Ecuación 5.1 tiene una solución única por trayectoria, \(\mathcal{F}_t\)-adaptada, \(\{x_t\}_{t \geq 0} \in S_{\mathcal{F}}^{2,\text{loc}}(\mathbb{R}^d)\).
En el caso en que \(b(t,x,\omega)\) y \(\sigma(t,x,\omega)\) sean \(\mathcal{F}_t^{w,\tilde{N}}\)-adaptadas, y \(R(t,x,z,\omega)\) sea \(\mathcal{F}_t^{w,\tilde{N}}\)-predecible, entonces la solución también es \(\mathcal{F}_t^{w,\tilde{N}}\)-adaptada, es decir, es una solución fuerte.
Demostración. Para algún \(T < \infty\) fijo, se define la norma: \[\| (x_{\cdot}) \|_M^2 = \sup_{t \in [0,T]} e^{-b_0 A(t)} \mathbb{E}[|x_t|^2],\] donde: - \(A(t) := \int_0^t 4\widetilde{c}(s) ds\), - \(b_0 \geq 0\) es una constante que se elegirá más adelante para hacer que el operador sea contractivo, - \(\widetilde{c}(s)\) es la función no aleatoria que aparece en las hipótesis \(1\) y \(2\) (crecimiento lineal y Lipschitz)
Entonces, el espacio sobre el cual se aplica el principio de contracción es: \[H = \left\{ \{x_t\} \in B :B \in L_{\mathfrak{F}}^{2}(\mathbb{R}), \ \| (x_{\cdot}) \|_M < \infty \right\}.\] Sea \(\Phi: H \to H\) el operador definido por: \[(\Phi(x))_t = x_0 + \int_0^t b(s, x_s, \omega)\,ds + \int_0^t \sigma(s, x_s, \omega)\,dW_s + \int_0^t \int_Z R(s, x_{s-}, z, \omega)\,\tilde{N}(ds, dz).\] y sea \(X_t = x_t^{(1)} - x_t^{(2)}\), y \(Y_t = (\Phi(x^{(1)}))_t - (\Phi(x^{(2)}))_t\). Entonces para un \(\omega\) fijo \[Y_t = \int_0^t [b(s, x_s^{(1)}, \omega) - b(s, x_s^{(2)}, \omega)]\,ds + \int_0^t [\sigma(s, x_s^{(1)}, \omega) - \sigma(s, x_s^{(2)}, \omega)]\,dW_s\] \[+ \int_0^t \int_Z [R(s, x_{s-}^{(1)}, z, \omega) - R(s, x_{s-}^{(2)}, z, \omega)]\,\tilde{N}(ds, dz).\] Por comodidad \[Y_t = \int_0^t \Delta b_s\,ds + \int_0^t \Delta \sigma_s\,dW_s + \int_0^t \int_Z \Delta R_s(z)\,\tilde{N}(ds, dz),\] donde \(\Delta b_s := b(s, x_s^{(1)}) - b(s, x_s^{(2)}), \Delta \sigma_s := \sigma(s, x_s^{(1)}) - \sigma(s, x_s^{(2)}), \Delta R_s(z) := R(s, x_{s-}^{(1)}, z) - R(s, x_{s-}^{(2)}, z)\) Puesto que la función \(f(y) = y^2\) tiene derivadas \(f'(y) = 2y, \ \ f''(y) = 2\), al aplicar la fórmula de Itô para semimartingalas con saltos, obtenemos \[Y_t^2 = Y_0^2 + 2 \int_0^t Y_s \, dY_s^c + \int_0^t d\langle Y^c \rangle_s + \sum_{s \leq t} \left[ Y_s^2 - Y_{s-}^2 - 2 Y_{s-} \Delta Y_s \right],\] donde: - \(dY_s^c = \Delta b_s \, ds + \Delta \sigma_s \, dW_s\) es la parte continua, - \(d\langle Y^c \rangle_s = (\Delta \sigma_s)^2 \, ds\) es la variación cuadrática de la parte continua, - \(\Delta Y_s = \int_Z \Delta R_s(z) \, N(\{s\}, dz)\) es el tamaño del salto en el instante \(s\). Al reescribir a la versión integral ya desarrollada y aplicar la formula de itô para \(f(y) = y^2\) aplicada a \(Y_t\) \[|Y_t|^2 = 2 \int_0^t Y_s \, \Delta b_s \, ds + 2 \int_0^t Y_s \, \Delta \sigma_s \, dW_s + \int_0^t |\Delta \sigma_s|^2 \, ds + 2 \int_0^t \int_Z Y_s \, \Delta R_s(z) \, \tilde{N}(ds, dz)\]
\[+ \int_0^t \int_Z |\Delta R_s(z)|^2 \, N(ds, dz).\] Aplicando valor esperado y sus propiedades \[\begin{aligned} \mathbb{E}[ |Y_t|^2] = {}& \mathbb{E}\left[2 \int_0^t Y_s \, \Delta b_s \, ds \right] +\mathbb{E}\left[ 2 \int_0^t Y_s \, \Delta \sigma_s \, dW_s \right] \\ & +\mathbb{E}\left[ \int_0^t |\Delta \sigma_s|^2 \, ds + 2 \int_0^t \int_Z Y_s \, \Delta R_s(s,z) \tilde{N}(ds, dz)\right] \end{aligned}\] \[\mathbb{E}\left[\int_0^t \int_Z |\Delta R_s(z)|^2 \, N(ds, dz)\right]\] Dado que los valores esperados de las integrales respecto a \(dW_s\) y \(\widetilde{N}\) son martingalas, \[\mathbb{E}\left[ \int_0^t Y_s \, \Delta \sigma_s \, dW_s \right] = 0,\] \[\mathbb{E} \left[ \int_0^t \int_Z Y_s \, \Delta R_s(z) \, \tilde{N}(ds, dz)\right] = 0,\] y puesto que \(\mathbb{E}[N(ds,dz)] = \pi(dz)ds,\) se reduce a \[\mathbb{E}[|Y_t|^2] = \mathbb{E}\left[\int_0^t \left(2Y_s \, \Delta b(s) \, + |\Delta \sigma(s)|^2 + \int_Z |\Delta R_s(s,z)|^2 \, \pi ( dz)\right) ds\right].\] Nótese que para el primer término, al aplicar la desigualdad de Cauchy-Schwarz \(2Y_s\Delta b(s)\leq 2|Y_s||\Delta b(s)|,\) y por las hipótesis de Lipschitz
\[|\Delta b(s) |\leq \widetilde{c}(s)|X_s|, \ \ |\Delta \sigma(s)|^2 + \int_z |\Delta R(s.z)|^2 \pi(dz) \leq \widetilde{c}(s)|X_s|^2.\] Además usando la desigualdad \(2ab \leq a^2 + b^2\), se tiene que \[2Y_s\Delta b(s) \leq 2|Y_s |\widetilde{c}(s)|X_s| \leq \widetilde{c}(s)(|Y_s|^2 + |X_s|^2),\] aplicando valor esperado y tomando el supremo \[\mathbb{E}[|{Y_t}|^2] \leq \int_0^t \widetilde{c}(s) \left( \mathbb{E}[|{Y_s}|^2] + \mathbb{E}[|{X_s}|^2] \right) ds.\] \[\mathbb{E}\!\left[ \sup_{0 \leq r \leq t} |{Y_r}|^2 \right] \leq \int_0^t \widetilde{c}(s) \left( \mathbb{E}\!\left[ \sup_{0 \leq r \leq s} |{Y_r}|^2 \right] + \!\left[ \sup_{0 \leq r \leq s} |{X_r}|^2 \right] \right) ds. \tag{5.3}\]
Como se ha eliminado la parte estocástica al tomar el valor esperado anteriormente, se procederá a obtener un acotamiento determinista.
Sea
\[u(t) := \mathbb{E}\!\left[ \sup_{0 \leq r \leq t} |{Y_r}|^2 \right], \qquad v(t) := \mathbb{E}\!\left[ \sup_{0 \leq r \leq t} |{X_r}|^2 \right],\]
entonces podemos reescribir Ecuación 5.3 como
\[u(t) \leq \int_0^t \widetilde{c}(s) \bigl( u(s) + v(s) \bigr) ds,\]
aplicando la desigualdad de Gronwall
\[u(t) \leq \int_0^t \widetilde{c}(s) v(s) \exp\!\left( \int_s^t \widetilde{c}(r) \, dr \right) ds.\]
Multiplicamos ambos lados por \(e^{-b_0 A(t)}\), donde \(A(t) = \int_0^t 4\widetilde{c}(r),dr,\) entonces
\[e^{-b_0 A(t)}u(t) \leq e^{-b_0 A(t)}\int_0^t \widetilde{c}(s) v(s) \exp\!\left( \int_s^t \widetilde{c}(r) \, dr \right) ds.\]
Notemos que
\[\int_s^t \widetilde{c}(r) \, dr = \frac{1}{4} \bigl( A(t) - A(s) \bigr),\]
y por lo tanto,
\[\begin{align*}e^{-b_0 A(t)} u(t)&\leq \int_0^t \widetilde{c}(s)v(s)\exp\!\left( \frac{1}{4}\bigl( A(t) - A(s) \bigr) -b_0 A(t)\right) ds \\ & = \int_0^t \widetilde{c}(s)v(s)exp\left(-\left(b_0-\frac{1}{4}\right)A(t) - \frac{1}{4}A(s)\right)ds.\end{align*}\]
Como \(v(s) \leq e^{b_0A(s)}\|{X}\|_M^2\), se tiene
\[\begin{align*}e^{-b_0 A(t)} u(t)&\leq \|{X}\|_M^2 \int_0^t \widetilde{c}(s)exp\left(-\left(b_0-\frac{1}{4}\right)A(t) - \frac{1}{4}A(s)\right)ds\end{align*}\]
simplificando lo que esta dentro de la exponencial
\[\left(-\left(b_0-\frac{1}{4}\right)A(t) - \frac{1}{4}A(s)\right) = \left(b_0-\frac{1}{4}\right)(A(s) -A(t)),\]
se reduce a \[\begin{align*} e^{-b_0 A(t)} u(t) &\leq \|{X}\|_M^2 \int_0^t \widetilde{c}(s)exp \left(\left(b_0-\frac{1}{4}\right)(A(s) -A(t))\right) ds. \end{align*}\] Dado que \(A(s)-A(t)\leq 0\), el término exponencial es menor que uno si \(b_0\geq\frac{1}{4}.\) Por lo que haciendo un cambio de variable \(U = A(s)\), \(dU=\widetilde{c}(s)ds,\) y \(A(t)= \int_0^t \widetilde{c}(s)ds\) \[\begin{align*} \int_0^t \widetilde{c}(s)exp\left(\left(b_0 - \frac{1}{4}\right) \cdot A(s(-A(t)))\right)ds & = \int_0^{A(t)}exp\left(\left( b_0 - \frac{1}{4}\right)(U-A(t))\right)dU\\ & = exp\left(-\left( b_0 - \frac{1}{4}\right)A(t)\right) \\ & \ \ \ \ \ \ \ \ \ \cdot \int_0^{A(t)}exp\left(\left( b_0 - \frac{1}{4}\right)U\right)dU, \end{align*}\] Si \(b_0>\frac{1}4{}\)
\[\int_0^{A(t)}exp\left(\left( b_0 - \frac{1}{4}\right)U\right)dU = \frac{1}{b_0 - \frac{1}{4}}\left[exp\left(\left(b_0-\frac{1}{4}\right)A(t)\right)-1\right],\] entonces \[e^{-b_0A(t)} u(t) \leq \|{X}\|_M^2 \frac{1}{b_0-\frac{1}{4}}\left[1-exp\left(-\left(b_0-\frac{1}{4}\right)A(t)\right)\right]\leq\|{X}\|_M^2\frac{1}{b_0-\frac{1}{4}},\] por lo tanto \[\|{Y}\|_M^2 = \sup_{t\in[0,T]}e^{-b_0A(t)}u(t)\leq\frac{1}{b_0-\frac{1}{4}} \|{X}\|_M^2.\] Elegimos apropiadamente a \(b_0>\frac{5}{4}\), para que \(\frac{1}{b_0-\frac{1}{4}}<1\), en consecuencia \(\Phi\) es contractivo. Por el principio de contracción de Banach, \(\Phi\)tiene un único punto fijo en \(H\) , que es la solución única de la SDE.
Ahora se demostrará que la solución es única por trayectoria. Sea \(x^{\prime}_{t}\), una versión RCLL(Definición 4.8) del proceso \(x_t\) que es solución de Ecuación 5.1, es decir para cada \(t \in [0,T]\), \(P(x^{\prime}_{t} \neq x_t) = 0\), \(x^{\prime}_{t}\) es solución de Ecuación 5.1 y es un proceso continuo por la derecha y con limite por la izquierda en \(t.\)
Denotemos \(x^{\prime\prime}_{t}\) y \(y_t\) como \[\begin{align*} x^{\prime\prime}_t = x_0 &+ \int_0^t b(s,x_s,\omega)\,ds + \int_0^t \sigma(s,x_s,\omega)\,dw_s \\ & \ \ \ \ \ \ \ \ \ \ \ + \int_0^t\!\int_Z R(s,x_{s-},z,\omega)\,\tilde{N}_t(ds,dz), \qquad t\ \in [0,T] \end{align*}\] \[\begin{align*} y_t = x_0 &+ \int_0^t b(s,x^{\prime}_s,\omega)\,ds + \int_0^t \sigma(s,x^{\prime}_s,\omega)\,dw_s \\ & \ \ \ \ \ \ \ \ \ \ \ + \int_0^t\!\int_Z R(s,x^{\prime}_{s-},z,\omega)\,\tilde{N}_t(ds,dz), \qquad t\in [0,T]. \end{align*}\] Dado que \(x^{\prime}\) es una versión RCLL de un proceso adaptado, por el teorema () \(x^{\prime}\) es adaptado. \ Puesto que \(x_t \in L^2(\Omega \times [0,T])\) y ademas ambos procesos son medibles como funciones \((t,\omega) \mapsto x_t(\omega)\) con respecto a la \(\sigma-\)álgebra producto \(\mathcal{B}([0,T])\bigotimes\mathcal{F}.\) Entonces para cada \(t\), \(|x^{\prime}_t - x_t|^2 =0\) casi seguramente, es decir \[\mathbb{E}[|x^{\prime}_t - x_t|^2] = 0, \quad \text{para todo } t \in [0,T]. \] Ahora, bajo la suposición de medibilidad conjunta (que se cumple si, por ejemplo, los procesos son progresivamente medibles, lo cual es cierto para soluciones de SDEs con coeficientes medibles), podemos aplicar el (teorema de Fubini), \[\mathbb{E}[\int_0^T|x^{\prime}_t - x_t|^2dt] = \int_0^T\mathbb{E}[|x^{\prime}_t - x_t|^2]dt =0. \tag{5.4}\] Consideremos el conjunto donde los procesos no coinciden \[N := \{(t,\omega) \in [0,T]\times \Omega : x^{\prime}_t(\omega)\neq x_t(\omega)\},\] este conjunto es medible en \(\mathcal{B}([0,T])\bigotimes\mathcal{F}\) ya que \(x^{\prime}_t(\omega) - x_t(\omega)\) es una función medible y además es equivalente a \(N = \{(t,\omega) : |x^{\prime}_t(\omega)- x_t(\omega)|^2>0\}.\)
De la Ecuación 5.4 se sigue que \[(dt\bigotimes\mathbb{P})(N) = \int_0^T \mathbb{P}(x^{\prime}_t\neq x_t)dt = \mathbb{E} \left[\int_0^T 1_N(t,\omega)dt\right]= 0. \tag{5.5}\]
Como \(N\) tiene medida cero se puede decir que \(x^\prime_t = x_t\) para \((dt\bigotimes\mathbb{P})\)- casi todo \((t,\omega)\).
Ahora, consideremos el conjunto denso \(D:=\mathbb{Q}\cap[0,T]\) . Definimos el evento \[\Omega_0 := \bigcap_{t \in D} \left\{ \omega \in \Omega : x_t(\omega) = x'_t(\omega) \right\}.\] Dado que \(D\) es numerable y \(\mathbb{P}(x_t = x'_t) = 1\) para cada \(t \in D\), se tiene \(\mathbb{P}(\Omega_0) = 1\). Fijemos \(\omega \in \Omega_0\), como ambas trayectorias \(t \mapsto x_t(\omega)\) y \(t \mapsto x'_t(\omega)\) son RCLL (continuas por la derecha con límites por la izquierda) y coinciden en el conjunto denso \(D\), se sigue que \[x_t(\omega) = x'_t(\omega) \quad \text{para todo } t \in [0,T].\] Por lo tanto, el conjunto \[\left\{ \omega \in \Omega : x_t(\omega) = x'_t(\omega) \text{ para todo } t \in [0,T] \right\}\] contiene a \(\Omega_0\), y en consecuencia tiene probabilidad uno. Por lo tanto, coinciden para todo $ t .$ Por lo que se concluye que la solución de la ecuación estocástica diferencial con saltos es única por trayectoria. Además, como los coeficientes \(b\), \(\sigma\) y \(R\) son \(\mathcal{F}_t^{W,\widetilde{N}}\)-adaptados, se sigue la solución es fuerte.\(\quad \square\)
Definición 5.3 \[\tau^N := \inf\{ t \geq 0 : |x_t| > N \}\] Se demuestra que \(\tau^N \uparrow \infty\) c.s. usando: - Estimaciones en \(S^{2,\mathrm{loc}}\) vía BDG y Grönwall, - Cota uniforme en \(N\): \(\mathbb{E}[\sup_{t \leq T} |x_t^N|^2] \leq K_T < \infty\), - Argumento de contradicción: \(N^2 \mathbb{P}(\tau^N \leq T) \leq K_T \Rightarrow \mathbb{P}(\tau^N \leq T) \to 0\).
5.1.2 Teorema de existencia y unicidad local de una solución fuerte para la EDE con difusión y saltos
Teorema 5.2 Si la condición \(2°\) del Teorema anterior se debilita a \(2°'\) tal que para cada \(N = 1, 2,\cdots,\) existe una función no aleatoria \(\widetilde{c}^N(t)\) tal que para cada \(|x_1|, |x_2| \leq N\), \[|b(t, x_1, \omega) - b(t, x_2, \omega)| \leq \widetilde{c}^N(t) |x_1 - x_2|,\] \[|\sigma(t, x_1, \omega) - \sigma(t, x_2, \omega)|^2 + \int_Z |R(t, x_1, z, \omega) - R(t, x_2, z, \omega)|^2 \pi(dz) \leq \widetilde{c}^N(t) |x_1 - x_2|^2,\] donde \(\widetilde{c}^N(t) \geq 0\) satisface \[\int_0^T \widetilde{c}^N(t)\,dt < \infty \quad \text{para cada } T < \infty,\] manteniendo la condición de crecimiento lineal global (independiente de \(N\)): \[\begin{align*} |b(t,x,\omega)| &\leq \tilde{c}(t)(1 + |x|), \\ |\sigma(t,x,\omega)|^2 + \int_Z |R(t,x,z,\omega)|^2 \, \nu(dz) &\leq \tilde{c}(t)(1 + |x|^2), \end{align*}\] con \(\tilde{c}(t) \geq 0\) no aleatoria y \(\int_0^T \tilde{c}(t)\,dt < \infty\) para todo \(T > 0\), y todas las demás hipótesis del Teorema anterior siguen siendo válidas. Entonces la conclusión del Teorema anterior sigue siendo cierta.
Demostración. Sea \(b^{N}(t,x,\omega)\) definida de la siguiente manera \[\begin{split} b^{N}(t,x,\omega) = \left\lbrace\begin{array}{c}b(t,x,\omega), \quad \text{si }|x|\leq N, \\ b(t,N_{\frac{x}{|x|}},\omega), \quad \text{si } |x| > N.\end{array}\right. \end{split} \tag{5.6}\] De igual manera se hace para \(\sigma^{N}(t,x,\omega)\) y \(R^{N}(t,x,z,\omega),\) consideramos \[\begin{split} x_t = x_0 &+ \int_0^t b_N(s,x^N_s,\omega)\,ds + \int_0^t \sigma^N(s,x^N_s,\omega)\,dw_s \\ & \ \ \ \ \ \ \ \ \ \ \ + \int_0^t\!\int_Z R^N(s,x^N_{s-},z,\omega)\,\tilde{N}_t(ds,dz), \qquad t\geq 0 \end{split} \tag{5.7}\] Como \(b^N, \sigma^N, R^N\) son globalmente Lipschitz en \(x\) y satisfacen las condiciones de medibilidad y crecimiento del Teorema anterior, se deduce inmediatamente la existencia y unicidad de una solución fuerte \(\{x^N_t\}_{t\geq 0}\in S^{2,loc}_{\mathcal{F}}(\mathbb{R})\). Definimos el tiempo de paro \(\tau^N:=inf\{t\geq0:|x^N_t|> N\}\), en el intervalo estocástico \([0, \tau^N),\) se tiene \(x^N_t=x_t,\) donde \(x_t\) es una solución de la ecuación original(Ecuación 5.1). Para $ t < ^N$, se tiene \(|x_t^N| \leq N\). Por la definición de los coeficientes truncados, esto implica
\[b^N(t,x_t^N,\omega) = b(t,x_t^N,\omega), \quad \sigma^N(t,x_t^N,\omega) = \sigma(t,x_t^N,\omega),\]
\[R^N(t,x_{t-}^N,z,\omega) = R(t,x_{t-}^N,z,\omega).\] Por lo tanto, en \([0, \tau^N)\), la ecuación (7) coincide exactamente con la ecuación (1). Así, la restricción de \(x^N\) a \([0, \tau^N)\) es una solución local de (1).
Sea $ N < M$, entonces, en el intervalo \([0, \tau^N)\), ambas soluciones \(x^N\) y \(x^M\) satisfacen la misma SDE, por la unicidad del Teorema anterior aplicada a la ecuación original en el intervalo estocástico, se concluye que \[x_t^N = x_t^M \quad \text{para todo } t < \tau^N, \quad \text{c.s.}\] lo que permite definir un proceso $ x = {x_t}_{t }$ mediante \[x_t := x_t^N \quad \text{para } t \in [0, \tau^N).\] Gracias a la compatibilidad entre las soluciones truncadas , esta definición es independiente de \(N\), por lo tanto \(x\) está bien definido en todo \([0, \infty)\), siempre que \(\tau^N \to \infty\) casi seguramente cuando \(N \to \infty\). Supongamos ahora por contradicción que existe ( T_0 > 0 ) tal que \[\mathbb{P}\left( \lim_{N \to \infty} \tau^N \leq T_0 \right) > 0.\]
Definamos \(\tau := \lim_{N \to \infty} \tau^N\). Entonces, para el evento \(A := \{ \tau \leq T_0 \}\), se tiene \(\mathbb{P}(A) > 0\), y para todo \(N\), \(\tau^N \leq T_0\) en \(A\), con \(|x_{\tau^N}^N| = N.\) Aplicando la desigualdad de Itô a la solución truncada \(x^N\) \[|x_t^N|^2 = |x_0|^2 + 2\int_0^t x_s^N \cdot b^N(s,x_s^N) ds + 2\int_0^t x_s^N \cdot \sigma^N(s,x_s^N) dw_s\]
\[+ \int_0^t \|\sigma^N(s,x_s^N)\|^2 ds + \int_0^t \int_Z |c^N(s,x_{s-}^N,z)|^2 N(ds,dz)\]
\[+ 2\int_0^t \int_Z x_{s-}^N \cdot c^N(s,x_{s-}^N,z) \tilde{N}(ds,dz).\] Tomando supremo en \([0, T_0]\) y esperanza, y usando la desigualdad \((a+b+c)^2 \leq 3(a^2 + b^2 + c^2)\), obtenemos \[\mathbb{E}\left[ \sup_{0 \leq t \leq T_0} \|x_t^N\|^2 \right] \leq C\Bigg( \mathbb{E}[\|x_0\|^2] + \mathbb{E}\left[ \sup_{t \leq T_0} \left| \int_0^t x_s^N \cdot b^N(s,x_s^N)\,ds \right| \right] \] \[+ \mathbb{E}\left[ \sup_{t \leq T_0} \left| \int_0^t x_s^N \cdot \sigma^N(s,x_s^N)\,dW_s \right|^2 \right] + \mathbb{E}\left[ \int_0^{T_0} \|\sigma^N(s,x_s^N)\|^2 ds \right]\] \[+ \mathbb{E}\left[ \int_0^{T_0} \int_Z \|R^N(s,x_{s-}^N,z)\|^2 \nu(dz) ds \right] + \mathbb{E}\left[ \sup_{t \leq T_0} \left| \int_0^t \int_Z x_{s-}^N \cdot R^N(s,x_{s-}^N,z)\,\tilde{N}(ds,dz) \right|^2 \right] \Bigg).\] Ahora acotamos cada término usando la condición de crecimiento lineal global y la desigualdad de Burkholder–Davis–Gundy (BDG). Para el termino con drift aplicamos Cauchy–Schwarz y crecimiento lineal: \[\left| x_s^N \cdot b^N(s,x_s^N) \right| \leq \|x_s^N\| \cdot \tilde{c}(s)(1 + \|x_s^N\|) \leq \tilde{c}(s)\bigl(\|x_s^N\| + \|x_s^N\|^2\bigr) \leq \tilde{c}(s)\bigl(1 + 2\|x_s^N\|^2\bigr).\] Luego \[\begin{aligned} \mathbb{E}\left[ \sup_{t \leq T_0} \left| \int_0^t x_s^N \cdot b^N(s,x_s^N)\,ds \right| \right] \leq{}& \int_0^{T_0} \tilde{c}(s)\bigl(1 + 2\mathbb{E}[\|x_s^N\|^2]\bigr) ds \\ &\leq C\left(1 + \int_0^{T_0} \tilde{c}(s) \mathbb{E}\left[ \sup_{r \leq s} \|x_r^N\|^2 \right] ds\right). \end{aligned}\] Ahora para el término browniano por la desigualdad de BDG con \(p=2\), existe una constante universal \(C_{\mathrm{BDG}} > 0\) tal que \[\mathbb{E}\left[ \sup_{t \leq T_0} \left| \int_0^t x_s^N \cdot \sigma^N(s,x_s^N)\,dW_s \right|^2 \right] \leq C_{\mathrm{BDG}} \, \mathbb{E}\left[ \int_0^{T_0} \|x_s^N \cdot \sigma^N(s,x_s^N)\|^2 ds \right].\] Usando Cauchy–Schwarz y crecimiento lineal: \[\|x_s^N \cdot \sigma^N(s,x_s^N)\|^2 \leq \|x_s^N\|^2 \cdot \|\sigma^N(s,x_s^N)\|^2 \leq \|x_s^N\|^2 \cdot \tilde{c}(s)(1 + \|x_s^N\|^2) \leq \tilde{c}(s)\bigl(\|x_s^N\|^2 + \|x_s^N\|^4\bigr).\] Sin embargo, al trabajar con cotas en \(L^2\), es estándar usar directamente: \[\|\sigma^N(s,x_s^N)\|^2 \leq \tilde{c}(s)(1 + \|x_s^N\|^2),\] y por lo tanto:
\[\begin{align*} \mathbb{E}\left[ \sup_{t \leq T_0} \left| \int_0^t x_s^N \cdot \sigma^N(s,x_s^N)\,dW_s \right|^2 \right] \leq C_{\mathrm{BDG}} \int_0^{T_0} \tilde{c}(s)\left(1 + \mathbb{E}[\|x_s^N\|^2]\right) ds\\ \leq C\left(1 + \int_0^{T_0} \tilde{c}(s) \mathbb{E}\left[ \sup_{r \leq s} \|x_r^N\|^2 \right] ds\right). \end{align*}\]
Análogamente para el término de saltos, por la versión con saltos de BDG, se tiene \[\mathbb{E}\left[ \sup_{t \leq T_0} \left| \int_0^t \int_Z x_{s-}^N \cdot R^N(s,x_{s-}^N,z)\,\tilde{N}(ds,dz) \right|^2 \right] \leq C \, \mathbb{E}\left[ \int_0^{T_0} \int_Z \|x_{s-}^N \cdot R^N(s,x_{s-}^N,z)\|^2 \nu(dz) ds \right]\]
\[\leq C \int_0^{T_0} \tilde{c}(s)\left(1 + \mathbb{E}[\|x_s^N\|^2]\right) ds \leq C\left(1 + \int_0^{T_0} \tilde{c}(s) \mathbb{E}\left[ \sup_{r \leq s} \|x_r^N\|^2 \right] ds\right).\] Por crecimiento lineal global se acotan los términos de variación cuadrática \[\mathbb{E}\left[ \int_0^{T_0} \|\sigma^N(s,x_s^N)\|^2 ds \right] + \mathbb{E}\left[ \int_0^{T_0} \int_Z \|R^N(s,x_{s-}^N,z)\|^2 \nu(dz) ds \right] \leq C \int_0^{T_0} \tilde{c}(s)\left(1 + \mathbb{E}[\|x_s^N\|^2]\right) ds.\] Reuniendo todas las estimaciones, definimos \[u(t) := \mathbb{E}\left[ \sup_{0 \leq r \leq t} \|x_r^N\|^2 \right],\] y obtenemos \[u(t) \leq C \left( 1 + \mathbb{E}[\|x_0\|^2] + \int_0^t \tilde{c}(s) u(s) ds \right).\] Por la desigualdad de Grönwall, se deduce \[u(T_0) \leq C\left(1 + \mathbb{E}[\|x_0\|^2]\right) \exp\!\left( C \int_0^{T_0} \tilde{c}(s) ds \right) =: K_{T_0}.\] \(K_{T_0}\) no depende de \(N\), ya que \(\tilde{c}(t)\) es independiente de \(N\) por hipótesis.\ Ahora, observamos que en el evento \(A\) se tiene \(\tau_N \leq T_0\) y \(\|x^N_{\tau_N}\| = N\), luego \[N^2 \, \mathbb{P}(A) \leq \mathbb{E}\left[ \sup_{0 \leq t \leq \tau_N \wedge T_0} \|x^N_t\|^2 \right] \leq K_{T_0}.\] Esto implica \[\mathbb{P}(A) \leq \frac{K_{T_0}}{N^2} \xrightarrow{N \to \infty} 0,\] lo cual contradice \(\mathbb{P}(A) > 0\). Por lo tanto, \(\mathbb{P}(A) = 0\) para todo \(T_0 > 0\), y en consecuencia, \[\mathbb{P}\!\left( \lim_{N \to \infty} \tau_N = \infty \right) = 1.\] Esto garantiza que el proceso \(x = \{x_t\}_{t \geq 0}\) está definido para todo \(t \geq 0\), pertenece a \(S^{2,\mathrm{loc}}_{\mathcal{F}}(\mathbb{R})\), y es la única solución fuerte de la SDE Ecuación 5.1. La unicidad por trayectoria se sigue del argumento estándar usando densidad de \(\mathbb{Q} \cap [0,T]\) y la propiedad cádlág de las soluciones, como se demostró en el Teorema Teorema 5.1. \(\quad \square\)
5.2 Modelo de Cramér–Lundberg Extendido.
5.2.1 Formulación del modelo base (C-L clásico).
El modelo clásico de Cramér-Lundberg (C-L) constituye un pilar fundamental en la teoría de riesgo actuarial, ofreciendo una representación matemáticamente rigurosa de la evolución del capital de una aseguradora a lo largo del tiempo. Formalmente, consideramos un proceso estocástico \(\{U(t)\}_{t \geq 0}\) que representa la reserva de capital de la aseguradora en el instante \(t\). El modelo clásico de Cramér-Lundberg (Lundberg (1903)) postula que esta reserva evoluciona mediante: \[U(t) = u + ct - \sum_{i=1}^{N(t)} Y_i, \tag{5.8}\] donde:
\(U(t)\): Reserva o capital en el tiempo \(t\),
\(u\): Capital inicial,
\(c\): Tasa de entrada de primas (constante en el modelo clásico),
\(N(t)\): Proceso de conteo de siniestros, modelado como un proceso de Poisson homogéneo con intensidad \(\lambda > 0\). Formalmente, \(N(t)\) es un proceso y \(\mathbb{E}[N(t)] = \lambda t\).
\(\{Y_i\}_{i \geq 1}\): Secuencia de variables aleatorias independientes e idénticamente distribuidas (i.i.d.) que representan las magnitudes de los siniestros, con distribución \(F_Y\) y función de densidad \(f_Y\) (en caso de ser absolutamente continua). Se asume que \(\mathbb{E}[Y_1] = \mu < \infty\) y \(\text{Var}(Y_1) = \sigma^2 < \infty\) para garantizar la existencia de momentos necesarios en el análisis.
La suposición de parámetros constantes (especialmente la tasa de primas \(c\) y la intensidad del proceso de Poisson \(\lambda\)) limita su aplicabilidad en entornos dinámicos donde las condiciones del mercado cambian con el tiempo, como es el caso del mercado asegurador mexicano que enfrenta variaciones estacionales en los siniestros catastróficos, cambios en las tasas de inversión y fluctuaciones en la estructura de primas debido a factores macroeconómicos como la inflación.
5.2.2 Extensión del modelo (C-L) a un modelo con difusión y saltos.
Formalmente, extendemos el proceso de reservas \(\{U(t)\}_{t \geq 0}\) del modelo (C-L) que sigue la dinámica estocástica de una ecuación diferencial con difusión y saltos (EDES).
Las ecuaciones diferenciales estocásticas con saltos (EDES) constituyen una extensión natural del cálculo estocástico clásico de Itô,(Sección 4.7) permitiendo modelar dinámicas que combinan evolución continua con cambios abruptos discontinuos. Este marco teórico es esencial para representar fenómenos en los que coexisten tendencias suaves y eventos extremos, como es el caso de los mercados financieros y las carteras de seguros sujetas a siniestros catastróficos.
Una ecuación diferencial estocástica con saltos y parámetros dependientes del tiempo toma la forma general (Capítulo 5) \[dX(t) = a(t,X(t^-))dt + b(t,X(t^-))dW(t) + \int_{\mathbb{R}} R(t,X(t^-),x) \tilde{N}(dt,dx), \tag{5.9}\] donde los coeficientes \(a\), \(b\) y \(R\) satisfacen condiciones de Lipschitz y crecimiento lineal que garantizan existencia y unicidad de soluciones fuertes. La notación \(X(t^-)\) denota el valor del proceso predecible(Sección 4.6) inmediatamente antes del tiempo \(t\), crucial para manejar correctamente las discontinuidades inducidas por los saltos.(Teorema 5.1) \(N(dt,dx)\) es una medida de Poisson aleatoria que cuenta los saltos de tamaño \(x\) en el intervalo \(dt\), y \(\tilde{N}(dt,dx) = N(dt,dx) - \nu(dx)dt\) es su compensador con \(\nu\) siendo la medida de Poisson compensada. Esta descomposición separa explícitamente la componente difusiva continua (\(\sigma W(t)\)) de los saltos de pequeña magnitud (integrado compensado) y los saltos de gran magnitud (integrado puro).(Sección 4.5)
Para capturar la dinámica real del mercado Mexicano, extendemos el modelo incorporando dependencia temporal en todos los parámetros.
En el contexto actuarial, esta estructura matemática permite integrar de manera coherente tres elementos fundamentales:
La acumulación determinista de primas,
La evolución estocástica de las inversiones con volatilidad de mercado,
La ocurrencia aleatoria de siniestros catastróficos modelados como saltos negativos. El uso de parámetros dependientes del tiempo \((c(t)\), \(r(t)\), \(\sigma(t))\) refleja adecuadamente la estacionalidad en la frecuencia de siniestros, las fluctuaciones en las tasas de interés y la variabilidad de la volatilidad financiera observadas en mercados emergentes como el Mexicano. Incorporando los fundamentos teóricos al marco de la ecuación el proceso de reservas \(\{U(t)\}_{t \geq 0}\) se presenta como la siguiente ecuación diferencial estocástica con saltos (Ecuación 5.9) \[dU(t) = \underbrace{c(t)\,dt}_{\text{Primas}} + \underbrace{U(t^-)r(t)\,dt}_{\text{Rendimientos}} + \underbrace{U(t^-)\sigma(t)\,dW(t)}_{\text{Volatilidad}} - \underbrace{dJ(t)}_{\text{Siniestros}}, \tag{5.10}\] donde
\(c(t) > 0\) es la tasa de prima neta tiempo-dependiente, ajustada por inflación y estacionalidad en la demanda (Sección 7.1.1);
\(r(t)\) representa la tasa de interés instantánea de la cartera de inversiones, modelada como un proceso determinista que refleja la estructura de tasas de Banxico, los rendimientos de CETES y globales (ILS) (Sección 7.1.2) ;
\(\sigma(t) > 0\) es la volatilidad tiempo-dependiente de las inversiones, estimada mediante una combinación convexa de la volatilidad de activos locales (CETES) y globales (ILS), ponderada por la composición de la cartera según reportes de la CNSF (Sección 7.1.3);
\(W(t)\) es un movimiento browniano estándar que modela el riesgo de mercado continuo;
\(J(t)\): Proceso de saltos compuesto que modela siniestros catastróficos.
Por tanto las soluciones del proceso de reservas presentado por la ecuación (Ecuación 5.10) bajo las especificaciones del modelo (con tasas de prima, interés y volatilidad acotadas), cumple con las condiciones de Lipschitz y crecimiento lineal que garantizan existencia y unicidad de soluciones fuertes para el proceso de reservas.
\(N_m(t)\): Proceso de Poisson no homogéneo para eventos meteorológicos con intensidad \(\lambda_m(t)\),
\(N_s(t)\): Proceso de Poisson para eventos sísmicos con intensidad constante \(\lambda_s\),
\(Y_k^{(m)} \sim \text{TruncNormal}(\mu_m, \sigma_m^2)\): Severidad de siniestros meteorológicos,
\(Y_\ell^{(s)} \sim \text{TruncNormal}(\mu_s, \sigma_s^2)\): Severidad de siniestros sísmicos.
5.3 Análisis Asintótico y Estimación de Parámetros
5.3.1 Estimación de la Varianza Integrada
Teorema 5.3 Definamos la variación de bipotencia con retardo \(h = 1\), \[BV_n := \frac{1}{\mu_1^2} \sum_{i=2}^{n} \bigl|r_{i-1,n}\bigr| \cdot \bigl|r_{i,n}\bigr|, \quad \mu_1 = \sqrt{\frac{2}{\pi}},\] se quiere demostrar que es un estimador consistente en probabilidad de la varianza integrada \[IV := \int_0^1 \sigma^2(t)\,dt,\] es decir, \[BV_n \xrightarrow[n\to\infty]{\mathbb{P}} IV.\]
Demostración. Cada retorno se descompone en su parte continua y su parte por saltos \[r_{i,n} = C_{i,n} + S_{i,n},\] donde \[C_{i,n} = \int_{(i-1)\Delta}^{i\Delta} \sigma(t)\,dW(t), \quad S_{i,n} = \sum_{(i-1)\Delta < t \leq i\Delta} \Delta J_t.\] Por la hipótesis de actividad finita de los saltos, se tiene que \[\mathbb{P}\bigl(S_{i-1,n} \neq 0 \text{ y } S_{i,n} \neq 0\bigr) \xrightarrow[n\to\infty]{} 0.\] Por lo tanto, con probabilidad \(1\), \[|r_{i-1,n}| \cdot |r_{i,n}| = |C_{i-1,n}| \cdot |C_{i,n}| + o_p(n^{-1}).\] Dado que \(\sigma(t)\) es cádlág, es localmente constante en el límite. Así, condicionalmente, \[\mathbb{E}\bigl[|C_{i-1,n}| \cdot |C_{i,n}| \mid \mathcal{F}_{(i-1)\Delta}\bigr] = \mu_1^2 \cdot \sigma^2((i-1)\Delta) \cdot \frac{1}{n} + o(n^{-1}),\] donde \(\mu_1 = \mathbb{E}[|Z|] = \sqrt{2/\pi}\), \(Z \sim N(0,1)\). Sumando sobre \(i = 2,\dots,n\), obtenemos \[\mathbb{E}[BV_n] = \frac{1}{\mu_1^2} \sum_{i=2}^n \mathbb{E}\bigl[|r_{i-1,n}| \cdot |r_{i,n}|\bigr] = \sum_{i=2}^n \sigma^2((i-1)\Delta) \cdot \frac{1}{n} + o(1). \quad \square\]
5.3.2 Hipótesis técnicas
Hipotesis 1 (Cádlág y previsibilidad) El proceso \(\sigma^2(t)\) es cádlág (continuo por la derecha con límites por la izquierda) y predecible.
Hipótesis 2 (Acotamiento local) Existe una sucesión creciente de tiempos de parada \((\tau_m)_{m \geq 1}\), con \(\tau_m \uparrow \infty\) casi seguramente, tal que \[\sup_{t \leq \tau_m} \sigma^2(t) < \infty \quad \text{c.s.}\]
Hipótesis 3 (Integrabilidad) \[\int_0^1 \sigma^2(t)\,dt < \infty \quad \text{casi seguramente}.\]
Teorema 5.4 Bajo las Hipótesis \(1\)–\(3\) y la condición de actividad finita de los saltos, se cumple: \[BV_n \xrightarrow[n\to\infty]{\mathbb{P}} \int_0^1 \sigma^2(t)\,dt.\] Es decir, la variación de bipotencia es un estimador consistente en probabilidad de la varianza integrada.
Sea \((\Omega, \mathcal{F}, (\mathcal{F}_t)_{t \in [0,1]}, \mathbb{P})\) un espacio de probabilidad filtrado que satisface las (completo y continuo por la derecha).
Supongamos que \(\sigma^2 = (\sigma^2(t))_{t \in [0,1]}\) es un proceso estocástico. Definimos la partición regular del intervalo \([0,1]\) como \(t_i^n := \frac{i}{n}, \quad i = 0,1,\dots,n.\) La suma de Riemann izquierda asociada a \(\sigma^2\) es \[S_n := \frac{1}{n} \sum_{i=1}^n \sigma^2\!\left(t_{i-1}^n\right) = \frac{1}{n} \sum_{i=1}^n \sigma^2\!\left(\frac{i-1}{n}\right).\] Denotamos el límite objetivo como la varianza integrada \[IV := \int_0^1 \sigma^2(t)\,dt.\] se busca demostrar que, para todo \(\varepsilon > 0\), \[\lim_{n \to \infty} \mathbb{P}\bigl( |S_n - IV| > \varepsilon \bigr) = 0,\] es decir, \(S_n \xrightarrow[n \to \infty]{\mathbb{P}} IV\).
Demostración. Supongamos que existe una constante \(M < \infty\) tal que \[\sigma^2(t, \omega) \leq M \quad \text{para todo } t \in [0,1], \text{ c.s.}\] Como \(\sigma^2(\cdot, \omega)\) es cádlág, para cada trayectoria fija \(\omega\), la función \(t \mapsto \sigma^2(t,\omega)\) es Lebesgue-integrable y Riemann-integrable en \([0,1]\) (pues las funciones cádlág tienen a lo sumo un número numerable de discontinuidades). Por resultados clásicos del análisis real, para cada \(\omega\) fijo, \[S_n(\omega) \xrightarrow[n \to \infty]{} IV(\omega).\] Es decir, la convergencia es casi segura. La convergencia casi segura implica convergencia en probabilidad: \[S_n \xrightarrow{\mathbb{P}} IV \quad \text{cuando } \sigma^2 \text{ está uniformemente acotado}.\] Dado que \(\sigma^2\) es localmente acotado, existe una sucesión creciente de tiempos de parada \((\tau_m)_{m \geq 1}\) tal que \(\tau_m \uparrow \infty\) c.s. cuando \(m \to \infty\) y \(\displaystyle \sup_{t \leq \tau_m} \sigma^2(t) \leq m \quad \text{c.s.}\)
Definimos el proceso truncado \[\sigma_m^2(t) := \sigma^2(t) \cdot \mathbf{1}_{\{t \leq \tau_m\}} + m \cdot \mathbf{1}_{\{t > \tau_m\}}.\]
Entonces: \(\sigma_m^2\) es uniformemente acotado por \(m\), - \(\sigma_m^2(t) \to \sigma^2(t)\) c.s. para cada \(t\), cuando \(m \to \infty\), - \(IV_m := \int_0^1 \sigma_m^2(t)\,dt \to IV\) c.s. por el teorema de convergencia monótona.
Definimos la suma de Riemann asociada al proceso truncado: \[S_n^{(m)} := \frac{1}{n} \sum_{i=1}^n \sigma_m^2\!\left(\frac{i-1}{n}\right).\] Del Paso 1, para cada \(m\) fijo, \[S_n^{(m)} \xrightarrow[n \to \infty]{\mathbb{P}} IV_m.\] Además, como \(\sigma_m^2 \to \sigma^2\) c.s. y ambas son acotadas por una función integrable (\(\sigma^2\)), se tiene: \[|S_n^{(m)} - S_n| \leq \frac{1}{n} \sum_{i=1}^n |\sigma_m^2(t_{i-1}^n) - \sigma^2(t_{i-1}^n)| \xrightarrow[m \to \infty]{} 0 \quad \text{c.s.}\] Fijemos \(\varepsilon > 0\). Queremos mostrar: \[\lim_{n \to \infty} \mathbb{P}(|S_n - IV| > \varepsilon) = 0.\] Por la desigualdad triangular, \[|S_n - IV| \leq |S_n - S_n^{(m)}| + |S_n^{(m)} - IV_m| + |IV_m - IV|.\] Luego, para cualquier \(m\), \[\begin{aligned} \mathbb{P}(|S_n - IV| > {}& \varepsilon) \leq \mathbb{P}(|S_n - S_n^{(m)}| > \varepsilon /3) + \mathbb{P}(|S_n^{(m)} - IV_m| > \varepsilon /3) \\ & \ \ \ \ +\mathbb{P}(|IV_m - IV| > \varepsilon /3). \end{aligned}\]
Por construcción, \(\sigma_m^2(t) \to \sigma^2(t)\) c.s. para cada \(t \in [0,1]\) cuando \(m \to \infty\). Además, como \(\sigma^2\) es localmente acotado y \(\int_0^1 \sigma^2(t)\,dt < \infty\) c.s., existe una variable integrable que domina la secuencia \((\sigma_m^2)_{m \geq 1}\). En efecto, para todo \(m\), \[0 \leq \sigma_m^2(t) \leq \sigma^2(t) + m \cdot \mathbf{1}_{\{t > \tau_m\}} \leq \sigma^2(t) + C,\] para alguna constante \(C\), y \(\sigma^2\) es integrable c.s., luego \(\sigma^2 + C \in L^1(\Omega \times [0,1])\). Por el teorema de convergencia dominada \[IV_m = \int_0^1 \sigma_m^2(t)\,dt \xrightarrow[m \to \infty]{\text{c.s.}} \int_0^1 \sigma^2(t)\,dt = IV.\] La convergencia casi segura implica convergencia en probabilidad, por lo que \[\mathbb{P}(|IV_m - IV| > \varepsilon/3) \xrightarrow[m \to \infty]{} 0.\] Por lo tanto, existe \(m_0\) tal que para todo \(m \geq m_0\), \[\mathbb{P}(|IV_m - IV| > \varepsilon/3) < \frac{\varepsilon}{3}.\] Para el segundo termino se tiene que \[|S_n - S_n^{(m)}| \leq \frac{1}{n} \sum_{i=1}^n \left| \sigma^2\!\left(\frac{i-1}{n}\right) - \sigma_m^2\!\left(\frac{i-1}{n}\right) \right|.\] Tomando esperanza y usando la linealidad \[\mathbb{E}[|S_n - S_n^{(m)}|] \leq \frac{1}{n} \sum_{i=1}^n \mathbb{E}\left[ \left| \sigma^2\!\left(\frac{i-1}{n}\right) - \sigma_m^2\!\left(\frac{i-1}{n}\right) \right| \right].\] Dado que la partición es fina y la función \(t \mapsto |\sigma^2(t) - \sigma_m^2(t)|\) es no negativa, la suma de Riemann está acotada por la integral \[\frac{1}{n} \sum_{i=1}^n \mathbb{E}\left[ \left| \sigma^2\!\left(\frac{i-1}{n}\right) - \sigma_m^2\!\left(\frac{i-1}{n}\right) \right| \right] \leq \mathbb{E}\left[ \int_0^1 |\sigma^2(t) - \sigma_m^2(t)|\,dt \right].\] Nuevamente, por el teorema de convergencia dominada, el lado derecho tiende a 0 cuando \(m \to \infty\), y esta cota no depende de \(n\). Por lo tanto \[\sup_{n \geq 1} \mathbb{E}[|S_n - S_n^{(m)}|] \xrightarrow[m \to \infty]{} 0.\] Aplicando la desigualdad de Markov(citar) \[\mathbb{P}(|S_n - S_n^{(m)}| > \varepsilon/3) \leq \frac{\mathbb{E}[|S_n - S_n^{(m)}|]}{\varepsilon/3} \leq \frac{\sup_n \mathbb{E}[|S_n - S_n^{(m)}|]}{\varepsilon/3}.\] Como el numerador tiende a \(0\) uniformemente en \(n\), se concluye \[\sup_{n \geq 1} \mathbb{P}(|S_n - S_n^{(m)}| > \varepsilon/3) \xrightarrow[m \to \infty]{} 0.\] Así, para el mismo para \(m_0\) \[\mathbb{P}(|S_n - S_n^{(m)}| > \varepsilon/3) < \frac{\varepsilon}{3} \quad \text{para todo } n\] Ahora para \(m\) fijo, \(\sigma_m^2\) es uniformemente acotado por \(m\), cádlág y predecible. Por lo tanto, para cada \(\omega \in \Omega\), la función \(t \mapsto \sigma_m^2(t,\omega)\) es Riemann-integrable en \([0,1]\), pues posee a lo sumo un número numerable de discontinuidades. Por lo que para cada \(\omega\), la suma de Riemann izquierda converge a la integral \[S_n^{(m)}(\omega) \xrightarrow[n \to \infty]{} IV_m(\omega).\] Esto implica \(S_n^{(m)} \xrightarrow{\text{c.s.}} IV_m\). Dado que la convergencia casi segura implica convergencia en probabilidad, luego \[\mathbb{P}(|S_n^{(m)} - IV_m| > \varepsilon/3) \xrightarrow[n \to \infty]{} 0.\] Para el \(m_0\) elegido anteriormente, existe \(N \in \mathbb{N}\) tal que \(\forall n \geq N\), \[\mathbb{P}(|S_n^{(m_0)} - IV_{m_0}| > \varepsilon/3) < \varepsilon/3.\] Sustituyendo en (2), para todo \(n \geq N\), \[\mathbb{P}(|S_n - IV| > \varepsilon) < \frac{\varepsilon}{3} + \frac{\varepsilon}{3} + \frac{\varepsilon}{3} = \varepsilon.\] Como \(\varepsilon > 0\) fue arbitrario, concluimos \[\lim_{n \to \infty} \mathbb{P}(|S_n - IV| > \varepsilon) = 0.\] es decir, \(S_n \xrightarrow{\mathbb{P}} IV. \quad \square\)
5.4 Estimación de la Intensidad de Saltos.
5.4.1 Estimador \(\hat{\lambda}_n\) y elección del umbral \(\tau_n = \alpha \Delta_n^{\varpi}\).
Definimos el estimador de intensidad de saltos mediante el método de conteo con umbral: \[\hat{\lambda}_n := \frac{1}{T} \sum_{i=1}^n \mathbf{1}_{\{ |\Delta_i^n X| > \tau_n \}}, \tag{5.11}\]
donde \(\tau_n > 0\) es un umbral determinista que depende de \(n\). Siguiendo la metodología de (Aı̈t-Sahalia y Jacod (2009)) (ver Sección 4.3 y la ecuación (24)), elegimos el umbral de la forma \[ \tau_n = \alpha \Delta_n^{\varpi}, \quad \alpha > 0, \quad \varpi \in \left(0, \frac{1}{2}\right). \tag{5.12}\] Esta elección es crucial y satisface dos propiedades asintóticas fundamentales:
Detección de saltos: \(\tau_n \to 0\) cuando \(n \to \infty\). Esto asegura que, asintóticamente, cualquier salto de tamaño fijo (no nulo) será detectado, ya que su magnitud superará al umbral.
Eliminación del ruido difusivo: \(\tau_n / \sqrt{\Delta_n} = \alpha \Delta_n^{\varpi - 1/2} \to \infty\). Esto asegura que los incrementos correspondientes a la parte continua del proceso (de orden estocástico \(\sqrt{\Delta_n}\)) rara vez superarán el umbral, controlando así los falsos positivos.
Teorema 5.5 (Consistencia del estimador de intensidad). Supongamos que el proceso \(X\) satisface el modelo (Ecuación 6.2) bajo el Assumption 1 de (Aı̈t-Sahalia y Jacod (2009)) y tiene actividad finita de saltos, \(\lambda = \int_E \lambda(dx) < \infty\).
Considérese un régimen asintótico de alta frecuencia en el que \(\Delta_n \to 0\) y \(T = n \Delta_n \to \infty\) cuando \(n \to \infty\). Entonces, bajo la elección del umbral (Ecuación 5.11) con \(\varpi \in (0, 1/2)\), el estimador (Ecuación 5.12) es consistente en probabilidad para \(\lambda\), es decir, \[\hat{\lambda}_n \xrightarrow{\mathbb{P}} \lambda.\]
Demostración. Un falso positivo ocurre cuando un incremento \(\Delta_i^n X\) sin salto (es decir, generado únicamente por la parte continua del proceso) excede el umbral \(\tau_n\). Para controlar este fenómeno, debemos analizar la magnitud de la parte continua. La herramienta fundamental es la cota proporcionada en la de (Aı̈t-Sahalia y Jacod (2009)) (Sección 8.1), derivada bajo el Assumption 1. Para cualquier \(\eta > 0\) y \(\theta \in (0,1)\), se cumple \[ \mathbb{E}_{i-1}^n \left( |\Delta_i^n X - \delta_i^n|^2 \wedge \eta^2 \right) \leq K \Delta_n (\eta^2 + \Delta_n^{\theta} + \epsilon(\theta)) \tag{5.13}\] donde - \(\mathbb{E}_{i-1}^n(\cdot) = \mathbb{E}(\cdot \mid \mathcal{F}_{(i-1)\Delta_n})\), - \(\delta_i^n = \sigma_{(i-1)\Delta_n} (W_{i\Delta_n} - W_{(i-1)\Delta_n})\) es la aproximación gaussiana de la parte continua, - \(\epsilon(\theta) \to 0\) cuando \(\theta \to 0\), - \(K\) es una constante que depende de los coeficientes del modelo.
Esta desigualdad implica que la parte continua del incremento es de orden \(O_p(\sqrt{\Delta_n})\). Ahora, utilizando la desigualdad de Chebyshev o argumentos de cola gaussiana, la probabilidad de que un incremento puramente difusivo exceda \(\tau_n\) se puede acotar por \[\mathbb{P}(|\Delta_i^n X| > \tau_n \mid \text{no hay salto en } [(i-1)\Delta_n, i\Delta_n]) \leq C \exp\left( -c \frac{\tau_n^2}{\Delta_n} \right).\] Dado que \(\tau_n^2 / \Delta_n = \alpha^2 \Delta_n^{2\varpi-1} \to \infty\) (porque \(\varpi < 1/2\)), el término exponencial decae a cero más rápido que cualquier potencia de \(\Delta_n\). Por lo tanto, el número esperado de falsos positivos, \(\mathrm{FP}_n\), satisface \[\mathbb{E}[\mathrm{FP}_n] = \sum_{i=1}^n \mathbb{P}(\text{falso positivo en } i) \leq n \cdot o(\Delta_n) = o(T).\] En consecuencia, \(\mathrm{FP}_n / T \xrightarrow{\mathbb{P}} 0\). Un falso negativo ocurre cuando un salto real \(J\) ocurre en un intervalo de muestreo, pero su magnitud \(|J|\) es menor o igual que \(\tau_n\), por lo que no se detecta. Sin embargo, dado que el proceso tiene actividad finita, el número de saltos en \([0,T]\) es finito c.s., y cada salto tiene tamaño \(|J_k| > 0\) c.s. Dado que \(\tau_n \to 0\) por construcción, existe un \(n_0(\omega)\) (aleatorio pero finito) tal que para todo \(n \geq n_0(\omega)\), se cumple \(\tau_n < \min_{k=1,\dots,N_T} |J_k|(\omega)\). Por lo tanto, asintóticamente, todos los saltos son detectados y el número de falsos negativos, \(\mathrm{FN}_n\), satisface \(\mathbb{E}[\mathrm{FN}_n] \to 0\), lo que implica \(\mathrm{FN}_n / T \xrightarrow{\mathbb{P}} 0\). Sea \(N_T\) el número real (y finito) de saltos en \([0,T]\). De los pasos anteriores, se deduce que el número de saltos detectados por el estimador coincide asintóticamente con \(N_T\): \[\sum_{i=1}^n \mathbf{1}_{\{ |\Delta_i^n X| > \tau_n \}} = N_T + \mathrm{FP}_n - \mathrm{FN}_n = N_T + o_{\mathbb{P}}(T). \tag{5.14}\] Dividiendo por \(T\), obtenemos \[\hat{\lambda}_n = \frac{N_T}{T} + o_{\mathbb{P}}(1). \tag{5.15}\] Finalmente, dado que la actividad de saltos es finita y la intensidad es constante \(\lambda\), el proceso de conteo \(N_T\) es un proceso de Poisson con media \(\mathbb{E}[N_T] = \lambda T\) y varianza \(\mathrm{Var}(N_T) = \lambda T\). Por la ley de los grandes números para procesos de Poisson, se tiene que cuando \(T \to \infty\), \[\frac{N_T}{T} \xrightarrow{\mathbb{P}} \lambda.\]
Combinando las dos últimas convergencias, concluimos que \[\hat{\lambda}_n \xrightarrow{\mathbb{P}} \lambda,\] lo cual demuestra el Teorema 5.5. \(\quad \square\)
5.4.2 Estimación no paramétrica de la distribución de severidad de los saltos.
La estimación de la intensidad de saltos desarrollada en la Sección 6.4.1 permite identificar, mediante un procedimiento basado en umbrales, los incrementos de la trayectoria observada cuya magnitud resulta incompatible con la variación continua esperada. Sin embargo, el conteo de dichos incrementos proporciona únicamente información acerca de la frecuencia de ocurrencia de los eventos detectados y no caracteriza la magnitud de los saltos.
En esta sección se desarrolla el procedimiento estadístico necesario para obtener, a partir de las detecciones identificadas por el umbral, una estimación no paramétrica de la distribución de severidad. El procedimiento se formula sobre la trayectoria del proceso de reservas y no requiere especificar previamente una familia paramétrica para la distribución de las magnitudes de los saltos.
La formulación se desarrolla inicialmente para una trayectoria genérica y posteriormente puede aplicarse de manera idéntica a cada uno de los esquemas numéricos considerados en el Capítulo 7.
El Teorema 5.5 garantiza que \(\hat\lambda_n\) (Ecuación 5.11) es un estimador consistente de la intensidad total \(\lambda\), pero es un estadístico agregado: cuenta cuántos incrementos superan el umbral \(\tau_n\) sin identificar cuáles instantes contienen un salto ni qué tamaño tuvo cada uno. Esta sección extiende el marco de la Sección 5.4 en dos direcciones: Se pondera el umbral por la volatilidad instantánea local \(\hat\sigma(t_{n-1})\), refinamiento introducido por Mancini (2009) y Lee y Mykland (2008) sobre el umbral no ponderado de la Ecuación 5.12; y se convierte el conteo agregado en un procedimiento a nivel de evento que recupera, para cada salto detectado, su instante y su magnitud, sobre los cuales se ajusta un modelo de distribución agregada, sin requerir identificación del tipo de siniestro (meteorológico o sísmico).
Se trabaja sobre el proceso de reservas \(\{U(t)\}_{t\ge 0}\) de la Ecuación 5.10, observado en la malla \(t_0<t_1<\dots<t_n\) con paso constante \(\Delta_n=t_i-t_{i-1}\), sobre \(N_{\text{sim}}\) trayectorias simuladas independientes \(U^{(1)},\dots,U^{(N_{\text{sim}})}\) (Sección 8.2).
La estimación de la distribución de severidad se realiza directamente a partir de las trayectorias simuladas del proceso de reserva y de los incrementos identificados por el procedimiento de detección de saltos descrito previamente. El procedimiento es común a los esquemas numéricos considerados, por lo que se aplica de manera independiente a las trayectorias obtenidas mediante el método de Milstein compensado y mediante el método semi-implícito compensado.
En particular, la inferencia no paramétrica no utiliza información acerca de la causa física del evento. Por consiguiente, las observaciones utilizadas en esta sección corresponden exclusivamente a los decrementos detectados en las trayectorias agregadas. Las etiquetas utilizadas durante la simulación para distinguir los mecanismos generadores de los saltos, cuando se dispone de ellas, se reservan exclusivamente para la validación de la capacidad de detección y no intervienen en la construcción de los estimadores.
Sea
\[ 0=t_0<t_1<\cdots<t_n=T, \qquad \Delta_n=t_i-t_{i-1}, \tag{5.16}\]
la partición temporal utilizada para la simulación, y sea
\[ U^{(j)}(t_i), \qquad j=1,\ldots,N_{\mathrm{sim}}, \]
la trayectoria \(j\)-ésima del proceso de reserva, con \(N_{\mathrm{sim}}=1000\).
La metodología se desarrolla mediante las siguientes etapas: construcción de incrementos relativos, estimación local de la volatilidad, definición del umbral de detección, identificación de incrementos anómalos, extracción de las severidades detectadas, estimación de su distribución empírica y de su densidad mediante KDE, ajuste paramétrico auxiliar y cuantificación de incertidumbre mediante bootstrap por trayectorias.
5.4.2.1 Incrementos relativos y estimación local de la volatilidad
Para cada trayectoria se define el incremento relativo
\[ \widetilde r_{n,i}^{(j)} := \frac{ U^{(j)}(t_i)-U^{(j)}(t_{i-1}) }{ U^{(j)}(t_{i-1}) }, \qquad i=1,\ldots,n, \quad j=1,\ldots,N_{\mathrm{sim}}. \tag{5.17}\]
Esta normalización permite expresar los cambios de la reserva en términos relativos a su nivel inmediatamente anterior. La estimación de la escala local asociada a la componente continua se obtiene mediante una versión agregada de la variación bipotencia realizada, siguiendo la construcción de variación bipotencia propuesta para separar la variación continua de la contribución de saltos (Barndorff-Nielsen y Shephard 2004). Para una ventana de \(K\) observaciones se define
\[ \widehat\sigma^2(t_{i-1}) := \frac{\pi}{2} \frac{1}{K\Delta_nN_{\mathrm{sim}}} \sum_{j=1}^{N_{\mathrm{sim}}} \sum_{k=1}^{K} \left| \widetilde r_{n,i-k}^{(j)} \right| \left| \widetilde r_{n,i-k+1}^{(j)} \right|. \tag{5.18}\]
La correspondiente estimación de la escala local es
\[ \widehat\sigma(t_{i-1}) := \sqrt{\widehat\sigma^2(t_{i-1})}. \tag{5.19}\]
La agregación sobre las trayectorias es coherente con la implementación numérica, en la cual la componente de difusión utiliza la misma función de volatilidad para las trayectorias simuladas. En este sentido, el pooling permite utilizar conjuntamente las réplicas Monte Carlo para estimar la escala local común. El estimador se emplea como una medida local de escala para distinguir fluctuaciones ordinarias de incrementos cuya magnitud resulta incompatible con la dinámica continua en la escala temporal considerada (Barndorff-Nielsen y Shephard 2004).
5.4.2.2 Umbral de detección de saltos
A partir de la estimación local de volatilidad se define el umbral dependiente del tamaño de la malla mediante
\[ \tau_n(t_{i-1}) := \alpha \widehat\sigma(t_{i-1}) \Delta_n^{\varpi}, \qquad \alpha>0, \qquad \varpi\in\left(0,\frac12\right). \tag{5.20}\]
La elección del exponente \(\varpi\) responde a dos requerimientos asintóticos. En primer lugar,
\[ \Delta_n^{\varpi}\longrightarrow0 \qquad \text{cuando} \qquad \Delta_n\longrightarrow0, \tag{5.21}\]
mientras que
\[ \frac{\Delta_n^\varpi}{\sqrt{\Delta_n}} = \Delta_n^{\varpi-\frac12} \longrightarrow\infty. \tag{5.22}\]
Por consiguiente, el umbral tiende a cero, pero lo hace más lentamente que la escala de las fluctuaciones continuas de orden \(\sqrt{\Delta_n}\). Esta propiedad constituye la base de los procedimientos de detección por umbral: bajo las condiciones de regularidad apropiadas, permite separar incrementos asociados a saltos de las fluctuaciones producidas por la componente continua (Mancini 2009).
Para eliminar, en la medida de lo posible, la contribución regular de la dinámica de la reserva, se define el residuo relativo
\[ \widetilde e_{n,i}^{(j)} := \widetilde r_{n,i}^{(j)} - \left[ \frac{c(t_{i-1})}{U^{(j)}(t_{i-1})} + r(t_{i-1}) \right]\Delta_n. \tag{5.23}\]
El conjunto de índices identificados como detecciones en la trayectoria \(j\) se define entonces mediante
\[ D^{(j)} := \left\{ i\in\{1,\ldots,n\}: \left| \widetilde e_{n,i}^{(j)} \right| > \tau_n(t_{i-1}) \right\}. \tag{5.24}\]
La condición anterior constituye el criterio principal de detección utilizado en los programas de simulación. La construcción es consistente con los procedimientos de detección no paramétrica por umbral desarrollados para procesos observados discretamente (Mancini 2009; Lee y Mykland 2008).
Proposición 5.1 Bajo el esquema de detección anterior, la clasificación de un incremento como evento detectado depende únicamente de la trayectoria observada, del estimador local de escala y de los parámetros \((\alpha,\varpi)\). En consecuencia, el procedimiento es aplicable tanto a las trayectorias simuladas como, una vez observadas las variables correspondientes, a datos empíricos en los cuales no se disponga de información sobre la causa física del evento.
5.4.2.3 Estadístico normalizado para diagnóstico
Como medida complementaria para caracterizar la magnitud relativa de los incrementos se utiliza el estadístico normalizado
\[ \mathcal L_i^{(j)} := \frac{ \widetilde r_{n,i}^{(j)} }{ \widehat\sigma(t_{i-1}) }. \tag{5.25}\]
Bajo ausencia de saltos y bajo las condiciones de regularidad requeridas por la aproximación asintótica correspondiente, este estadístico permite utilizar una escala aproximadamente gaussiana como referencia para evaluar la magnitud de las fluctuaciones. La construcción de estadísticas normalizadas para detectar saltos en procesos observados discretamente está relacionada con el procedimiento de Lee–Mykland (Lee y Mykland 2008).
En particular, las cantidades asociadas a la aproximación de falsos positivos deben interpretarse como medidas diagnósticas y no como probabilidades exactas de error de clasificación para el procedimiento completo.
5.4.2.4 Extracción de las severidades detectadas
Una vez identificado el conjunto \(D^{(j)}\), se obtiene para cada índice detectado una estimación de la magnitud monetaria del decremento residual. Para ello se define
\[ \widehat Y_i^{(j)} := - \widetilde e_{n,i}^{(j)} U^{(j)}(t_{i-1}), \qquad i\in D^{(j)}. \tag{5.26}\]
Se conservan únicamente las observaciones que satisfacen
\[ \widehat Y_i^{(j)}>0. \tag{5.27}\]
La cantidad \(\widehat Y_i^{(j)}\) debe interpretarse como una severidad detectada: representa la magnitud monetaria del decremento residual que el procedimiento atribuye al intervalo \((t_{i-1},t_i]\).
Esta distinción es importante porque la detección se realiza sobre una trayectoria discretizada. Si varios saltos físicos ocurren dentro de un mismo intervalo de discretización, el procedimiento opera sobre el incremento agregado de dicho intervalo y, por tanto, una única observación \(\widehat Y_i^{(j)}\) puede representar la contribución conjunta de varios eventos no resolubles temporalmente en la malla utilizada.
En consecuencia, sea
\[ \mathcal Y := \left\{ \widehat Y_i^{(j)}: j=1,\ldots,N_{\mathrm{sim}}, \ i\in D^{(j)}, \ \widehat Y_i^{(j)}>0 \right\}, \tag{5.28}\]
y sea \(N_Y:=|\mathcal Y|\) el número total de severidades detectadas. La inferencia de esta sección se realiza sobre la distribución agregada de \(\mathcal Y\).
Definición 5.4 La función de distribución de severidad detectada se define por
\[ F_Y(y) := \mathbb P(\widehat Y\leq y\mid D=1), \tag{5.29}\]
donde \(D=1\) indica que el incremento fue clasificado como una detección válida por el procedimiento definido en Ecuación 5.24 y que la severidad satisface Ecuación 5.27.
5.4.2.5 Sensibilidad respecto de los parámetros del detector
El procedimiento depende de los parámetros \(\alpha\) y \(\varpi\). Por esta razón, antes de fijar los valores utilizados para la comparación entre los métodos numéricos se realiza un análisis de sensibilidad sobre una malla de valores candidatos.
Para una combinación \((\alpha,\varpi)\) se registra el número de detecciones y, cuando corresponde, las estadísticas descriptivas asociadas. La tasa media de detección se expresa como
\[ R(\alpha,\varpi) := \frac{ N_{\mathrm{det}}(\alpha,\varpi) }{ N_{\mathrm{sim}} }, \tag{5.30}\]
donde \(N_{\mathrm{det}}(\alpha,\varpi)\) representa el número medio de detecciones por trayectoria bajo la combinación considerada.
5.4.2.6 Función de distribución empírica de las severidades
La estimación no paramétrica de la función de distribución de severidad se realiza mediante la función de distribución empírica asociada al conjunto \(\mathcal Y\) definido en Ecuación 5.28. Esta representación evita imponer una familia paramétrica para la distribución de severidades (Aalen 1978). Sea \(Y_1,\ldots,Y_{N_Y}\) una enumeración de dicho conjunto. Entonces,
\[ \widehat F_Y(y) = \frac{1}{N_Y} \sum_{\ell=1}^{N_Y} \mathbf 1_{\{Y_\ell\leq y\}}. \tag{5.31}\]
La función \(\widehat F_Y\) constituye el estimador no paramétrico principal de la distribución de severidad detectada. No requiere especificar una familia paramétrica para la distribución subyacente.
La comparación entre los métodos numéricos se realiza utilizando las funciones empíricas obtenidas a partir de sus respectivas colecciones de severidades detectadas. Las diferencias entre ambas funciones deben interpretarse como diferencias en la distribución de las severidades recuperadas por el procedimiento de detección aplicado a cada esquema numérico.
5.4.2.7 Estimación no paramétrica de la densidad mediante KDE en escala logarítmica
Dado que las severidades son positivas y pueden presentar asimetría y colas derechas, la densidad se estima mediante una transformación logarítmica. Sea
\[ Z_\ell:=\log(Y_\ell), \qquad \ell=1,\ldots,N_Y. \tag{5.32}\]
Sobre la escala transformada se utiliza un estimador de densidad por núcleo. La estimación de densidades mediante métodos de núcleo constituye una técnica no paramétrica estándar; su formulación y propiedades generales pueden consultarse en Silverman (Silverman 1986).
\[ \widehat f_Z(z) = \frac{1}{N_Yh} \sum_{\ell=1}^{N_Y} K\left( \frac{z-Z_\ell}{h} \right), \tag{5.33}\]
donde \(K\) es una función núcleo y \(h>0\) es el ancho de banda.
Por la transformación \(z=\log(y)\), se tiene
\[ \frac{\mathrm d z}{\mathrm d y} = \frac{1}{y}, \qquad y>0. \tag{5.34}\]
Por consiguiente, la densidad estimada sobre la escala original de las severidades es
\[ \widehat f_Y(y) = \frac{1}{y} \widehat f_Z(\log y), \qquad y>0. \tag{5.35}\]
Esta transformación es la que corresponde a la implementación computacional. La estimación KDE constituye una representación suavizada de la densidad asociada a la distribución empírica, mientras que Ecuación 5.31 continúa siendo el estimador no paramétrico directo de la función de distribución.
5.4.2.8 Ajustes paramétricos auxiliares de la distribución de severidad
Con el propósito de disponer de representaciones paramétricas de referencia, se ajustan mediante máxima verosimilitud las distribuciones Lognormal, Gamma y Weibull. Estos modelos se consideran únicamente como familias auxiliares para describir la muestra detectada y comparar representaciones paramétricas. Estos ajustes son complementarios a la estimación no paramétrica y no implican que alguna de las familias consideradas constituya el mecanismo generador verdadero de las severidades.
Para la distribución Lognormal se utiliza
\[ f(y;\mu,\sigma) = \frac{1}{y\sigma\sqrt{2\pi}} \exp\left[ -\frac{(\log y-\mu)^2}{2\sigma^2} \right], \qquad y>0. \tag{5.36}\]
Para la distribución Gamma,
\[ f(y;k,\theta) = \frac{1}{\Gamma(k)\theta^k} y^{k-1} e^{-y/\theta}, \qquad y>0, \tag{5.37}\]
y para la distribución Weibull,
\[ f(y;k,\theta) = \frac{k}{\theta} \left( \frac{y}{\theta} \right)^{k-1} \exp\left[ -\left( \frac{y}{\theta} \right)^k \right], \qquad y>0. \tag{5.38}\]
Sea \(\widehat\ell\) el valor máximo de la log-verosimilitud y sea \(p\) el número de parámetros estimados. El criterio de información de Akaike, introducido como una medida de selección de modelos basada en información, se define mediante (Akaike 1974)
\[ AIC = 2p-2\widehat\ell. \tag{5.39}\]
El AIC se utiliza exclusivamente como criterio de comparación entre las familias paramétricas consideradas, de acuerdo con el propósito original del criterio de Akaike (Akaike 1974). La estimación no paramétrica de Ecuación 5.31 y Ecuación 5.35 no depende de seleccionar una de estas familias.
5.4.2.9 Incertidumbre mediante bootstrap por trayectoria
Debido a que varias detecciones pueden proceder de una misma trayectoria, las observaciones de severidad no se consideran automáticamente independientes. Para preservar la estructura de dependencia intra-trayectoria, el procedimiento bootstrap se realiza remuestreando trayectorias completas. El uso del bootstrap para cuantificar incertidumbre sigue la formulación general de Efron y Tibshirani (Efron y Tibshirani 1993).
En cada réplica bootstrap se seleccionan \(N_{\mathrm{sim}}\) trayectorias con reemplazo y se reconstruye el conjunto de severidades detectadas correspondiente a la muestra remuestreada. Para un estadístico \(\theta\) de interés, se obtiene una colección
\[ \widehat\theta^{(1)}, \ldots, \widehat\theta^{(B)}, \tag{5.40}\]
donde \(B\) es el número de réplicas bootstrap.
El intervalo percentil de nivel de confianza \(1-\gamma\) se define mediante
\[ IC_{1-\gamma} = \left[ \widehat\theta^{\,(\gamma/2)}, \widehat\theta^{\,(1-\gamma/2)} \right], \tag{5.41}\]
donde \(\widehat\theta^{\,(q)}\) representa el cuantil \(q\) de la distribución empírica de las réplicas bootstrap.
Estos intervalos cuantifican la variabilidad asociada al muestreo de las trayectorias bajo el procedimiento de detección y los parámetros \((\alpha,\varpi)\) fijados. No incorporan incertidumbre adicional derivada de una eventual selección de estos parámetros.
5.4.3 Distribución de los tiempos entre saltos detectados.
En esta sección se estudia la distribución de los tiempos entre detecciones, así como la intensidad temporal de los eventos detectados.
El procedimiento de estimación opera sobre la información disponible en las trayectorias discretizadas; por tanto, los tiempos utilizados en esta sección son los tiempos de los incrementos clasificados como detecciones por el criterio de Ecuación 5.24.
5.4.3.1 Tiempos de detección y proceso de conteo
Para cada trayectoria \(j\), sean
\[ \tau_k^{(j)} := t_{i_k}, \qquad k=1,\ldots,K_j, \tag{5.42}\]
los tiempos correspondientes a los índices \(i_k\in D^{(j)}\), ordenados de manera creciente. Aquí \(K_j\) denota el número de detecciones de la trayectoria \(j\).
El proceso de conteo de detecciones se define por
\[ N^{(j)}(t) := \#\left\{ k: \tau_k^{(j)}\leq t \right\}, \qquad t\in[0,T]. \tag{5.43}\]
Este proceso cuenta exclusivamente los eventos que han sido identificados por el detector y constituye la base para el análisis de intensidad y de tiempos entre detecciones. La formulación mediante procesos de conteo es el marco natural para describir tiempos de ocurrencia y sus intensidades (Aalen 1978; Andersen et al. 1993).
5.4.3.2 Intensidad temporal no paramétrica
Debido a la periodicidad anual incorporada en la estructura temporal del modelo, la intensidad de las detecciones se estima mediante un suavizamiento de núcleo sobre un dominio periódico.
Sea \(P=365\) el periodo anual expresado en días. Para \(t,\tau\in[0,P)\) se define la distancia circular
\[ d_{\mathrm{circ}}(t,\tau) := \min\left\{ |t-\tau|, P-|t-\tau| \right\}. \tag{5.44}\]
Sea \(h>0\) el ancho de banda. El estimador de intensidad por núcleo circular utilizado en la implementación es
\[ \widehat\lambda_h(t) = \frac{1}{N_{\mathrm{sim}}h} \sum_{j=1}^{N_{\mathrm{sim}}} \sum_{k=1}^{K_j} K\left( \frac{ d_{\mathrm{circ}}(t,\tau_k^{(j)}) }{h} \right). \tag{5.45}\]
El factor \(1/N_{\mathrm{sim}}\) produce una intensidad media por trayectoria, mientras que el factor \(1/h\) corresponde a la normalización del estimador de núcleo.
La Ecuación 5.45 representa el estimador efectivamente utilizado en los programas. Su construcción pertenece a la familia de estimadores de intensidad por núcleo (Ramlau-Hansen 1983). Por tanto, no se identifica este estimador con el estimador clásico de Nelson–Aalen.
5.4.3.3 Análisis de sensibilidad del ancho de banda
El ancho de banda \(h\) controla el grado de suavizamiento de la intensidad estimada. Valores pequeños permiten identificar variaciones temporales más localizadas, mientras que valores grandes producen una representación más suave. Este compromiso entre suavizamiento y variabilidad es inherente a los estimadores de intensidad por núcleo (Ramlau-Hansen 1983).
Para evaluar la estabilidad de la estructura temporal, se consideran distintos valores de \(h\), incluyendo los utilizados en la implementación computacional. La comparación de las curvas \(\widehat\lambda_h(t)\) permite determinar si las características estacionales principales permanecen estables frente a cambios razonables en el nivel de suavizamiento.
Este análisis se interpreta como un estudio de sensibilidad y no como un procedimiento automático de selección óptima del ancho de banda.
5.4.3.4 Tiempos entre detecciones
Para cada trayectoria con al menos dos detecciones se define el tiempo entre detecciones consecutivas mediante
\[ \Delta\tau_k^{(j)} := \tau_k^{(j)} - \tau_{k-1}^{(j)}, \qquad k=2,\ldots,K_j. \tag{5.46}\]
La colección de todas las cantidades \(\Delta\tau_k^{(j)}\) constituye la muestra utilizada para caracterizar la distribución marginal de los tiempos entre detecciones.
En el caso particular de un proceso de Poisson homogéneo con intensidad constante \(\lambda\), los tiempos entre eventos son variables aleatorias independientes con distribución exponencial. Esta propiedad es un resultado fundamental de la teoría de procesos de conteo y de la teoría de renovación (Andersen et al. 1993).
\[ \Delta\tau \sim \operatorname{Exp}(\lambda). \tag{5.47}\]
Por el contrario, cuando la intensidad depende del tiempo, los tiempos en la escala cronológica original no tienen, en general, una distribución exponencial con parámetro constante. Por esta razón, la comparación con una distribución exponencial debe entenderse como una hipótesis de referencia correspondiente al caso homogéneo.
5.4.3.5 Distribuciones paramétricas de referencia
Para describir de manera complementaria la distribución de los tiempos entre detecciones se consideran las familias Exponencial, Weibull y Gamma.
La densidad exponencial está dada por
\[ f(x;\lambda) = \lambda e^{-\lambda x}, \qquad x>0, \quad \lambda>0. \tag{5.48}\]
La densidad Weibull se define mediante
\[ f(x;k,\theta) = \frac{k}{\theta} \left( \frac{x}{\theta} \right)^{k-1} \exp\left[ -\left( \frac{x}{\theta} \right)^k \right], \qquad x>0. \tag{5.49}\]
La densidad Gamma está dada por
\[ f(x;k,\theta) = \frac{1}{\Gamma(k)\theta^k} x^{k-1}e^{-x/\theta}, \qquad x>0. \tag{5.50}\]
Los parámetros de las tres familias se estiman mediante máxima verosimilitud incorporando el tratamiento de censura descrito en la siguiente sección.
5.4.3.6 Censura administrativa por la derecha
El horizonte de observación es finito y está dado por \([0,T]\). Si una trayectoria presenta una última detección en \(\tau_{K_j}^{(j)}\) y no se observa una detección posterior antes de \(T\), el tiempo entre esta última detección y el siguiente evento es desconocido. Por tanto, no debe tratarse como una observación completa.
El tiempo observado hasta el final del horizonte se define mediante
\[ c^{(j)} := T-\tau_{K_j}^{(j)}. \tag{5.51}\]
Esta cantidad constituye una observación censurada por la derecha del siguiente tiempo entre eventos.
La inclusión explícita de estas observaciones evita introducir artificialmente un último tiempo entre detecciones igual al intervalo restante hasta \(T\).
5.4.3.7 Estimación descriptiva de la supervivencia
La función de supervivencia de los tiempos entre detecciones se define como
\[ S(x) := \mathbb P(\Delta\tau>x). \tag{5.52}\]
Para representar descriptivamente esta función bajo la presencia de observaciones censuradas se utiliza el estimador de Kaplan–Meier, introducido por Kaplan y Meier para la estimación no paramétrica bajo observaciones incompletas (Kaplan y Meier 1958).
El estimador de Kaplan–Meier permite conservar la información proporcionada por las observaciones censuradas sin considerarlas como eventos completos. En este contexto, su interpretación es descriptiva y se refiere a la distribución marginal de los tiempos entre detecciones.
Debe señalarse que las detecciones sucesivas de una misma trayectoria pueden presentar dependencia temporal. El marco de procesos de conteo y análisis de supervivencia permite formular explícitamente esta estructura (Aalen 1978; Andersen et al. 1993). Por esta razón, la utilización de Kaplan–Meier no implica que la colección de todos los gaps constituya una muestra independiente e idénticamente distribuida. La estimación se emplea como herramienta descriptiva para caracterizar la supervivencia marginal.
5.4.3.8 Máxima verosimilitud con observaciones censuradas
Sea \(f(x;\theta)\) la densidad de una familia paramétrica de tiempos entre detecciones y sea
\[ S(x;\theta) = 1-F(x;\theta) \]
su función de supervivencia.
Si \(\Delta\tau_i\) representa una observación completa y \(c_j\) una observación censurada por la derecha, la contribución de una observación completa a la verosimilitud es
\[ L_i(\theta) = f(\Delta\tau_i;\theta), \tag{5.53}\]
mientras que la contribución de una observación censurada es
\[ L_j^{\mathrm{cens}}(\theta) = S(c_j;\theta). \tag{5.54}\]
Por tanto, la log-verosimilitud correspondiente a la muestra completa es
\[ \ell(\theta) = \sum_{\text{completos}} \log f(\Delta\tau_i;\theta) + \sum_{\text{censurados}} \log S(c_j;\theta). \tag{5.55}\]
Los estimadores de máxima verosimilitud se obtienen mediante
\[ \widehat\theta = \arg\max_{\theta} \ell(\theta). \tag{5.56}\]
Esta formulación se aplica por separado a las familias Exponencial, Weibull y Gamma consideradas en la Ecuación 5.48, Ecuación 5.49 y Ecuación 5.50. La contribución \(S(c_j;\theta)\) de una observación censurada es la forma estándar de incorporar a la verosimilitud la información de que el tiempo de espera excede el último intervalo observado (Kaplan y Meier 1958; Andersen et al. 1993).
5.4.3.9 Comparación mediante el criterio de información de Akaike
Para comparar los modelos paramétricos ajustados se utiliza el criterio de información de Akaike (Akaike 1974),
\[ AIC = 2p-2\widehat\ell, \tag{5.57}\]
donde \(p\) es el número de parámetros libres del modelo y \(\widehat\ell\) es el valor máximo de la log-verosimilitud censurada.
El AIC proporciona una medida relativa de ajuste penalizada por complejidad dentro del conjunto de modelos considerados. Su utilización no demuestra que alguno de los modelos sea el verdadero mecanismo generador de los tiempos entre detecciones; únicamente permite comparar las representaciones paramétricas consideradas bajo el mismo conjunto de observaciones y tratamiento de censura.
5.4.3.10 Coeficiente de variación al cuadrado
Una medida descriptiva adicional de la dispersión relativa de los tiempos entre detecciones es el coeficiente de variación al cuadrado,
\[ CV^2 := \frac{ \operatorname{Var}(\Delta\tau) }{ [\mathbb E(\Delta\tau)]^2 }. \tag{5.58}\]
Para una distribución exponencial,
\[ CV^2=1. \tag{5.59}\]
Por consiguiente, el valor de \(CV^2\) puede utilizarse como indicador descriptivo de la dispersión relativa. Sin embargo, una diferencia respecto de uno no constituye por sí misma una prueba formal de no-Poissonidad, debido a que la distribución de los tiempos entre eventos también puede estar afectada por heterogeneidad temporal de la intensidad, dependencia entre eventos, censura y el propio procedimiento de detección.
5.4.3.11 Teorema de cambio de tiempo
Sea \(N(t)\) un proceso de conteo simple con intensidad condicional \(\lambda(t\mid\mathcal F_{t^-})\) y compensador
\[ \Lambda(t) := \int_0^t \lambda(s\mid\mathcal F_{s^-}) \,\mathrm ds. \tag{5.60}\]
Bajo las condiciones del teorema de cambio de tiempo para procesos puntuales, si \(\tau_k\) y \(\tau_{k-1}\) son tiempos de eventos consecutivos, los incrementos del tiempo transformado se definen mediante
\[ s_k := \Lambda(\tau_k) \tag{5.61}\]
y
\[ \Delta s_k := s_k-s_{k-1} = \Lambda(\tau_k) - \Lambda(\tau_{k-1}). \tag{5.62}\]
Teorema 5.6 (cambio de tiempo). Bajo las condiciones de regularidad del teorema de cambio de tiempo y utilizando el compensador verdadero del proceso puntual, los incrementos transformados (Ecuación 5.62) presentan distribución exponencial unitaria (Brown et al. 2002). La formulación del cambio de tiempo para procesos puntuales también constituye la base de los procedimientos de análisis de residuos de procesos de eventos desarrollados en la literatura de procesos de conteo.
\[ \Delta s_k \sim \operatorname{Exp}(1). \tag{5.63}\]
En consecuencia, mediante la transformación de la distribución exponencial a la uniforme,
\[ u_k = 1-e^{-\Delta s_k}, \tag{5.64}\]
se obtiene
\[ u_k\sim\operatorname{Uniforme}(0,1). \tag{5.65}\]
Demostración. El resultado se obtiene aplicando el teorema de cambio de tiempo al proceso puntual con intensidad condicional \(\lambda(t\mid\mathcal F_{t^-})\) (Brown et al. 2002). La transformación mediante el compensador verdadero convierte el proceso en una escala temporal en la cual los eventos presentan intensidad unitaria. Por tanto, los incrementos entre eventos consecutivos siguen una distribución exponencial de parámetro uno. Finalmente, si \(E\sim\operatorname{Exp}(1)\), entonces \(1-e^{-E}\sim\operatorname{Uniforme}(0,1)\). \(\square\)
5.4.3.12 Diagnóstico de cambio de tiempo mediante la intensidad estimada
En la aplicación computacional, la intensidad verdadera \(\lambda(t)\) y su compensador \(\Lambda(t)\) no se conocen. Por ello, el procedimiento sustituye el compensador verdadero por uno obtenido a partir de la intensidad estimada mediante Ecuación 5.45.
Se define numéricamente
\[ \widehat\Lambda(t) := \int_0^t \widehat\lambda_h(s)\,\mathrm ds, \tag{5.66}\]
o, en la implementación sobre una malla temporal, mediante la correspondiente aproximación discreta de la integral.
Los incrementos transformados estimados son entonces
\[ \widehat{\Delta s}_k = \widehat\Lambda(\tau_k) - \widehat\Lambda(\tau_{k-1}). \tag{5.67}\]
A partir de ellos se construye
\[ \widehat u_k = 1-e^{-\widehat{\Delta s}_k}. \tag{5.68}\]
Si el modelo de intensidad utilizado para construir \(\widehat\lambda_h\) describe adecuadamente la estructura temporal de las detecciones y la estimación del compensador es suficientemente precisa, los valores \(\widehat u_k\) deberían presentar un comportamiento compatible con una distribución uniforme.
Es fundamental distinguir este procedimiento del teorema anterior: la propiedad exacta \(\Delta s_k\sim\operatorname{Exp}(1)\) corresponde al compensador verdadero \(\Lambda\), mientras que \(\widehat{\Delta s}_k\) constituye un diagnóstico basado en un compensador estimado. La interpretación como diagnóstico de especificación mediante tiempo reescalado sigue la literatura de análisis de procesos puntuales (Brown et al. 2002).
Como medida descriptiva de discrepancia se registra el estadístico \(D\) de Kolmogorov–Smirnov,
\[ D := \sup_{0\leq u\leq1} \left| \widehat F_{\widehat u}(u)-u \right|, \tag{5.69}\]
donde \(\widehat F_{\widehat u}\) es la función de distribución empírica de los valores \(\widehat u_k\).
En la implementación considerada, este estadístico se utiliza como diagnóstico descriptivo. No se interpreta como un p-valor exacto de una prueba clásica de uniformidad, debido a que la intensidad utilizada para construir los residuos ha sido estimada a partir de los mismos datos.
5.4.3.13 Incertidumbre mediante bootstrap por trayectoria
La incertidumbre de las estadísticas descriptivas de los tiempos entre detecciones se cuantifica mediante bootstrap por trayectoria, siguiendo el principio general de remuestreo para inferencia estadística (Efron y Tibshirani 1993). En cada réplica se seleccionan con reemplazo trayectorias completas y se reconstruye la colección correspondiente de tiempos entre detecciones y de observaciones censuradas.
Para un estadístico \(\theta\), como la media, mediana o \(CV^2\), se obtiene
\[ \widehat\theta^{(1)}, \ldots, \widehat\theta^{(B)}. \tag{5.70}\]
El intervalo percentil de nivel \(1-\gamma\) se define por
\[ IC_{1-\gamma} = \left[ \widehat\theta^{\,(\gamma/2)}, \widehat\theta^{\,(1-\gamma/2)} \right]. \tag{5.71}\]
El remuestreo de trayectorias completas preserva, en la medida permitida por el esquema bootstrap, la dependencia temporal existente entre las detecciones de una misma trayectoria y evita tratar cada gap como una observación independiente por construcción.
5.4.3.14 Validación mediante información conocida en la simulación
Al igual que en el análisis de severidades, la simulación permite conservar información sobre los tiempos de los eventos generados por el mecanismo conocido. Esta información puede utilizarse para evaluar la capacidad del detector para recuperar la estructura temporal subyacente.
Esta comparación constituye una validación oracle y no participa en la estimación de \(\widehat\lambda_h\), en la construcción de la distribución de \(\Delta\tau\), en la estimación de los modelos paramétricos ni en el cálculo de los intervalos bootstrap.
Por tanto, el procedimiento de inferencia permanece basado exclusivamente en las detecciones obtenidas a partir de las trayectorias simuladas, reproduciendo la situación de aplicación a datos reales en la cual únicamente se dispone de la trayectoria observada y no de la causa física ni del instante verdadero de cada salto no observado.