Clase 01 — Fundamentos y descenso de gradiente

Todo lo que ves aquí se calcula en vivo en tu navegador: no hay curvas dibujadas a mano. Entrena un perceptrón hasta que falle con XOR, mide cuánto gradiente deja pasar cada activación y sigue la regla de la cadena número por número.

Frontera de decisión perceptrón
\[ \hat y = \text{step}(w_1 x_1 + w_2 x_2 + b), \qquad \text{frontera: } w_1 x_1 + w_2 x_2 + b = 0 \]
clase 1 clase 0 frontera neuronas ocultas (MLP)

El fondo colorea la región que la red clasifica como 1 o como 0. Cada punto lleva un borde blanco si está bien clasificado y un anillo rojo si está mal.

Controles
Exactitud
sobre los 4 puntos
Época
0
regla del perceptrón
Función de activación y su derivada
f(x)
f′(x)
máx f′
techo por capa
Lo que le pasa al gradiente al cruzar \(L\) capas

El gradiente que llega a la primera capa es un producto de derivadas locales, una por capa (1.4.4). Aquí se multiplica \(f'(x)\) por sí misma \(L\) veces, con el \(x\) que elegiste arriba.

Eje vertical en escala logarítmica: cada división es un factor de 10.

Teorema de aproximación universal, ajustado de verdad

Se ajusta por mínimos cuadrados una combinación de \(N\) activaciones ocultas con centros repartidos en el intervalo. Los pesos de salida se resuelven exactamente (ecuaciones normales), así que el error que ves es el real: baja porque el modelo realmente mejora, no porque la animación lo simule.

ECM
error cuadrático medio
Parámetros
pesos de salida + sesgo
Lo que el teorema NO dice (1.2.4). Que exista una red que aproxime la función no dice cuántas neuronas hace falta, ni que el descenso de gradiente vaya a encontrarla, ni que generalice fuera del intervalo. Prueba el escalón: hace falta muchísima más anchura para el mismo error, y aun así queda el rebote junto al salto.

Abajo: el ECM alcanzable para cada \(N\) de 1 a 30, con la configuración actual.

Superficie de pérdida y trayectoria

Haz clic en cualquier punto para relanzar el descenso desde ahí. El color es la pérdida real evaluada punto a punto; las curvas de nivel salen de esa misma función.

Parámetros de optimización
Paso
0
Pérdida
norma ∇L
Sube \(\eta\) poco a poco. Hay un umbral nítido: mientras \(\eta < 2/\lambda_{\max}\) la trayectoria converge; justo encima empieza a oscilar y luego diverge. En el cuenco, \(\lambda_{\max}=3\), así que el punto de quiebre está en \(\eta \approx 0{,}67\).
Grafo computacional y regla de la cadena

La red mínima del ejemplo trabajado de la clase (1.4.3): una entrada, una neurona oculta con sigmoide y una salida lineal (es regresión, así que la salida no se acota). Con los valores por defecto reproduce exactamente los números del apunte.

\[ z_1 = w_1 x, \quad h = \sigma(z_1), \quad \hat y = w_2 h, \quad L = \tfrac{1}{2}(\hat y - y)^2 \]

Pérdida tras cada actualización aplicada. El apunte llega a 0.126 → 0.116 en el primer paso: compruébalo.

Para seguir jugando
  • En la pestaña 1, entrena XOR con el perceptrón y mira la exactitud quedarse pegada en 75 %. Luego cambia a MLP y vuelve a entrenar.
  • En la 2, pon la sigmoide en \(x=3\) y sube \(L\): el gradiente cae bajo \(10^{-9}\) antes de la capa 20. Repítelo con ReLU.
  • En la 3, elige el valle estrecho y busca la \(\eta\) más grande que todavía converge. Ese zigzag es el problema que resuelve momentum en la Clase 2.
  • En la 4, pon \(w_1=3\): la sigmoide se satura, \(\sigma'\) se desploma y el gradiente de \(w_1\) casi desaparece aunque la pérdida sea grande.