Clase 01 — Fundamentos y descenso de gradiente
Todo lo que ves aquí se calcula en vivo en tu navegador: no hay curvas dibujadas a mano. Entrena un perceptrón hasta que falle con XOR, mide cuánto gradiente deja pasar cada activación y sigue la regla de la cadena número por número.
El fondo colorea la región que la red clasifica como 1 o como 0. Cada punto lleva un borde blanco si está bien clasificado y un anillo rojo si está mal.
El gradiente que llega a la primera capa es un producto de derivadas locales, una por capa (1.4.4). Aquí se multiplica \(f'(x)\) por sí misma \(L\) veces, con el \(x\) que elegiste arriba.
Eje vertical en escala logarítmica: cada división es un factor de 10.
Se ajusta por mínimos cuadrados una combinación de \(N\) activaciones ocultas con centros repartidos en el intervalo. Los pesos de salida se resuelven exactamente (ecuaciones normales), así que el error que ves es el real: baja porque el modelo realmente mejora, no porque la animación lo simule.
Abajo: el ECM alcanzable para cada \(N\) de 1 a 30, con la configuración actual.
Haz clic en cualquier punto para relanzar el descenso desde ahí. El color es la pérdida real evaluada punto a punto; las curvas de nivel salen de esa misma función.
La red mínima del ejemplo trabajado de la clase (1.4.3): una entrada, una neurona oculta con sigmoide y una salida lineal (es regresión, así que la salida no se acota). Con los valores por defecto reproduce exactamente los números del apunte.
Pérdida tras cada actualización aplicada. El apunte llega a 0.126 → 0.116 en el primer paso: compruébalo.
- En la pestaña 1, entrena XOR con el perceptrón y mira la exactitud quedarse pegada en 75 %. Luego cambia a MLP y vuelve a entrenar.
- En la 2, pon la sigmoide en \(x=3\) y sube \(L\): el gradiente cae bajo \(10^{-9}\) antes de la capa 20. Repítelo con ReLU.
- En la 3, elige el valle estrecho y busca la \(\eta\) más grande que todavía converge. Ese zigzag es el problema que resuelve momentum en la Clase 2.
- En la 4, pon \(w_1=3\): la sigmoide se satura, \(\sigma'\) se desploma y el gradiente de \(w_1\) casi desaparece aunque la pérdida sea grande.