Fundamentos y descenso de gradiente
De la neurona al MLP. Fronteras de decisión, el muro del XOR, cuánto gradiente deja pasar cada activación y la regla de la cadena número por número.
- Perceptrón entrenable — y el fracaso demostrable con XOR
- Activaciones, su derivada exacta y el producto de \(L\) capas
- Aproximación universal ajustada por mínimos cuadrados
- Descenso de gradiente sobre superficies reales, con el umbral \(2/\lambda_{max}\)
- Grafo computacional y backpropagation paso a paso
Convoluciones, normalización, ResNets y optimizadores
El kernel recorriendo la imagen celda a celda, la diferencia real entre BatchNorm y LayerNorm, y cuatro optimizadores compitiendo por el mismo valle.
- Convolución 2D con kernel editable, padding y stride
- BatchNorm vs LayerNorm con μ y σ calculados por eje
- Atajos residuales: el gradiente que muere y el que sobrevive
- Carrera SGD / Momentum / RMSProp / Adam, con corrección de sesgo
Secuencias y espacios latentes
Una RNN con números de verdad, las compuertas de LSTM y GRU decidiendo qué recordar, y el espacio semántico recorrido con sumas y restas.
- Estado oculto propagándose paso a paso
- Compuertas LSTM y GRU, con vida media de la memoria
- BPTT: en qué paso exacto se desvanece (o explota) el gradiente
- Analogías vectoriales y matriz de similitud por coseno
Mecanismos de atención y Transformers
\(Q\), \(K\), \(V\), los puntajes, el softmax y la mezcla, calculados a partir de matrices que puedes editar. Incluye el recorrido completo de un Transformer.
- Self-attention editable, con máscara causal y verificación de filas
- Por qué \(\sqrt{d_k}\): la entropía del softmax en función de la dimensión
- Multi-head con arcos proporcionales a los pesos reales
- Positional encoding: matriz, ondas y decaimiento por distancia
- "La capital de ___ es …" — los ocho pasos, ejecutados
Modelos de lenguaje y decodificación
Un entrenador de BPE que fusiona pares sobre el texto que escribas, un modelo de lenguaje real y los tres mandos de decodificación implementados como en las librerías.
- BPE real: cuenta pares, fusiona y comprime tu propio texto
- Generación autorregresiva con probabilidades contadas de un corpus
- Temperatura, top-k y top-p (núcleo correcto) con muestreo empírico
- Entropía y perplejidad, arrastrando la distribución con la mano
LoRA, alineación DPO y agentes
Las matrices de LoRA multiplicadas de verdad (con la comprobación de que fusionar no cambia nada), la pérdida DPO sin factores inventados y un agente cuyas herramientas se ejecutan.
- LoRA paso a paso, con \(A\) y \(B\) editables y verificación del merge
- Aproximación de bajo rango real, con su espectro de valores singulares
- DPO: pérdida, recompensa implícita y por qué el gradiente se apaga solo
- Agente ReAct con calculadora y búsqueda que funcionan — y que puedes romper