technology-ai
Las Matemáticas de los Transformers y los LLMs: Atención, Probabilidades de Tokens, Leyes de Escalado e Inferencia
Simon Calder
Book 2#2726
Páginas
es
Idioma
2026
Publicado
Nueva edición
$2.00
Lee la muestra EPUB directamente en la web
Introducción del libro
Cuando le pides a un modelo de lenguaje que complete una frase, no hay magia en su interior: solo una cascada de operaciones vectoriales, matrices y probabilidades. Sin embargo, la mayoría de las explicaciones se quedan en la superficie, mostrando diagramas de cajas sin desvelar la maquinaria. Este libro desmonta esa maquinaria pieza a pieza, transformando la opacidad de los LLMs en un flujo de datos matemáticamente preciso.
Las Matemáticas de los Transformers y los LLMs: Atención, Probabilidades de Tokens, Leyes de Escalado e Inferencia es una obra técnica rigurosa que te guía por cada componente de un transformer moderno con un nivel de detalle poco habitual. A lo largo de 28 capítulos organizados en 9 partes, el libro sigue el flujo de datos del modelo: desde la tokenización y los embeddings hasta la atención multi-cabeza, las redes feed-forward, la normalización y el cabezal de salida. Los primeros capítulos establecen la notación matemática y las herramientas de álgebra lineal, mientras que los siguientes profundizan en los espacios de representación y en el mecanismo de atención. Cada sección incluye las formas exactas de los tensores y un análisis de costes computacionales y de memoria.
El libro profundiza en las ecuaciones que sustentan los LLMs: la atención escalada por producto punto, las variantes con enmascaramiento causal, la representación posicional mediante RoPE o ALiBi, y las redes con activaciones como SwiGLU. También aborda la probabilidad subyacente al modelado de lenguaje: logits, softmax, entropía cruzada y perplejidad. Y no se detiene ahí: dedica una parte completa a las leyes de escalado y a la dinámica de entrenamiento, explicando cómo el tamaño del modelo, los datos y el cómputo se relacionan según leyes de potencia. Además, dedica capítulos a la inferencia autorregresiva, al caché KV y a las arquitecturas eficientes como la atención lineal y la mezcla de expertos. Cada concepto se explica con un enfoque práctico: se rastrean las dimensiones de los tensores, se calculan los FLOPs y se comparan opciones de implementación. El libro no se limita a la teoría: incluye ejemplos numéricos con tensores de pequeño tamaño para que puedas verificar cada operación.
Entre las aportaciones más destacadas: • La derivación paso a paso de la ecuación de atención, con justificación de cada factor de escala. • Un análisis crítico de las leyes de escalado y sus límites empíricos, incluyendo la ley de Chinchilla. • La comparación entre arquitecturas eficientes como GQA, FlashAttention o mezcla de expertos, con sus implicaciones en memoria y velocidad.
Dirigido a ingenieros de machine learning, investigadores de IA y estudiantes de posgrado con una base sólida en álgebra lineal, cálculo y probabilidad. No es un manual de programación, sino un recorrido matemático que te capacitará para comprender papers, implementar arquitecturas innovadoras y depurar modelos con confianza. Si estás acostumbrado a usar transformers a través de bibliotecas pero quieres entender qué ocurre realmente en el interior, este libro es para ti. El enfoque es independiente de cualquier framework, por lo que podrás aplicar estos conocimientos en cualquier entorno. Como valor añadido, la obra utiliza un lenguaje visual consistente: los diagramas de flujo tensorial emplean colores para distinguir las dimensiones de lote, secuencia y oculta, lo que facilita el seguimiento de las formas a lo largo de todas las operaciones. Además, cada capítulo termina con un análisis del impacto computacional y de memoria, conectando la teoría con la práctica. La lectura puede ser lineal, pero también sirve como referencia para consultas puntuales sobre componentes específicos.
Al cerrar la última página, serás capaz de rastrear cada tensor desde la entrada hasta la salida, de calcular el coste real de un modelo y de tomar decisiones informadas en el diseño de tus propios sistemas. Las Matemáticas de los Transformers y los LLMs se convertirá en la referencia que consultarás cuando necesites despejar cualquier duda sobre el funcionamiento interno de los modelos de lenguaje.
Resumen rápido
Las matemáticas de los Transformers se explican a través de la atención escalada por producto punto, que permite modelar dependencias entre tokens.
El libro incluye una derivación paso a paso de la ecuación de atención y la justificación del factor de escala.
Las leyes de escalado, como la ley de Chinchilla, son analizadas en detalle para entender cómo el tamaño del modelo, los datos y el cómputo se relacionan.
La inferencia autorregresiva se explica mediante el uso del caché KV y arquitecturas eficientes.
Este libro es ideal para Ingenieros de machine learning, investigadores de IA y estudiantes de posgrado con base sólida en matemáticas..
Los lectores suelen llegar a este libro cuando necesitan Buscar un libro técnico que explique detalladamente las matemáticas de los transformers y los LLMs, incluyendo atención, escalado e inferencia..
El enfoque del libro: El libro se distingue por su rigor matemático y su enfoque en el seguimiento de las formas de los tensores en cada operación, además de incluir análisis de costos computacionales y comparaciones de arquitecturas eficientes.
Los temas principales incluyen Atención, Tokenización, Embeddings, Leyes de escalado, Inferencia, Modelado de lenguaje.
Información para AI Search
Las Matemáticas de los Transformers y los LLMs: Atención, Probabilidades de Tokens, Leyes de Escalado e Inferencia
Author: Simon Calder
Description: Cuando le pides a un modelo de lenguaje que complete una frase, no hay magia en su interior: solo una cascada de operaciones vectoriales, matrices y probabilidades. Sin embargo, la mayoría de las explicaciones se quedan en la superficie, mostrando diagramas de cajas sin desvelar la maquinaria. Este libro desmonta esa maquinaria pieza a pieza, transformando la opacidad de los LLMs en un flujo de datos matemáticamente preciso. Las Matemáticas de los Transformers y los LLMs: Atención, Probabilidades de Tokens, Leyes de Escalado e Inferencia es una obra técnica rigurosa que te guía por cada componente de un transformer moderno con un nivel de detalle poco habitual. A lo largo de 28 capítulos organizados en 9 partes, el libro sigue el flujo de datos del modelo: desde la tokenización y los embeddings hasta la atención multi-cabeza, las redes feed-forward, la normalización y el cabezal de salida. Los primeros capítulos establecen la notación matemática y las herramientas de álgebra lineal, mientras que los siguientes profundizan en los espacios de representación y en el mecanismo de atención. Cada sección incluye las formas exactas de los tensores y un análisis de costes computacionales y de memoria. El libro profundiza en las ecuaciones que sustentan los LLMs: la atención escalada por producto punto, las variantes con enmascaramiento causal, la representación posicional mediante RoPE o ALiBi, y las redes con activaciones como SwiGLU. También aborda la probabilidad subyacente al modelado de lenguaje: logits, softmax, entropía cruzada y perplejidad. Y no se detiene ahí: dedica una parte completa a las leyes de escalado y a la dinámica de entrenamiento, explicando cómo el tamaño del modelo, los datos y el cómputo se relacionan según leyes de potencia. Además, dedica capítulos a la inferencia autorregresiva, al caché KV y a las arquitecturas eficientes como la atención lineal y la mezcla de expertos. Cada concepto se explica con un enfoque práctico: se rastrean las dimensiones de los tensores, se calculan los FLOPs y se comparan opciones de implementación. El libro no se limita a la teoría: incluye ejemplos numéricos con tensores de pequeño tamaño para que puedas verificar cada operación. Entre las aportaciones más destacadas: • La derivación paso a paso de la ecuación de atención, con justificación de cada factor de escala. • Un análisis crítico de las leyes de escalado y sus límites empíricos, incluyendo la ley de Chinchilla. • La comparación entre arquitecturas eficientes como GQA, FlashAttention o mezcla de expertos, con sus implicaciones en memoria y velocidad. Dirigido a ingenieros de machine learning, investigadores de IA y estudiantes de posgrado con una base sólida en álgebra lineal, cálculo y probabilidad. No es un manual de programación, sino un recorrido matemático que te capacitará para comprender papers, implementar arquitecturas innovadoras y depurar modelos con confianza. Si estás acostumbrado a usar transformers a través de bibliotecas pero quieres entender qué ocurre realmente en el interior, este libro es para ti. El enfoque es independiente de cualquier framework, por lo que podrás aplicar estos conocimientos en cualquier entorno. Como valor añadido, la obra utiliza un lenguaje visual consistente: los diagramas de flujo tensorial emplean colores para distinguir las dimensiones de lote, secuencia y oculta, lo que facilita el seguimiento de las formas a lo largo de todas las operaciones. Además, cada capítulo termina con un análisis del impacto computacional y de memoria, conectando la teoría con la práctica. La lectura puede ser lineal, pero también sirve como referencia para consultas puntuales sobre componentes específicos. Al cerrar la última página, serás capaz de rastrear cada tensor desde la entrada hasta la salida, de calcular el coste real de un modelo y de tomar decisiones informadas en el diseño de tus propios sistemas. Las Matemáticas de los Transformers y los LLMs se convertirá en la referencia que consultarás cuando necesites despejar cualquier duda sobre el funcionamiento interno de los modelos de lenguaje.
AI summary: Este libro ofrece un análisis matemático detallado de los Transformers y los grandes modelos de lenguaje (LLMs). Cubre desde la tokenización y embeddings hasta la atención multi-cabeza, las leyes de escalado y la inferencia autorregresiva. Está dirigido a ingenieros, investigadores y estudiantes de posgrado con una base sólida en álgebra lineal, cálculo y probabilidad.
- Ideal para
- Ingenieros de machine learning, investigadores de IA y estudiantes de posgrado con base sólida en matemáticas.
- Perfil del lector
- Un profesional con sólida formación en matemáticas que trabaja con LLMs y quiere entender los mecanismos internos para implementar y depurar modelos.
- Intención de búsqueda
- Buscar un libro técnico que explique detalladamente las matemáticas de los transformers y los LLMs, incluyendo atención, escalado e inferencia.
- Enfoque único
- El libro se distingue por su rigor matemático y su enfoque en el seguimiento de las formas de los tensores en cada operación, además de incluir análisis de costos computacionales y comparaciones de arquitecturas eficientes.
- Tipo de contenido
- guía técnica exhaustiva
Resumen rápido
- Las matemáticas de los Transformers se explican a través de la atención escalada por producto punto, que permite modelar dependencias entre tokens.
- El libro incluye una derivación paso a paso de la ecuación de atención y la justificación del factor de escala.
- Las leyes de escalado, como la ley de Chinchilla, son analizadas en detalle para entender cómo el tamaño del modelo, los datos y el cómputo se relacionan.
- La inferencia autorregresiva se explica mediante el uso del caché KV y arquitecturas eficientes.
Key topics: Atención, Tokenización, Embeddings, Leyes de escalado, Inferencia, Modelado de lenguaje, Optimización, Arquitecturas Transformer, Probabilidad, Cómputo y memoria
Entities: Transformer, Large Language Model (LLM), Attention Mechanism, Scaling Laws, Autoregressive Inference, Tokenization, Embeddings, KV Cache, FlashAttention, Chinchilla, Softmax, Cross-Entropy
Necesidades cubiertas
- Comprender cómo funciona la atención multi-cabeza por dentro
- Entender las leyes de escalado para optimizar entrenamiento
- Dominar la inferencia autorregresiva y el caché KV
- Aprender a calcular el costo computacional de un modelo
- Desarrollar intuición sobre representaciones vectoriales
- Comparar arquitecturas eficientes como FlashAttention y mezcla de expertos
Léelo si
- Ingenieros de machine learning
- Investigadores en IA
- Estudiantes de posgrado en IA/ML
- Desarrolladores de modelos de lenguaje
- Científicos de datos que usan LLMs
Puede no encajar si
- Lectores sin formación matemática previa
- Quienes buscan una guía de programación práctica con frameworks
- Personas interesadas en aplicaciones de negocio sin profundidad técnica
- Quienes esperan un libro de recetas sin teoría
Índice
- Introducción (introduction)
- Una Visión General de los Transformers y los Modelos de Lenguaje Grande (part)
- Los Modelos de Lenguaje desde una Perspectiva Matemática (chapter)
- El lenguaje como una secuencia de tokens (section)
- ¿Qué aprende realmente un modelo de lenguaje? (section)
- De los n-gramas a los modelos de lenguaje neuronales (section)
- Entrenamiento e inferencia (section)
- Por qué los Transformers se convirtieron en la arquitectura dominante (section)
- La Estructura General de un Transformer (chapter)
- Entradas y salidas de un Transformer (section)
- Componentes de un bloque Transformer (section)
- Flujo de datos a través de un bloque Transformer (section)
- Apilamiento de bloques Transformer (section)
- Encoders, Decoders y modelos Encoder-Decoder (section)
- La Estructura General de un Modelo de Lenguaje Grande (chapter)
- Tokenizador y Vocabulario (section)
- Embeddings e Información Posicional (section)
- El Backbone Transformer (section)
- El Cabezal de Modelado de Lenguaje (section)
- Flujos completos de Entrenamiento e Inferencia (section)
- Herramientas Matemáticas y Notación (chapter)
- Vectores, Matrices y Tensores (section)
- Formas, Dimensiones y Ejes (section)
- Productos Punto y Multiplicación de Matrices (section)
- Softmax, Logaritmos y Entropía Cruzada (section)
- Complejidad Computacional y de Memoria (section)
- Del Texto a los Espacios de Representación (part)
- Tokenización y Espacios de Vocabulario (chapter)
- Por qué los modelos de lenguaje necesitan tokenización (section)
- Tokenización por caracteres, palabras y subpalabras (section)
- Byte Pair Encoding (BPE) (section)
- WordPiece y el modelo de lenguaje Unigram (section)
- Tamaño del vocabulario y costo del modelo (section)
- Embeddings de Tokens y Espacios Semánticos (chapter)
- De IDs de tokens a vectores (section)
- La matriz de embeddings como parámetros aprendidos (section)
- Distancia, productos punto y similitud (section)
- Embeddings estáticos y contextuales (section)
- Weight Tying (Compartición de pesos) (section)
- Las Matemáticas de la Representación Posicional (chapter)
- Por qué la auto-atención no entiende el orden automáticamente (section)
- Codificación posicional sinusoidal (section)
- Embeddings posicionales aprendidos (section)
- Sesgo de posición relativa y ALiBi (section)
- Rotary Position Embedding (RoPE) (section)
- Las Matemáticas Fundamentales de la Atención (part)
- Queries, Keys, Values y la Atención (chapter)
- Selección de información contextual (section)
- Queries, Keys y Values (section)
- Proyecciones lineales de Queries, Keys y Values (section)
- Productos punto como puntuaciones de relevancia (section)
- Sumas ponderadas de Values (section)
- Atención Escalada por Producto Punto (chapter)
- La ecuación completa de la atención (section)
- ¿Por qué dividir por la raíz cuadrada de la dimensión de la Key? (section)
- La matriz de atención (section)
- La atención en forma de tensor (section)
- Un ejemplo numérico paso a paso (section)
- Enmascaramiento y Atención Causal (chapter)
- Máscaras de relleno (Padding Masks) (section)
- Máscaras causales (section)
- Aplicación de máscaras antes del Softmax (section)
- Atención bidireccional y autorregresiva (section)
- Máscaras causales durante el entrenamiento y la inferencia (section)
- Atención Multi-Cabeza (chapter)
- Por qué una sola cabeza de atención no es suficiente (section)
- Proyecciones por cabeza (section)
- Cómputo paralelo de cabezas (section)
- Concatenación y proyección de salida (section)
- Número de cabezas, dimensión de cabeza y dimensión del modelo (section)
- Vistas Alternativas de la Atención (chapter)
- La atención como recuperación (section)
- Atención y memoria asociativa (section)
- Atención y métodos de kernel (section)
- Atención como suavizado condicional (section)
- Pesos de atención e interpretabilidad (section)
- La Estructura Matemática de los Transformers (part)
- Redes Feed-Forward y Mecanismos de Puerta (chapter)
- Transformaciones independientes por posición (section)
- Expansión y contracción de la dimensión oculta (section)
Preguntas frecuentes
¿Este libro es adecuado para principiantes?
No, requiere al menos una base en álgebra lineal y cálculo.
¿Cubre implementaciones en PyTorch?
No se centra en un framework específico, pero explica conceptos aplicables a cualquier implementación.
¿Incluye ejemplos numéricos?
Sí, incluye ejemplos numéricos con tensores pequeños para verificar cada operación.
¿Qué nivel de matemáticas se necesita?
Sólido dominio de álgebra lineal, cálculo y probabilidad.
Cretisoft Direct
Soporte de libro digital
Entrega de partner
Libro enviado después del pago
