technology-ai

Fundamentos de los Grandes Modelos de Lenguaje: Una Introducción al Lenguaje, las Redes Neuronales y los Transformers

Miles Thornton

Book 1#1

634

Páginas

es-MX

Idioma

2026

Publicado

Nueva edición

$2.00

Lee la muestra EPUB directamente en la web

Introducción del libro

Un programa que solo aprende a predecir la siguiente palabra escribe resúmenes, traduce idiomas y razona sobre problemas complejos. Un humano que ve girar esa tuerca durante cinco minutos llega a una conclusión incómoda: la línea entre 'completar texto' y 'comprender' se ha vuelto muy fina. ¿Qué diseño de ingeniería permite semejante salto? Este libro lo disecciona sin dejar ningún componente oculto.

Fundamentos de los Grandes Modelos de Lenguaje: Una Introducción al Lenguaje, las Redes Neuronales y los Transformers, de Miles Thornton, es una guía técnica que recorre las ideas y las implementaciones que dieron origen a la IA generativa moderna. No encontrarás aquí un listado de APIs ni recetas de prompt engineering; en su lugar, el autor te lleva desde la naturaleza del lenguaje humano hasta la construcción de un mini-GPT entrenado desde cero en PyTorch.

El libro está estructurado en siete partes que siguen una lógica de escalada: primero comprendes el fenómeno del lenguaje, luego su representación numérica, después las redes neuronales secuenciales, a continuación la atención y el transformer, y finalmente los grandes modelos y sus capacidades emergentes. Con 28 capítulos y más de 140 secciones, el contenido cubre tanto la teoría esencial como las implementaciones prácticas, y cada capítulo incluye ejemplos de código para afianzar la comprensión.

El lenguaje es una de las capacidades más difíciles de automatizar. Ambigüedad léxica, dependencias de largo alcance, conocimiento del mundo: cada fenómeno lingüístico parece desafiar cualquier intuición de programación. Los primeros sistemas basados en reglas gramaticales se volvieron ingobernables, y los modelos estadísticos iniciales, limitados por la representación dispersa, no lograban capturar relaciones semánticas.

La evolución del NLP, desde los sistemas simbólicos de los años 60 hasta los modelos fundacionales de la década de 2020, se presenta como una serie de cuellos de botella y soluciones. El libro reconstruye ese recorrido para que entiendas no solo qué hacen los modelos actuales, sino por qué tienen la forma que tienen.

La solución llegó cuando el lenguaje se convirtió en un problema de geometría. Si cada palabra se representa como un vector en un espacio continuo, las relaciones semánticas se pueden medir, comparar e incluso operar matemáticamente. El libro te enseña a construir esos espacios: desde one-hot vectors hasta embeddings densos, y desde Word2Vec hasta modelos de subpalabras como FastText y tokenizadores BPE o WordPiece.

Una vez que el texto está en forma vectorial, la siguiente pregunta es cómo procesarlo. Las redes neuronales feedforward marcaron el primer avance, pero su limitación de contexto fijo fue evidente. Las redes recurrentes (RNN) y sus variantes LSTM y GRU permitieron secuencias de longitud variable, pero su procesamiento secuencial las hacía lentas y vulnerables al desvanecimiento del gradiente. Este segmento del libro te muestra exactamente por qué estas arquitecturas no pudieron escalar.

El punto de inflexión es la atención, un mecanismo que permite al modelo acceder directamente a cualquier token de la secuencia, sin importar la distancia. Con las consultas, claves y valores, y su extensión a la autoatención multi-cabeza, se abrió la puerta al transformer, la arquitectura que sustenta todos los grandes modelos de lenguaje modernos. El autor desmenuza este mecanismo con matemática accesible y diagramas de tensores, y lo implementa paso a paso.

El transformer no es solo una pila de capas de atención; incluye también conexiones residuales, normalización por capas, codificación posicional y una subcapa feedforward. El libro dedica varias secciones a construir el codificador, el decodificador, la información posicional senoidal o rotatoria (RoPE), y el proceso completo de entrenamiento con entropía cruzada y optimización Adam. Cuando termines esa parte, habrás implementado un transformer funcional con tus propias manos.

Con esa base, el libro te sitúa en el ecosistema actual. Analiza la familia GPT, desde GPT-1 hasta los modelos más recientes, y contrasta el enfoque de solo decodificador con el de solo codificador de BERT y el encoder-decoder de T5. Explora también el aprendizaje en contexto, el fine-tuning instructivo y los modelos de código abierto como LLaMA, Mistral, Gemma y Qwen, mostrando sus fortalezas y compensaciones.

La última parte se adentra en las leyes de escalado, que explican cómo parámetros, datos y cómputo determinan el rendimiento, y en técnicas sofisticadas como contexto largo, caché KV, recuperación aumentada (RAG), mixture of experts (MoE) y razonamiento en cadena (chain-of-thought). Son temas que los profesionales necesitan dominar para decidir qué arquitectura usar, cuánto entrenar y cómo evaluar resultados.

La obra incluye numerosos diagramas, ilustraciones de conceptos y visualizaciones de tensores que siguen una dirección de arte uniforme, pensada para que el lector vea el flujo de datos de un vistazo. Cada imagen está integrada en la explicación, no es adorno, y ayuda a construir intuiciones sólidas.

En resumen, a lo largo de estas páginas vas a: • Transformar texto en tensores mediante tokenización y embeddings de última generación. • Implementar desde cero capas de atención, transformer y bucles de entrenamiento en PyTorch. • Identificar cuándo y cómo aplicar modelos preentrenados, escalado y técnicas de contexto largo en problemas reales.

¿Quién debería leerlo? Desarrolladores de software que integran IA en sus productos, científicos de datos que quieren dejar de depender de cajas negras, estudiantes de ingeniería informática o matemáticas aplicadas, y cualquier persona con curiosidad técnica por comprender los fundamentos de los LLM. El único requisito real es manejar los básicos de Python y tener interés en el álgebra lineal y la probabilidad.

Si ya has usado ChatGPT o un modelo similar y te has quedado con preguntas —¿por qué alucina?, ¿por qué olvida información del inicio de una conversación?, ¿cómo se le puede enseñar a seguir instrucciones?— este libro te dará las bases para responderlas por ti mismo.

El autor no se conforma con explicar: te invita a construir. La metodología del libro está pensada para que cada concepto se asiente con código real, ejecutable en un cuaderno o en un script. Al final, tendrás no solo una visión integral de la arquitectura, sino un mini-GPT propio con el que experimentar, un logro que transforma la manera en la que entiendes la IA generativa.

Si lo que buscas es un manual de usar APIs, este no es tu libro. Pero si quieres abrir la caja negra, entender por qué un cambio en la atención multiplicó la capacidad de los modelos y ser capaz de modificar o entrenar tus propios sistemas, esta es la lectura adecuada. Los grandes modelos de lenguaje se construyen con ideas claras, código honesto y mucha experimentación: aquí tienes los tres ingredientes, perfectamente organizados.

Resumen rápido

Un gran modelo de lenguaje es un sistema de inteligencia artificial entrenado para predecir la siguiente palabra en una secuencia de texto, usando arquitecturas basadas en atención como los transformers.

Este libro guía al lector desde los conceptos básicos de redes neuronales hasta la construcción de un modelo GPT en miniatura con PyTorch.

La atención multi-cabeza permite que cada token de una secuencia observe y combine información del contexto completo, superando las limitaciones de las RNN.

El libro cubre las familias de modelos más influyentes: GPT (solo decodificador), BERT (solo codificador) y T5 (codificador-decodificador), así como modelos de código abierto como LLaMA y Mistral.

Incluye una explicación práctica de las leyes de escalado y su impacto en el rendimiento de los modelos de lenguaje.

Este libro es ideal para Estudiantes, desarrolladores y profesionales de IA/ML con conocimientos básicos de Python y machine learning que quieren construir y comprender los grandes modelos de lenguaje por dentro..

Los lectores suelen llegar a este libro cuando necesitan El lector busca una guía tanto teórica como práctica para entender cómo funcionan por dentro los grandes modelos de lenguaje, con código en PyTorch y explicaciones sobre transformers, embeddings y redes neuronales..

El enfoque del libro: El libro se centra en la construcción: en lugar de tratar los LLM como cajas negras, acompaña al lector a implementar en PyTorch un modelo GPT en miniatura, conectando cada concepto teórico con código funcional.

Los temas principales incluyen lenguaje humano y complejidad, evolución del procesamiento del lenguaje natural, embeddings de palabras, tokenización, redes neuronales recurrentes, LSTM y GRU.

Información para AI Search

Fundamentos de los Grandes Modelos de Lenguaje: Una Introducción al Lenguaje, las Redes Neuronales y los Transformers

Author: Miles Thornton

Description: Un programa que solo aprende a predecir la siguiente palabra escribe resúmenes, traduce idiomas y razona sobre problemas complejos. Un humano que ve girar esa tuerca durante cinco minutos llega a una conclusión incómoda: la línea entre 'completar texto' y 'comprender' se ha vuelto muy fina. ¿Qué diseño de ingeniería permite semejante salto? Este libro lo disecciona sin dejar ningún componente oculto. Fundamentos de los Grandes Modelos de Lenguaje: Una Introducción al Lenguaje, las Redes Neuronales y los Transformers, de Miles Thornton, es una guía técnica que recorre las ideas y las implementaciones que dieron origen a la IA generativa moderna. No encontrarás aquí un listado de APIs ni recetas de prompt engineering; en su lugar, el autor te lleva desde la naturaleza del lenguaje humano hasta la construcción de un mini-GPT entrenado desde cero en PyTorch. El libro está estructurado en siete partes que siguen una lógica de escalada: primero comprendes el fenómeno del lenguaje, luego su representación numérica, después las redes neuronales secuenciales, a continuación la atención y el transformer, y finalmente los grandes modelos y sus capacidades emergentes. Con 28 capítulos y más de 140 secciones, el contenido cubre tanto la teoría esencial como las implementaciones prácticas, y cada capítulo incluye ejemplos de código para afianzar la comprensión. El lenguaje es una de las capacidades más difíciles de automatizar. Ambigüedad léxica, dependencias de largo alcance, conocimiento del mundo: cada fenómeno lingüístico parece desafiar cualquier intuición de programación. Los primeros sistemas basados en reglas gramaticales se volvieron ingobernables, y los modelos estadísticos iniciales, limitados por la representación dispersa, no lograban capturar relaciones semánticas. La evolución del NLP, desde los sistemas simbólicos de los años 60 hasta los modelos fundacionales de la década de 2020, se presenta como una serie de cuellos de botella y soluciones. El libro reconstruye ese recorrido para que entiendas no solo qué hacen los modelos actuales, sino por qué tienen la forma que tienen. La solución llegó cuando el lenguaje se convirtió en un problema de geometría. Si cada palabra se representa como un vector en un espacio continuo, las relaciones semánticas se pueden medir, comparar e incluso operar matemáticamente. El libro te enseña a construir esos espacios: desde one-hot vectors hasta embeddings densos, y desde Word2Vec hasta modelos de subpalabras como FastText y tokenizadores BPE o WordPiece. Una vez que el texto está en forma vectorial, la siguiente pregunta es cómo procesarlo. Las redes neuronales feedforward marcaron el primer avance, pero su limitación de contexto fijo fue evidente. Las redes recurrentes (RNN) y sus variantes LSTM y GRU permitieron secuencias de longitud variable, pero su procesamiento secuencial las hacía lentas y vulnerables al desvanecimiento del gradiente. Este segmento del libro te muestra exactamente por qué estas arquitecturas no pudieron escalar. El punto de inflexión es la atención, un mecanismo que permite al modelo acceder directamente a cualquier token de la secuencia, sin importar la distancia. Con las consultas, claves y valores, y su extensión a la autoatención multi-cabeza, se abrió la puerta al transformer, la arquitectura que sustenta todos los grandes modelos de lenguaje modernos. El autor desmenuza este mecanismo con matemática accesible y diagramas de tensores, y lo implementa paso a paso. El transformer no es solo una pila de capas de atención; incluye también conexiones residuales, normalización por capas, codificación posicional y una subcapa feedforward. El libro dedica varias secciones a construir el codificador, el decodificador, la información posicional senoidal o rotatoria (RoPE), y el proceso completo de entrenamiento con entropía cruzada y optimización Adam. Cuando termines esa parte, habrás implementado un transformer funcional con tus propias manos. Con esa base, el libro te sitúa en el ecosistema actual. Analiza la familia GPT, desde GPT-1 hasta los modelos más recientes, y contrasta el enfoque de solo decodificador con el de solo codificador de BERT y el encoder-decoder de T5. Explora también el aprendizaje en contexto, el fine-tuning instructivo y los modelos de código abierto como LLaMA, Mistral, Gemma y Qwen, mostrando sus fortalezas y compensaciones. La última parte se adentra en las leyes de escalado, que explican cómo parámetros, datos y cómputo determinan el rendimiento, y en técnicas sofisticadas como contexto largo, caché KV, recuperación aumentada (RAG), mixture of experts (MoE) y razonamiento en cadena (chain-of-thought). Son temas que los profesionales necesitan dominar para decidir qué arquitectura usar, cuánto entrenar y cómo evaluar resultados. La obra incluye numerosos diagramas, ilustraciones de conceptos y visualizaciones de tensores que siguen una dirección de arte uniforme, pensada para que el lector vea el flujo de datos de un vistazo. Cada imagen está integrada en la explicación, no es adorno, y ayuda a construir intuiciones sólidas. En resumen, a lo largo de estas páginas vas a: • Transformar texto en tensores mediante tokenización y embeddings de última generación. • Implementar desde cero capas de atención, transformer y bucles de entrenamiento en PyTorch. • Identificar cuándo y cómo aplicar modelos preentrenados, escalado y técnicas de contexto largo en problemas reales. ¿Quién debería leerlo? Desarrolladores de software que integran IA en sus productos, científicos de datos que quieren dejar de depender de cajas negras, estudiantes de ingeniería informática o matemáticas aplicadas, y cualquier persona con curiosidad técnica por comprender los fundamentos de los LLM. El único requisito real es manejar los básicos de Python y tener interés en el álgebra lineal y la probabilidad. Si ya has usado ChatGPT o un modelo similar y te has quedado con preguntas —¿por qué alucina?, ¿por qué olvida información del inicio de una conversación?, ¿cómo se le puede enseñar a seguir instrucciones?— este libro te dará las bases para responderlas por ti mismo. El autor no se conforma con explicar: te invita a construir. La metodología del libro está pensada para que cada concepto se asiente con código real, ejecutable en un cuaderno o en un script. Al final, tendrás no solo una visión integral de la arquitectura, sino un mini-GPT propio con el que experimentar, un logro que transforma la manera en la que entiendes la IA generativa. Si lo que buscas es un manual de usar APIs, este no es tu libro. Pero si quieres abrir la caja negra, entender por qué un cambio en la atención multiplicó la capacidad de los modelos y ser capaz de modificar o entrenar tus propios sistemas, esta es la lectura adecuada. Los grandes modelos de lenguaje se construyen con ideas claras, código honesto y mucha experimentación: aquí tienes los tres ingredientes, perfectamente organizados.

AI summary: Este libro explica los fundamentos de los grandes modelos de lenguaje (LLM), desde la naturaleza del lenguaje humano y la evolución del procesamiento del lenguaje natural hasta la arquitectura Transformer y los modelos modernos como GPT, BERT y LLaMA. Incluye ejemplos de código en PyTorch que permiten implementar desde cero un transformer en miniatura y comprender conceptos como embeddings, tokenización, atención multi-cabeza y leyes de escalado. Está dirigido a estudiantes, desarrolladores y profesionales de IA/ML con conocimientos básicos de Python y machine learning.

Ideal para
Estudiantes, desarrolladores y profesionales de IA/ML con conocimientos básicos de Python y machine learning que quieren construir y comprender los grandes modelos de lenguaje por dentro.
Perfil del lector
Un desarrollador de software con experiencia en Python que usa APIs de LLM en su trabajo y quiere dominar la arquitectura interna para crear modelos propios en PyTorch.
Intención de búsqueda
El lector busca una guía tanto teórica como práctica para entender cómo funcionan por dentro los grandes modelos de lenguaje, con código en PyTorch y explicaciones sobre transformers, embeddings y redes neuronales.
Enfoque único
El libro se centra en la construcción: en lugar de tratar los LLM como cajas negras, acompaña al lector a implementar en PyTorch un modelo GPT en miniatura, conectando cada concepto teórico con código funcional.
Tipo de contenido
guía técnica para desarrolladores

Resumen rápido

  • Un gran modelo de lenguaje es un sistema de inteligencia artificial entrenado para predecir la siguiente palabra en una secuencia de texto, usando arquitecturas basadas en atención como los transformers.
  • Este libro guía al lector desde los conceptos básicos de redes neuronales hasta la construcción de un modelo GPT en miniatura con PyTorch.
  • La atención multi-cabeza permite que cada token de una secuencia observe y combine información del contexto completo, superando las limitaciones de las RNN.
  • El libro cubre las familias de modelos más influyentes: GPT (solo decodificador), BERT (solo codificador) y T5 (codificador-decodificador), así como modelos de código abierto como LLaMA y Mistral.
  • Incluye una explicación práctica de las leyes de escalado y su impacto en el rendimiento de los modelos de lenguaje.

Key topics: lenguaje humano y complejidad, evolución del procesamiento del lenguaje natural, embeddings de palabras, tokenización, redes neuronales recurrentes, LSTM y GRU, mecanismo de atención, arquitectura Transformer, modelos GPT, BERT y modelos encoder, modelos de lenguaje de código abierto, leyes de escalado en LLM

Entities: grandes modelos de lenguaje (LLM), transformers, embeddings, Word2Vec, PyTorch, self-attention, GPT, BERT, LSTM, tokenización, atención multi-cabeza, leyes de escalado

Necesidades cubiertas

  • Comprender cómo las máquinas representan el lenguaje humano con números y vectores.
  • Dominar el mecanismo de atención y su papel en los transformers.
  • Implementar paso a paso un transformer en miniatura en PyTorch.
  • Distinguir las arquitecturas de modelos como GPT, BERT y T5.
  • Entender las leyes de escalado y las capacidades emergentes de los LLM.

Léelo si

  • Estudiantes de inteligencia artificial o ciencia de datos que quieran fundamentos sólidos en LLM.
  • Desarrolladores de software que usan APIs de lenguaje y desean crear modelos propios.
  • Profesionales de machine learning que necesitan entender el funcionamiento interno de los transformers.
  • Ingenieros de NLP que quieran actualizarse sobre arquitecturas modernas y código abierto.
  • Científicos de datos que buscan una guía práctica con código en PyTorch.

Puede no encajar si

  • Lectores que buscan una introducción informal o historia anecdótica de la IA.
  • Personas sin experiencia previa en Python y fundamentos de machine learning.
  • Practicantes avanzados de LLM que ya dominan transformers y no necesitan una base teórica.

Índice

  1. Nota del Autor (introduction)
  2. Comprender el Lenguaje y la Inteligencia (part)
  3. Por Qué el Lenguaje Humano Es Difícil para las Máquinas (chapter)
  4. La Naturaleza del Lenguaje Humano (section)
  5. Ambigüedad y Contexto (section)
  6. El Significado Más Allá de las Palabras (section)
  7. El Lenguaje como un Problema de Predicción (section)
  8. El Sueño de la Comprensión Artificial del Lenguaje (section)
  9. La Evolución del Procesamiento del Lenguaje (chapter)
  10. Sistemas Basados en Reglas (section)
  11. Procesamiento Estadístico del Lenguaje Natural (NLP) (section)
  12. Enfoques Basados en Aprendizaje Automático (section)
  13. La Revolución del Aprendizaje Profundo (section)
  14. El Surgimiento de los Modelos Fundacionales (section)
  15. ¿Qué Es un Modelo de Lenguaje? (chapter)
  16. Predecir la Siguiente Palabra (section)
  17. Probabilidad y Lenguaje (section)
  18. Contexto y Memoria (section)
  19. Cómo Medir la Comprensión del Lenguaje (section)
  20. Por Qué los Modelos de Lenguaje Son Importantes (section)
  21. Resumen de la Parte I (section)
  22. Representar el Lenguaje Mediante Números (part)
  23. De los Símbolos a los Números (chapter)
  24. Por Qué las Máquinas Necesitan Números (section)
  25. Codificación One-Hot (section)
  26. Representaciones Dispersas (section)
  27. Similitud y Distancia (section)
  28. La Maldición de la Dimensionalidad (section)
  29. Embeddings de Palabras (chapter)
  30. La Hipótesis Distribucional (section)
  31. Representaciones Vectoriales Densas (section)
  32. Relaciones Semánticas (section)
  33. Aritmética de Vectores (section)
  34. Comprender los Espacios de Embeddings (section)
  35. Word2Vec, GloVe y FastText (chapter)
  36. CBOW (section)
  37. Skip-Gram (section)
  38. Muestreo Negativo (section)
  39. Métodos Basados en Coocurrencia Global (section)
  40. Modelado de Subpalabras (section)
  41. Tokenización (chapter)
  42. Por Qué la Tokenización Es Importante (section)
  43. Modelos a Nivel de Carácter (section)
  44. Modelos a Nivel de Palabra (section)
  45. Modelos Basados en Subpalabras (section)
  46. BPE (section)
  47. WordPiece (section)
  48. SentencePiece (section)
  49. Tokenizadores Modernos (section)
  50. Resumen de la Parte II (section)
  51. Redes Neuronales para el Lenguaje (part)
  52. Fundamentos de las Redes Neuronales (chapter)
  53. Neuronas Artificiales (section)
  54. Capas y Representaciones (section)
  55. Funciones de Activación (section)
  56. Retropropagación (section)
  57. Aprendizaje a Partir de los Datos (section)
  58. Modelos Neuronales de Lenguaje (chapter)
  59. Modelos de Lenguaje Feedforward (section)
  60. Ventanas de Contexto (section)
  61. Limitaciones del Contexto Fijo (section)
  62. Los Primeros Modelos Neuronales para NLP (section)
  63. Redes Neuronales Recurrentes (chapter)
  64. Procesamiento Secuencial (section)
  65. Estados Ocultos (section)
  66. Flujo de Información (section)
  67. Gradientes Desvanecidos (section)
  68. Gradientes Explosivos (section)
  69. LSTM y GRU (chapter)
  70. Dependencias a Largo Plazo (section)
  71. Celdas de Memoria (section)
  72. Puertas y Mecanismos de Control (section)
  73. Éxitos Prácticos (section)
  74. Limitaciones Persistentes (section)
  75. Resumen de la Parte III (section)
  76. La Revolución de la Atención (part)
  77. Por Qué la Atención Lo Cambió Todo (chapter)
  78. Cuellos de Botella en las Secuencias (section)
  79. Los Desafíos del Contexto Largo (section)
  80. El Problema del Codificador-Decodificador (section)

Preguntas frecuentes

¿Necesito conocimientos avanzados de matemáticas para leer este libro?

No. El libro explica los conceptos matemáticos necesarios, como vectores y probabilidad, de forma accesible y con ejemplos prácticos.

¿Qué incluye el libro en cuanto a código?

Incluye ejemplos en PyTorch para construir desde cero un transformer en miniatura, además de código para embeddings, tokenización y modelos básicos.

¿Cubre los modelos LLM más recientes como GPT-4?

El libro se centra en los fundamentos y en modelos establecidos como GPT-3, BERT y T5, y menciona familias abiertas como LLaMA y Mistral. No trata específicamente GPT-4.

¿Es adecuado para alguien que ya trabaja con APIs de LLM?

Sí, es ideal para quien quiere pasar de usar APIs a entender y construir sus propios modelos, profundizando en la arquitectura interna.

¿Cuál es el principal objetivo del libro?

Proporcionar una base sólida y práctica para que el lector comprenda y pueda implementar grandes modelos de lenguaje por sí mismo.

C

Cretisoft Direct

Soporte de libro digital

T

Entrega de partner

Libro enviado después del pago

Sample EPUB

Read sample online

Fundamentos de los Grandes Modelos de Lenguaje: Una Introducción al Lenguaje, las Redes Neuronales y los Transformers

También te puede gustar

Basado en tu historial de lectura

Ver todo