technology-ai

Ingeniería de Modelos de Lenguaje Grande: Entrenamiento Distribuido, Inferencia y Producción

Daniel Foster

Book 3#3

477

Páginas

es

Idioma

2026

Publicado

Nueva edición

$2.00

Lee la muestra EPUB directamente en la web

Introducción del libro

Un modelo de lenguaje con 70 mil millones de parámetros puede entrenar durante semanas en un clúster dedicado y, sin embargo, fallar miserablemente cuando intentas servirlo a usuarios reales. La razón no es el modelo en sí, sino la infraestructura que lo rodea: la gestión de memoria VRAM, la comunicación entre GPUs a través de NVLink e InfiniBand, la latencia de red y las estrategias de escalado. Este libro parte de esa realidad incómoda: no basta con lograr un buen accuracy; hay que lograr que el modelo sobreviva en producción, con costos controlados y alta disponibilidad. La brecha entre el prototipo de laboratorio y el servicio de producción real es donde fracasan la mayoría de los proyectos de IA, y este libro te da las herramientas para cruzarla.

Ingeniería de Modelos de Lenguaje Grande: Entrenamiento Distribuido, Inferencia y Producción es una guía práctica, escrita para ingenieros que necesitan llevar los LLMs más allá del laboratorio. A lo largo de 15 capítulos, el libro cubre el ciclo de vida completo de la infraestructura de IA, desde la configuración de hardware y la distribución del entrenamiento hasta el despliegue de servicios escalables y seguros. El enfoque es deliberadamente concreto: cada técnica se explica a través de su impacto en el uso de VRAM, el throughput y el costo, con ejemplos de código y configuración listos para usar. A diferencia de otros textos académicos, aquí no hay derivaciones matemáticas densas ni desvíos hacia fine-tuning; todo está orientado a la acción y a la toma de decisiones en entornos reales.

La primera parte del libro se centra en el entrenamiento eficiente a gran escala. Comienzas por entender los límites físicos de la GPU: la VRAM no es infinita, y cada parámetro, gradiente y estado de optimizador ocupa memoria. A partir de ahí, exploras técnicas como precisión mixta (FP16, bfloat16), checkpointing de gradientes y FlashAttention, que reducen drásticamente el consumo de memoria sin sacrificar rendimiento. También profundizas en las tres modalidades de paralelismo: datos, tensores y pipeline, y en cómo combinarlas en una estrategia híbrida 3D para modelos de más de 100 mil millones de parámetros. Frameworks como DeepSpeed con su familia ZeRO y el FSDP de PyTorch se tratan con detalle, incluyendo configuraciones YAML y código Python para implementarlos en tu propio clúster.

La segunda parte del libro ataca el problema económico de los LLMs: la inferencia. Aquí aprenderás a reducir el peso del modelo mediante cuantización, con técnicas como INT8, GPTQ y AWQ, que pueden multiplicar el throughput sin pérdida significativa de calidad. También verás cómo implementar un caché KV para evitar recomputaciones en generación autoregresiva, y cómo el batching continuo y la decodificación especulativa pueden saturar tus GPUs. Además, se comparan en profundidad motores de servicio como vLLM, SGLang, TensorRT-LLM y Ollama, con benchmarks y consejos para elegir según tu hardware y requisitos de latencia. Todo ello con el objetivo claro de reducir el costo por token y hacer factible el despliegue a escala.

La tercera parte del libro te lleva a la producción real. Diseñarás APIs robustas y seguras, con autenticación y rate limiting para proteger tu servicio. Aprenderás a balancear la carga entre réplicas y a configurar autoescalado basado en latencia, cola de peticiones y uso de GPU. El monitoreo es clave: métricas de throughput, latencia p50/p99, tasa de errores y costo por millón de tokens, visualizadas con Prometheus y Grafana. También se abordan estrategias de alta disponibilidad como despliegues azul-verde y arquitecturas multi-región. Finalmente, los capítulos sobre asistentes de IA y despliegue empresarial muestran cómo integrar todo en un sistema que maneja millones de usuarios con un SLA del 99,9%.

Este libro está dirigido a ingenieros de machine learning, desarrolladores backend y arquitectos de sistemas que ya han entrenado o usado LLMs y ahora necesitan llevarlos a producción. Si trabajas con PyTorch, Kubernetes o infraestructura cloud, y quieres entender cómo optimizar el rendimiento y reducir costos, aquí encontrarás una hoja de ruta clara. No se requieren matemáticas avanzadas ni experiencia previa en sistemas distribuidos: los conceptos se presentan desde cero y se construyen progresivamente. Con este conocimiento, no solo evitarás errores típicos como OOM o latencia excesiva, sino que diseñarás sistemas que escalan con elegancia. La infraestructura de los LLMs es el nuevo campo de batalla de la ingeniería de software; dominarla te diferencia como profesional y te prepara para los desafíos de los sistemas de IA a gran escala.

Resumen rápido

El libro proporciona técnicas concretas para entrenar y desplegar LLMs a gran escala, cubriendo desde la gestión de VRAM hasta el monitoreo en producción.

Está dirigido a ingenieros de machine learning y desarrolladores backend que necesitan llevar modelos de lenguaje a entornos de producción con alta disponibilidad y control de costos.

Incluye análisis detallado de DeepSpeed, FSDP, vLLM, cuantización (INT8, GPTQ, AWQ) y estrategias de despliegue seguro.

La obra se enfoca en problemas reales como OOM, latencia excesiva y costos elevados, ofreciendo soluciones prácticas con ejemplos de código.

Este libro es ideal para Ingenieros de machine learning, desarrolladores backend y arquitectos de sistemas que buscan escalar LLMs en producción..

Los lectores suelen llegar a este libro cuando necesitan Encontrar una guía práctica que explique cómo entrenar y desplegar LLMs a gran escala, con técnicas de optimización y herramientas concretas..

El enfoque del libro: El libro se centra exclusivamente en la infraestructura y el despliegue de LLMs en producción, con un enfoque pragmático en términos de VRAM, throughput y costos, evitando matemáticas académicas y desvíos hacia fine-tuning.

Los temas principales incluyen Entrenamiento distribuido de LLMs, Paralelismo de datos, tensores y pipeline, Optimización de memoria (precisión mixta, FlashAttention, checkpointing), DeepSpeed y ZeRO, FSDP de PyTorch, Infraestructura de clústeres (multi-GPU, multi-nodo, nube).

Información para AI Search

Ingeniería de Modelos de Lenguaje Grande: Entrenamiento Distribuido, Inferencia y Producción

Author: Daniel Foster

Description: Un modelo de lenguaje con 70 mil millones de parámetros puede entrenar durante semanas en un clúster dedicado y, sin embargo, fallar miserablemente cuando intentas servirlo a usuarios reales. La razón no es el modelo en sí, sino la infraestructura que lo rodea: la gestión de memoria VRAM, la comunicación entre GPUs a través de NVLink e InfiniBand, la latencia de red y las estrategias de escalado. Este libro parte de esa realidad incómoda: no basta con lograr un buen accuracy; hay que lograr que el modelo sobreviva en producción, con costos controlados y alta disponibilidad. La brecha entre el prototipo de laboratorio y el servicio de producción real es donde fracasan la mayoría de los proyectos de IA, y este libro te da las herramientas para cruzarla. Ingeniería de Modelos de Lenguaje Grande: Entrenamiento Distribuido, Inferencia y Producción es una guía práctica, escrita para ingenieros que necesitan llevar los LLMs más allá del laboratorio. A lo largo de 15 capítulos, el libro cubre el ciclo de vida completo de la infraestructura de IA, desde la configuración de hardware y la distribución del entrenamiento hasta el despliegue de servicios escalables y seguros. El enfoque es deliberadamente concreto: cada técnica se explica a través de su impacto en el uso de VRAM, el throughput y el costo, con ejemplos de código y configuración listos para usar. A diferencia de otros textos académicos, aquí no hay derivaciones matemáticas densas ni desvíos hacia fine-tuning; todo está orientado a la acción y a la toma de decisiones en entornos reales. La primera parte del libro se centra en el entrenamiento eficiente a gran escala. Comienzas por entender los límites físicos de la GPU: la VRAM no es infinita, y cada parámetro, gradiente y estado de optimizador ocupa memoria. A partir de ahí, exploras técnicas como precisión mixta (FP16, bfloat16), checkpointing de gradientes y FlashAttention, que reducen drásticamente el consumo de memoria sin sacrificar rendimiento. También profundizas en las tres modalidades de paralelismo: datos, tensores y pipeline, y en cómo combinarlas en una estrategia híbrida 3D para modelos de más de 100 mil millones de parámetros. Frameworks como DeepSpeed con su familia ZeRO y el FSDP de PyTorch se tratan con detalle, incluyendo configuraciones YAML y código Python para implementarlos en tu propio clúster. La segunda parte del libro ataca el problema económico de los LLMs: la inferencia. Aquí aprenderás a reducir el peso del modelo mediante cuantización, con técnicas como INT8, GPTQ y AWQ, que pueden multiplicar el throughput sin pérdida significativa de calidad. También verás cómo implementar un caché KV para evitar recomputaciones en generación autoregresiva, y cómo el batching continuo y la decodificación especulativa pueden saturar tus GPUs. Además, se comparan en profundidad motores de servicio como vLLM, SGLang, TensorRT-LLM y Ollama, con benchmarks y consejos para elegir según tu hardware y requisitos de latencia. Todo ello con el objetivo claro de reducir el costo por token y hacer factible el despliegue a escala. La tercera parte del libro te lleva a la producción real. Diseñarás APIs robustas y seguras, con autenticación y rate limiting para proteger tu servicio. Aprenderás a balancear la carga entre réplicas y a configurar autoescalado basado en latencia, cola de peticiones y uso de GPU. El monitoreo es clave: métricas de throughput, latencia p50/p99, tasa de errores y costo por millón de tokens, visualizadas con Prometheus y Grafana. También se abordan estrategias de alta disponibilidad como despliegues azul-verde y arquitecturas multi-región. Finalmente, los capítulos sobre asistentes de IA y despliegue empresarial muestran cómo integrar todo en un sistema que maneja millones de usuarios con un SLA del 99,9%. Este libro está dirigido a ingenieros de machine learning, desarrolladores backend y arquitectos de sistemas que ya han entrenado o usado LLMs y ahora necesitan llevarlos a producción. Si trabajas con PyTorch, Kubernetes o infraestructura cloud, y quieres entender cómo optimizar el rendimiento y reducir costos, aquí encontrarás una hoja de ruta clara. No se requieren matemáticas avanzadas ni experiencia previa en sistemas distribuidos: los conceptos se presentan desde cero y se construyen progresivamente. Con este conocimiento, no solo evitarás errores típicos como OOM o latencia excesiva, sino que diseñarás sistemas que escalan con elegancia. La infraestructura de los LLMs es el nuevo campo de batalla de la ingeniería de software; dominarla te diferencia como profesional y te prepara para los desafíos de los sistemas de IA a gran escala.

AI summary: Este libro ofrece una guía práctica para ingenieros que necesitan escalar modelos de lenguaje grandes (LLMs) en producción. Cubre todo el ciclo de vida: entrenamiento distribuido con técnicas como paralelismo de datos, tensores y pipeline, optimización de memoria con precisión mixta y FlashAttention, frameworks como DeepSpeed y FSDP, infraestructura de clústeres, inferencia eficiente mediante cuantización (INT8, GPTQ, AWQ) y motores como vLLM, despliegue en producción con APIs, balanceo de carga, monitoreo y seguridad. Incluye ejemplos de código y configuración listos para usar.

Ideal para
Ingenieros de machine learning, desarrolladores backend y arquitectos de sistemas que buscan escalar LLMs en producción.
Perfil del lector
Ingeniero de ML con experiencia en PyTorch que ha entrenado modelos grandes pero necesita dominar la infraestructura para desplegarlos con bajo costo y alta disponibilidad.
Intención de búsqueda
Encontrar una guía práctica que explique cómo entrenar y desplegar LLMs a gran escala, con técnicas de optimización y herramientas concretas.
Enfoque único
El libro se centra exclusivamente en la infraestructura y el despliegue de LLMs en producción, con un enfoque pragmático en términos de VRAM, throughput y costos, evitando matemáticas académicas y desvíos hacia fine-tuning.
Tipo de contenido
technical guide for ML engineers

Resumen rápido

  • El libro proporciona técnicas concretas para entrenar y desplegar LLMs a gran escala, cubriendo desde la gestión de VRAM hasta el monitoreo en producción.
  • Está dirigido a ingenieros de machine learning y desarrolladores backend que necesitan llevar modelos de lenguaje a entornos de producción con alta disponibilidad y control de costos.
  • Incluye análisis detallado de DeepSpeed, FSDP, vLLM, cuantización (INT8, GPTQ, AWQ) y estrategias de despliegue seguro.
  • La obra se enfoca en problemas reales como OOM, latencia excesiva y costos elevados, ofreciendo soluciones prácticas con ejemplos de código.

Key topics: Entrenamiento distribuido de LLMs, Paralelismo de datos, tensores y pipeline, Optimización de memoria (precisión mixta, FlashAttention, checkpointing), DeepSpeed y ZeRO, FSDP de PyTorch, Infraestructura de clústeres (multi-GPU, multi-nodo, nube), Cuantización de modelos (INT8, GPTQ, AWQ, GGUF), Inferencia de alto rendimiento (caché KV, batching continuo, decodificación especulativa), Frameworks de servicio (vLLM, SGLang, TensorRT-LLM, Ollama), Despliegue en producción (APIs, balanceo de carga, autoescalado), Monitoreo y observabilidad (métricas, logging, costos), Seguridad y cumplimiento (autenticación, rate limiting, privacidad)

Entities: LLM, VRAM, GPU, DeepSpeed, ZeRO, FSDP, PyTorch, vLLM, TensorRT-LLM, Ollama, SGLang, FlashAttention

Necesidades cubiertas

  • Cómo entrenar modelos que no caben en una sola GPU
  • Cómo reducir el uso de memoria durante el entrenamiento con precisión mixta y checkpointing
  • Cómo optimizar la inferencia para disminuir latencia y costos mediante cuantización y batching
  • Cómo desplegar servicios LLM escalables y seguros con balanceo de carga y autoescalado
  • Cómo monitorear el rendimiento y el costo de los LLMs en producción
  • Cómo elegir el framework de servicio adecuado según el hardware y los requisitos de latencia

Léelo si

  • Ingenieros de machine learning que quieran llevar LLMs a producción
  • Desarrolladores backend que integren modelos de lenguaje en aplicaciones
  • Arquitectos de sistemas que diseñan infraestructura de IA
  • Equipos de MLOps que buscan optimizar costos y rendimiento
  • Estudiantes avanzados de IA con experiencia en PyTorch

Puede no encajar si

  • Principiantes absolutos en aprendizaje automático sin experiencia previa en PyTorch
  • Lectores interesados en teoría de modelos de lenguaje o fine-tuning, ya que el libro se enfoca en infraestructura
  • Personas que buscan una guía para usar APIs de LLMs como usuario final sin implementar infraestructura

Índice

  1. Introducción (introduction)
  2. Entrenamiento Eficiente de LLMs (part)
  3. Escalando el Entrenamiento de LLMs (chapter)
  4. Por qué los modelos grandes son difíciles de entrenar (section)
  5. Cuellos de botella en la memoria de la GPU (section)
  6. Cómputo y comunicación (section)
  7. Eficiencia en el entrenamiento (section)
  8. El stack moderno de entrenamiento (section)
  9. Fundamentos del Entrenamiento Distribuido (chapter)
  10. Paralelismo de datos (section)
  11. Paralelismo de tensores (section)
  12. Paralelismo de pipeline (section)
  13. Paralelismo híbrido (section)
  14. Elección de una estrategia (section)
  15. Optimización de Memoria (chapter)
  16. Precisión mixta (section)
  17. Checkpointing de gradientes (section)
  18. FlashAttention (section)
  19. Optimización de activaciones (section)
  20. Entrenamiento eficiente en memoria (section)
  21. Entrenamiento a Gran Escala (part)
  22. DeepSpeed (chapter)
  23. Arquitectura de DeepSpeed (section)
  24. ZeRO Etapa 1 (section)
  25. ZeRO Etapa 2 (section)
  26. ZeRO Etapa 3 (section)
  27. Configuración práctica (section)
  28. Fully Sharded Data Parallel (chapter)
  29. Fundamentos de FSDP (section)
  30. Fragmentación de parámetros (section)
  31. Checkpointing (section)
  32. Ajuste de rendimiento (section)
  33. Comparación entre FSDP y ZeRO (section)
  34. Infraestructura de Entrenamiento (chapter)
  35. Sistemas multi-GPU (section)
  36. Clústeres multi-nodo (section)
  37. Entrenamiento en la nube (section)
  38. Almacenamiento y redes (section)
  39. Optimización de costos (section)
  40. Inferencia Eficiente (part)
  41. Cuantización (chapter)
  42. Por qué importa la cuantización (section)
  43. INT8 (section)
  44. GPTQ (section)
  45. AWQ (section)
  46. GGUF (section)
  47. Inferencia de Alto Rendimiento (chapter)
  48. Caché KV (section)
  49. Batching continuo (section)
  50. Decodificación especulativa (section)
  51. Caché de prefijos (section)
  52. Optimización de inferencia (section)
  53. Frameworks de Servicio (chapter)
  54. vLLM (section)
  55. SGLang (section)
  56. TensorRT-LLM (section)
  57. Ollama (section)
  58. Elección de un framework de servicio (section)
  59. Despliegue en Producción (part)
  60. Despliegue de Servicios LLM (chapter)
  61. Servicios API (section)
  62. Balanceo de carga (section)
  63. Autoescalado (section)
  64. Alta disponibilidad (section)
  65. Arquitecturas de despliegue (section)
  66. Monitoreo de Modelos en Producción (chapter)
  67. Métricas de rendimiento (section)
  68. Latencia y throughput (section)
  69. Registro de eventos (Logging) (section)
  70. Monitoreo de costos (section)
  71. Fiabilidad (section)
  72. Aseguramiento de Sistemas LLM (chapter)
  73. Autenticación (section)
  74. Limitación de tasa (Rate Limiting) (section)
  75. Privacidad de datos (section)
  76. Gestión de secretos (section)
  77. Despliegue seguro (section)
  78. Sistemas del Mundo Real (part)
  79. Construcción de Asistentes de IA para Producción (chapter)
  80. Diseño de arquitectura (section)

Preguntas frecuentes

¿Cuál es el enfoque principal del libro?

El libro se centra en la ingeniería de infraestructura para LLMs: entrenamiento distribuido, optimización de inferencia, despliegue y monitoreo en producción.

¿Qué tecnologías cubre?

Cubre PyTorch, DeepSpeed, FSDP, vLLM, TensorRT-LLM, SGLang, Ollama, herramientas de cuantización como GPTQ y AWQ, así como infraestructura de clústeres y servicios en la nube.

¿Es necesario tener experiencia en sistemas distribuidos?

No, los conceptos se presentan desde cero, con explicaciones claras y ejemplos prácticos.

¿Incluye ejemplos de código?

Sí, incluye fragmentos de configuración práctica y ejemplos de código para implementar las técnicas en entornos reales.

¿Qué beneficios obtiene el lector?

El lector aprende a evitar errores comunes como OOM, a reducir costos de inferencia, y a diseñar sistemas escalables y seguros para LLMs en producción.

C

Cretisoft Direct

Soporte de libro digital

T

Entrega de partner

Libro enviado después del pago

Sample EPUB

Read sample online

Ingeniería de Modelos de Lenguaje Grande: Entrenamiento Distribuido, Inferencia y Producción

También te puede gustar

Basado en tu historial de lectura

Ver todo