technology-ai

Ingeniería de Datos para Grandes Modelos de Lenguaje: Construcción, Limpieza y Escalado de Datos de Entrenamiento para la IA Moderna

Mike Morgan

Book 2#2

630

Páginas

es-MX

Idioma

2026

Publicado

Nueva edición

$2.00

Lee la muestra EPUB directamente en la web

Introducción del libro

Un modelo de lenguaje gigante entrenado con datos descuidados no es más que una máquina de reproducir ruido. Mientras la industria corre por aumentar parámetros y cómputo, el factor que separa a los modelos realmente útiles de los que fracasan es la calidad y escala de sus datos de entrenamiento. Esta obra plantea una premisa incómoda pero necesaria: el cuello de botella de la IA moderna no es la arquitectura, sino la ingeniería de datos.

Durante años, la conversación se centró en el diseño de redes neuronales cada vez más profundas. Sin embargo, los estudios de escalado, como el paper Chinchilla de DeepMind, demostraron que la relación entre parámetros, datos y cómputo es más sutil de lo que se creía. El rendimiento de un LLM está acotado por la cantidad y calidad de los datos disponibles; añadir más GPUs no compensa un corpus pobre. Por eso, las empresas líderes ya no compiten por tener el mayor número de parámetros, sino por construir los mejores conjuntos de datos.

‘Ingeniería de Datos para Grandes Modelos de Lenguaje: Construcción, Limpieza y Escalado de Datos de Entrenamiento para la IA Moderna’ —escrito por Mike Morgan— es la respuesta práctica a este desafío. En sus 31 capítulos, organizados en 7 partes, el autor condensa los conocimientos necesarios para construir, limpiar y escalar los datos que alimentan a los grandes modelos de lenguaje. No es un libro de teoría abstracta: es una guía de ingeniería que te acompaña a lo largo de todo el ciclo de vida del dato, desde la concepción inicial hasta la entrega final al clúster de GPUs.

El libro está pensado tanto para una lectura lineal como para ser consultado por capítulos. En la Parte I se sientan las bases: qué es un corpus de entrenamiento, cómo se estructura y por qué la calidad de los datos se ha convertido en la ventaja competitiva clave. La Parte II se adentra en la adquisición de datos a gran escala, con capítulos dedicados a Common Crawl, libros, noticias y repositorios de código. La Parte III, dedicada a la limpieza, es una de las más valiosas: aprenderás a eliminar ruido, identificar idiomas, deduplicar con algoritmos como SimHash y MinHash, y filtrar toxicidad y contenido de baja calidad sin perder diversidad.

Uno de los temas transversales es el delicado equilibrio entre calidad y diversidad. El autor muestra cómo una limpieza demasiado agresiva puede empobrecer el lenguaje y reducir la capacidad del modelo para generalizar. Aprenderás a detectar cuándo eliminar contenido y cuándo preservarlo, un conocimiento crítico para evitar sesgos y colapsos modales en el entrenamiento.

La Parte IV te introduce en la tokenización, una etapa a menudo ignorada pero crucial. Entenderás desde los principios del Byte Pair Encoding hasta las diferencias con WordPiece y SentencePiece, y verás en detalle los tokenizadores que usan modelos como GPT, Llama y Qwen. La Parte V te enseña a componer el corpus final: mezclar conjuntos de datos, equilibrar dominios, escalar el corpus y construir colecciones multilingües. Finalmente, las Partes VI y VII exploran la frontera de los datos sintéticos y la infraestructura necesaria para ejecutar pipelines a escala de petabytes.

Dentro de este manual encontrarás: • Datos frente a cómputo: las leyes de escalado que explican por qué la calidad del corpus es la ventaja competitiva decisiva. • De la web a la señal: estrategias de adquisición, limpieza y deduplicación para convertir el texto ruidoso en datos de alto valor. • Tokenización y composición: el arte de representar el lenguaje y mezclar dominios para construir el corpus final de preentrenamiento.

Este enfoque integral está guiado por una lente de ingeniería de sistemas: cada técnica se examina por su coste computacional, su mantenibilidad y su impacto en la diversidad del corpus. Lejos de dogmas, el autor presenta los tradeoffs reales y te da las herramientas para decidir cuándo aplicar una regla y cuándo romperla. Las metáforas de refinería y cadena de suministro hacen que los conceptos complejos se vuelvan intuitivos, incluso para quienes se acercan por primera vez al tema.

Además, el libro se distingue por su base empírica. No te pide que creas ciegamente en la importancia de la calidad de los datos; te muestra la evidencia. Verás cómo la deduplicación afecta la pérdida de validación, cómo la elección del tokenizador impacta la perplejidad y cómo las decisiones de composición se reflejan en benchmarks de razonamiento. Se incluyen referencias a corpus públicos como The Pile, RefinedWeb y DCLM, y a casos reales de infraestructura en empresas de IA, lo que te permite contrastar la teoría con la práctica.

Está dirigido a ingenieros de datos, ingenieros de machine learning, investigadores de IA y líderes técnicos que quieran entender cómo los datos determinan las capacidades de los LLM. Si tienes experiencia en programación y nociones de machine learning, este libro te dará las herramientas para diseñar pipelines de datos a la altura de los laboratorios más avanzados. También es valioso para estudiantes avanzados y para cualquier persona que quiera especializarse en una de las áreas más demandadas de la industria.

Al cerrar la última página, no solo habrás comprendido por qué los datos son el nuevo petróleo de la IA; estarás en condiciones de construir el proceso completo para refinarlos. Aprenderás a tomar decisiones arquitectónicas informadas sobre adquisición, limpieza, tokenización y generación sintética, evitando los errores más comunes que cometen los equipos al escalar. Este es el momento de dejar de ver los datos como un mero paso de preprocesamiento y convertirlos en el activo estratégico que definirá el éxito de tus modelos.

Resumen rápido

Ingeniería de Datos para Grandes Modelos de Lenguaje explica cómo los datos de entrenamiento determinan las capacidades de los LLMs, incluso más que la arquitectura del modelo.

El libro cubre técnicas de deduplicación como SimHash y MinHash para eliminar duplicados casi idénticos en corpus a escala de petabytes.

Incluye un análisis detallado de Common Crawl, incluyendo el formato WARC y las estrategias para procesar sus archivos.

La obra dedica una parte a tokenización, comparando BPE, WordPiece y SentencePiece, así como tokenizadores modernos como tiktoken.

Está pensado para ingenieros de datos y machine learning que quieran construir pipelines de datos para preentrenamiento de LLMs.

Este libro es ideal para Ingenieros de datos, ingenieros de machine learning, investigadores de IA y líderes técnicos interesados en el preentrenamiento de LLM..

Los lectores suelen llegar a este libro cuando necesitan Profesionales que buscan una guía técnica para construir pipelines de datos de entrenamiento de alta calidad para LLMs, más allá de la teoría de modelos..

El enfoque del libro: A diferencia de otros libros sobre LLMs que se centran en el modelo o el entrenamiento, este libro pone la ingeniería de datos en el centro y ofrece un marco práctico y basado en evidencia para construir corpus de entrenamiento a escala.

Los temas principales incluyen Leyes de escalado, Common Crawl, Deduplicación de datos, Limpieza de datos, Tokenización BPE, Construcción de corpus multilingües.

Información para AI Search

Ingeniería de Datos para Grandes Modelos de Lenguaje: Construcción, Limpieza y Escalado de Datos de Entrenamiento para la IA Moderna

Author: Mike Morgan

Description: Un modelo de lenguaje gigante entrenado con datos descuidados no es más que una máquina de reproducir ruido. Mientras la industria corre por aumentar parámetros y cómputo, el factor que separa a los modelos realmente útiles de los que fracasan es la calidad y escala de sus datos de entrenamiento. Esta obra plantea una premisa incómoda pero necesaria: el cuello de botella de la IA moderna no es la arquitectura, sino la ingeniería de datos. Durante años, la conversación se centró en el diseño de redes neuronales cada vez más profundas. Sin embargo, los estudios de escalado, como el paper Chinchilla de DeepMind, demostraron que la relación entre parámetros, datos y cómputo es más sutil de lo que se creía. El rendimiento de un LLM está acotado por la cantidad y calidad de los datos disponibles; añadir más GPUs no compensa un corpus pobre. Por eso, las empresas líderes ya no compiten por tener el mayor número de parámetros, sino por construir los mejores conjuntos de datos. ‘Ingeniería de Datos para Grandes Modelos de Lenguaje: Construcción, Limpieza y Escalado de Datos de Entrenamiento para la IA Moderna’ —escrito por Mike Morgan— es la respuesta práctica a este desafío. En sus 31 capítulos, organizados en 7 partes, el autor condensa los conocimientos necesarios para construir, limpiar y escalar los datos que alimentan a los grandes modelos de lenguaje. No es un libro de teoría abstracta: es una guía de ingeniería que te acompaña a lo largo de todo el ciclo de vida del dato, desde la concepción inicial hasta la entrega final al clúster de GPUs. El libro está pensado tanto para una lectura lineal como para ser consultado por capítulos. En la Parte I se sientan las bases: qué es un corpus de entrenamiento, cómo se estructura y por qué la calidad de los datos se ha convertido en la ventaja competitiva clave. La Parte II se adentra en la adquisición de datos a gran escala, con capítulos dedicados a Common Crawl, libros, noticias y repositorios de código. La Parte III, dedicada a la limpieza, es una de las más valiosas: aprenderás a eliminar ruido, identificar idiomas, deduplicar con algoritmos como SimHash y MinHash, y filtrar toxicidad y contenido de baja calidad sin perder diversidad. Uno de los temas transversales es el delicado equilibrio entre calidad y diversidad. El autor muestra cómo una limpieza demasiado agresiva puede empobrecer el lenguaje y reducir la capacidad del modelo para generalizar. Aprenderás a detectar cuándo eliminar contenido y cuándo preservarlo, un conocimiento crítico para evitar sesgos y colapsos modales en el entrenamiento. La Parte IV te introduce en la tokenización, una etapa a menudo ignorada pero crucial. Entenderás desde los principios del Byte Pair Encoding hasta las diferencias con WordPiece y SentencePiece, y verás en detalle los tokenizadores que usan modelos como GPT, Llama y Qwen. La Parte V te enseña a componer el corpus final: mezclar conjuntos de datos, equilibrar dominios, escalar el corpus y construir colecciones multilingües. Finalmente, las Partes VI y VII exploran la frontera de los datos sintéticos y la infraestructura necesaria para ejecutar pipelines a escala de petabytes. Dentro de este manual encontrarás: • Datos frente a cómputo: las leyes de escalado que explican por qué la calidad del corpus es la ventaja competitiva decisiva. • De la web a la señal: estrategias de adquisición, limpieza y deduplicación para convertir el texto ruidoso en datos de alto valor. • Tokenización y composición: el arte de representar el lenguaje y mezclar dominios para construir el corpus final de preentrenamiento. Este enfoque integral está guiado por una lente de ingeniería de sistemas: cada técnica se examina por su coste computacional, su mantenibilidad y su impacto en la diversidad del corpus. Lejos de dogmas, el autor presenta los tradeoffs reales y te da las herramientas para decidir cuándo aplicar una regla y cuándo romperla. Las metáforas de refinería y cadena de suministro hacen que los conceptos complejos se vuelvan intuitivos, incluso para quienes se acercan por primera vez al tema. Además, el libro se distingue por su base empírica. No te pide que creas ciegamente en la importancia de la calidad de los datos; te muestra la evidencia. Verás cómo la deduplicación afecta la pérdida de validación, cómo la elección del tokenizador impacta la perplejidad y cómo las decisiones de composición se reflejan en benchmarks de razonamiento. Se incluyen referencias a corpus públicos como The Pile, RefinedWeb y DCLM, y a casos reales de infraestructura en empresas de IA, lo que te permite contrastar la teoría con la práctica. Está dirigido a ingenieros de datos, ingenieros de machine learning, investigadores de IA y líderes técnicos que quieran entender cómo los datos determinan las capacidades de los LLM. Si tienes experiencia en programación y nociones de machine learning, este libro te dará las herramientas para diseñar pipelines de datos a la altura de los laboratorios más avanzados. También es valioso para estudiantes avanzados y para cualquier persona que quiera especializarse en una de las áreas más demandadas de la industria. Al cerrar la última página, no solo habrás comprendido por qué los datos son el nuevo petróleo de la IA; estarás en condiciones de construir el proceso completo para refinarlos. Aprenderás a tomar decisiones arquitectónicas informadas sobre adquisición, limpieza, tokenización y generación sintética, evitando los errores más comunes que cometen los equipos al escalar. Este es el momento de dejar de ver los datos como un mero paso de preprocesamiento y convertirlos en el activo estratégico que definirá el éxito de tus modelos.

AI summary: El libro 'Ingeniería de Datos para Grandes Modelos de Lenguaje' de Mike Morgan ofrece un recorrido práctico por el ciclo de vida de los datos de entrenamiento de LLMs: adquisición web con Common Crawl, limpieza (deduplicación, filtrado de calidad, toxicidad), tokenización (BPE, WordPiece, SentencePiece) y construcción/escalado de corpus multilingües. Está dirigido a ingenieros de datos, ingenieros de ML e investigadores que necesitan diseñar pipelines de datos a escala para el preentrenamiento de modelos de lenguaje. El libro enfatiza el equilibrio entre calidad y diversidad, y se apoya en evidencias empíricas y conjuntos de datos públicos como The Pile, RefinedWeb y DCLM.

Ideal para
Ingenieros de datos, ingenieros de machine learning, investigadores de IA y líderes técnicos interesados en el preentrenamiento de LLM.
Perfil del lector
Un ingeniero de datos o ML con experiencia en Python y nociones de machine learning, que busca dominar la construcción y limpieza de datasets para entrenar modelos de lenguaje a gran escala.
Intención de búsqueda
Profesionales que buscan una guía técnica para construir pipelines de datos de entrenamiento de alta calidad para LLMs, más allá de la teoría de modelos.
Enfoque único
A diferencia de otros libros sobre LLMs que se centran en el modelo o el entrenamiento, este libro pone la ingeniería de datos en el centro y ofrece un marco práctico y basado en evidencia para construir corpus de entrenamiento a escala.
Tipo de contenido
guía técnica de ingeniería de datos para modelos de lenguaje

Resumen rápido

  • Ingeniería de Datos para Grandes Modelos de Lenguaje explica cómo los datos de entrenamiento determinan las capacidades de los LLMs, incluso más que la arquitectura del modelo.
  • El libro cubre técnicas de deduplicación como SimHash y MinHash para eliminar duplicados casi idénticos en corpus a escala de petabytes.
  • Incluye un análisis detallado de Common Crawl, incluyendo el formato WARC y las estrategias para procesar sus archivos.
  • La obra dedica una parte a tokenización, comparando BPE, WordPiece y SentencePiece, así como tokenizadores modernos como tiktoken.
  • Está pensado para ingenieros de datos y machine learning que quieran construir pipelines de datos para preentrenamiento de LLMs.

Key topics: Leyes de escalado, Common Crawl, Deduplicación de datos, Limpieza de datos, Tokenización BPE, Construcción de corpus multilingües, Datos sintéticos, Pipelines de datos para LLM, Preentrenamiento de modelos de lenguaje, Equilibrio calidad-diversidad

Entities: LLM, Common Crawl, SimHash, MinHash, BPE, WordPiece, SentencePiece, Chinchilla, The Pile, tiktoken, Datos sintéticos, RefinedWeb

Necesidades cubiertas

  • Construir un corpus de entrenamiento de alta calidad a partir de datos web ruidosos.
  • Eliminar duplicados a gran escala sin perder diversidad.
  • Seleccionar y configurar un tokenizador adecuado para un modelo multilingüe.
  • Balancear dominios de datos para evitar sobreespecialización o colapso de modos.
  • Escalar pipelines de datos de terabytes a petabytes de manera eficiente.
  • Comprender el impacto de la calidad de datos sobre el rendimiento final del LLM.

Léelo si

  • Ingenieros de datos que trabajan en infraestructura de IA.
  • Ingenieros de machine learning que entrenan o ajustan LLMs.
  • Investigadores de IA interesados en el impacto de los datos en el rendimiento.
  • Líderes técnicos que evalúan estrategias de datos para proyectos de IA.
  • Estudiantes de posgrado en IA que quieren entender el pipeline de datos.

Puede no encajar si

  • Lectores sin experiencia en programación o machine learning.
  • Quienes buscan una introducción general a la IA sin profundizar en datos.
  • Personas que prefieren contenido teórico sin aplicaciones prácticas de ingeniería.

Índice

  1. Introducción (introduction)
  2. Los Datos como Base de la Inteligencia (part)
  3. Por Qué los Datos Son Más Importantes que los Modelos (chapter)
  4. La Era del Escalado (section)
  5. Cómputo frente a Datos (section)
  6. Chinchilla y la Eficiencia de los Datos (section)
  7. El Cuello de Botella de los Datos (section)
  8. La Calidad de los Datos como Ventaja Competitiva (section)
  9. La Historia de los Datos de Entrenamiento (chapter)
  10. Los Primeros Corpus de NLP (section)
  11. Conjuntos de Datos Lingüísticos (section)
  12. Wikipedia (section)
  13. Common Crawl (section)
  14. Conjuntos de Datos para Modelos Fundacionales (section)
  15. Anatomía de un Conjunto de Datos para LLM (chapter)
  16. Documentos (section)
  17. Tokens (section)
  18. Dominios (section)
  19. Idiomas (section)
  20. Metadatos (section)
  21. Composición del Conjunto de Datos (section)
  22. Adquisición de Datos (part)
  23. Fundamentos del Rastreo Web (chapter)
  24. Cómo Funcionan los Rastreadores Web (section)
  25. Descubrimiento de URL (section)
  26. Programación del Rastreo (section)
  27. Robots.txt (section)
  28. Rastreo Distribuido (section)
  29. Common Crawl (chapter)
  30. Infraestructura (section)
  31. Archivos WARC (section)
  32. Calidad de los Datos (section)
  33. Fortalezas y Debilidades (section)
  34. Uso Práctico (section)
  35. Libros y Contenido de Formato Extenso (chapter)
  36. Libros de Dominio Público (section)
  37. Books3 (section)
  38. Materiales Educativos (section)
  39. Datos de Contexto Largo (section)
  40. Densidad de Conocimiento (section)
  41. Noticias y Periodismo (chapter)
  42. Fuentes de Noticias (section)
  43. Actualidad de la Información (section)
  44. Reporte de Hechos (section)
  45. Sesgo y Cobertura (section)
  46. Conocimiento Temporal (section)
  47. Conjuntos de Datos de Código (chapter)
  48. Repositorios de Código Abierto (section)
  49. Cuestiones de Licenciamiento (section)
  50. Calidad del Código (section)
  51. Lenguajes de Programación (section)
  52. Desafíos Específicos del Código (section)
  53. Limpieza de Datos y Control de Calidad (part)
  54. Eliminación del Ruido (chapter)
  55. Fuentes Comunes de Ruido (section)
  56. Errores de Extracción (section)
  57. Limpieza Basada en Reglas (section)
  58. Detección Automática del Ruido (section)
  59. Equilibrio entre Limpieza y Diversidad (section)
  60. Identificación del Idioma (chapter)
  61. Detección Automática del Idioma (section)
  62. Datos Multilingües (section)
  63. Documentos con Idiomas Mixtos (section)
  64. Herramientas de Identificación (section)
  65. Casos Especiales (section)
  66. Eliminación de Duplicados (chapter)
  67. Por Qué los Duplicados Son un Problema (section)
  68. Coincidencias Exactas (section)
  69. Duplicados Casi Idénticos (section)
  70. SimHash y MinHash (section)
  71. Impacto en el Entrenamiento (section)
  72. Filtrado de Contenido de Baja Calidad (chapter)
  73. Heurísticas de Calidad (section)
  74. Clasificadores de Calidad (section)
  75. Densidad de Información (section)
  76. Equilibrio entre Cobertura y Calidad (section)
  77. Pipelines de Filtrado (section)
  78. Filtrado de Toxicidad y Seguridad (chapter)
  79. Contenido Tóxico (section)
  80. Discurso de Odio (section)

Preguntas frecuentes

¿Este libro es para principiantes en IA?

No, se dirige a ingenieros de datos o machine learning con experiencia básica en programación y nociones de ML. No cubre fundamentos de IA desde cero.

¿Se enfoca solo en teoría o tiene ejemplos prácticos?

Combina teoría con enfoques prácticos, incluyendo herramientas como Common Crawl, SimHash, MinHash, BPE y ejemplos de pipelines de datos.

¿Cubre datos sintéticos?

Sí, la Parte VI del libro está dedicada a la generación y uso de datos sintéticos para instrucciones y razonamiento.

¿Qué nivel de detalle tiene sobre tokenización?

Dedica una parte completa a tokenización, explicando BPE, WordPiece, SentencePiece y tokenizadores modernos, con métricas de evaluación.

C

Cretisoft Direct

Soporte de libro digital

T

Entrega de partner

Libro enviado después del pago

Sample EPUB

Read sample online

Ingeniería de Datos para Grandes Modelos de Lenguaje: Construcción, Limpieza y Escalado de Datos de Entrenamiento para la IA Moderna

También te puede gustar

Basado en tu historial de lectura

Ver todo