technology-ai

Sistemas de Modelos de Lenguaje: Inferencia, Servicio, Agentes e Infraestructura de IA en Producción

Miles Thornton

Book 4#4

563

Trang

es-MX

Ngôn ngữ

2026

Tái bản

Bản mới

2,00 US$

Đọc EPUB mẫu trực tiếp trên web

Giới thiệu sách

El entrenamiento de un modelo de lenguaje puede costar millones de dólares, pero es un gasto único. La verdadera factura llega después, cuando intentas servir ese modelo a usuarios reales: cada token generado se convierte en latencia, memoria y dinero. Mientras que la investigación avanza con nuevos transformadores, los equipos de ingeniería luchan con cuellos de botella como la caché de clave-valor, el batching en GPUs y la escasez de VRAM. Este libro nace de esa brecha: entre el modelo entrenado y el sistema que funciona en producción.

Sistemas de Modelos de Lenguaje: Inferencia, Servicio, Agentes e Infraestructura de IA en Producción, de Miles Thornton, es una guía práctica que recorre todo el stack de una plataforma de IA moderna. A lo largo de sus 8 partes y 32 capítulos, no solo explica cómo funcionan los motores de inferencia y los frameworks de serving, sino que introduce las decisiones de arquitectura que determinan el éxito de un producto: ¿cuándo usar RAG en lugar de fine-tuning? ¿cómo equilibrar latencia y throughput? ¿qué modelo de cuantización elegir? Este es el manual que une el conocimiento de machine learning con las exigencias de la ingeniería de software.

Entre los temas que encontrará: • Cómo optimizar la inferencia: caché KV, FlashAttention, decodificación especulativa y cuantización de pesos. • Cómo servir modelos a gran escala con vLLM, batching continuo, balanceo de carga y autoescalado. • Cómo construir sistemas RAG y agentes de IA confiables, con herramientas de evaluación, guardrails y observabilidad.

El libro no se queda en la teoría. En sus páginas se analizan las compensaciones de memoria y los cuellos de botella de hardware que determinan el rendimiento real. Explica cómo PagedAttention transforma la gestión de la caché KV en el framework vLLM, cómo la cuantización reduce el peso del modelo sin destruir la precisión, y cómo el batching continuo exprime la GPU al máximo. También dedica secciones a los sistemas multiagente y a la seguridad, porque un agente que llama herramientas sin control puede hacer más daño que un modelo que simplemente alucina.

En el bloque de generación aumentada por recuperación, aprenderás a conectar el modelo con bases de datos vectoriales, elegir el embedding adecuado y construir pipelines que reducen las alucinaciones. Después, el libro se adentra en los sistemas de agentes: function calling, el patrón ReAct y los sistemas multiagente, mostrando cómo automatizar flujos de trabajo sin sacrificar la seguridad. Además, incluye técnicas para evaluar la calidad de las respuestas y para observar el comportamiento del sistema en producción.

El libro también aborda la infraestructura empresarial: optimización de costes en clústeres de GPU, gobernanza, seguridad y cumplimiento. Aprenderás a planificar la capacidad, a autoescalar servicios y a gestionar la privacidad de los datos. Y gracias a los capítulos de observabilidad y detección de alucinaciones, estarás preparado para operar plataformas de IA que no se degradan silenciosamente.

Este libro está dirigido a ingenieros de software, arquitectos técnicos y desarrolladores backend que quieren llevar sus prototipos de IA a producción. No necesitas ser un investigador; solo tener experiencia con Python, conocer los conceptos básicos de los transformers y, sobre todo, vivir la frustración de un modelo que funciona en un notebook pero se cae en un entorno real. Si trabajas en una startup o en una gran empresa, este libro te da el vocabulario y el criterio para discutir con tu equipo de infraestructura y tomar decisiones informadas.

Después de leerlo, entenderás por qué los equipos de Netflix, OpenAI y Anthropic toman ciertas decisiones de arquitectura y tendrás las herramientas para replicar esos patrones en tu propia organización. No es una colección de recetas sueltas; es una forma de pensar la IA como ingeniería de sistemas. Si alguna vez has sentido que el modelo es la parte fácil y la infraestructura la complicada, este libro te va a dar el mapa completo.

Tóm tắt nhanh

Sistemas de Modelos de Lenguaje es una guía práctica para implementar y operar modelos de lenguaje en producción.

El libro está dirigido a ingenieros de software, arquitectos técnicos y desarrolladores backend.

Cubre desde la optimización de inferencia y el despliegue con vLLM hasta la construcción de sistemas RAG y agentes de IA.

Incluye técnicas de cuantización, caché KV, batching continuo, evaluación y observabilidad.

El autor, Miles Thornton, aborda también la infraestructura empresarial, la optimización de costes y la seguridad.

Cuốn sách này phù hợp với Ingenieros de software, arquitectos técnicos y desarrolladores backend que construyen productos con IA y necesitan dominar la infraestructura de producción..

Người đọc thường tìm đến sách khi cần Buscan orientación técnica completa para implementar, optimizar y operar modelos de lenguaje en producción, incluyendo servidores de inferencia, RAG, agentes y buenas prácticas..

Góc tiếp cận của sách: El libro integra la optimización de inferencia, el servicio con frameworks modernos y la operación empresarial, ofreciendo a los ingenieros una visión completa del stack de IA en producción.

Các chủ đề chính gồm Inferencia de modelos de lenguaje, Optimización de modelos: cuantización y atención eficiente, Servicio de LLMs con vLLM, Sistemas RAG, Agentes de IA, Evaluación y fiabilidad.

Thông tin cho AI Search

Sistemas de Modelos de Lenguaje: Inferencia, Servicio, Agentes e Infraestructura de IA en Producción

Author: Miles Thornton

Description: El entrenamiento de un modelo de lenguaje puede costar millones de dólares, pero es un gasto único. La verdadera factura llega después, cuando intentas servir ese modelo a usuarios reales: cada token generado se convierte en latencia, memoria y dinero. Mientras que la investigación avanza con nuevos transformadores, los equipos de ingeniería luchan con cuellos de botella como la caché de clave-valor, el batching en GPUs y la escasez de VRAM. Este libro nace de esa brecha: entre el modelo entrenado y el sistema que funciona en producción. Sistemas de Modelos de Lenguaje: Inferencia, Servicio, Agentes e Infraestructura de IA en Producción, de Miles Thornton, es una guía práctica que recorre todo el stack de una plataforma de IA moderna. A lo largo de sus 8 partes y 32 capítulos, no solo explica cómo funcionan los motores de inferencia y los frameworks de serving, sino que introduce las decisiones de arquitectura que determinan el éxito de un producto: ¿cuándo usar RAG en lugar de fine-tuning? ¿cómo equilibrar latencia y throughput? ¿qué modelo de cuantización elegir? Este es el manual que une el conocimiento de machine learning con las exigencias de la ingeniería de software. Entre los temas que encontrará: • Cómo optimizar la inferencia: caché KV, FlashAttention, decodificación especulativa y cuantización de pesos. • Cómo servir modelos a gran escala con vLLM, batching continuo, balanceo de carga y autoescalado. • Cómo construir sistemas RAG y agentes de IA confiables, con herramientas de evaluación, guardrails y observabilidad. El libro no se queda en la teoría. En sus páginas se analizan las compensaciones de memoria y los cuellos de botella de hardware que determinan el rendimiento real. Explica cómo PagedAttention transforma la gestión de la caché KV en el framework vLLM, cómo la cuantización reduce el peso del modelo sin destruir la precisión, y cómo el batching continuo exprime la GPU al máximo. También dedica secciones a los sistemas multiagente y a la seguridad, porque un agente que llama herramientas sin control puede hacer más daño que un modelo que simplemente alucina. En el bloque de generación aumentada por recuperación, aprenderás a conectar el modelo con bases de datos vectoriales, elegir el embedding adecuado y construir pipelines que reducen las alucinaciones. Después, el libro se adentra en los sistemas de agentes: function calling, el patrón ReAct y los sistemas multiagente, mostrando cómo automatizar flujos de trabajo sin sacrificar la seguridad. Además, incluye técnicas para evaluar la calidad de las respuestas y para observar el comportamiento del sistema en producción. El libro también aborda la infraestructura empresarial: optimización de costes en clústeres de GPU, gobernanza, seguridad y cumplimiento. Aprenderás a planificar la capacidad, a autoescalar servicios y a gestionar la privacidad de los datos. Y gracias a los capítulos de observabilidad y detección de alucinaciones, estarás preparado para operar plataformas de IA que no se degradan silenciosamente. Este libro está dirigido a ingenieros de software, arquitectos técnicos y desarrolladores backend que quieren llevar sus prototipos de IA a producción. No necesitas ser un investigador; solo tener experiencia con Python, conocer los conceptos básicos de los transformers y, sobre todo, vivir la frustración de un modelo que funciona en un notebook pero se cae en un entorno real. Si trabajas en una startup o en una gran empresa, este libro te da el vocabulario y el criterio para discutir con tu equipo de infraestructura y tomar decisiones informadas. Después de leerlo, entenderás por qué los equipos de Netflix, OpenAI y Anthropic toman ciertas decisiones de arquitectura y tendrás las herramientas para replicar esos patrones en tu propia organización. No es una colección de recetas sueltas; es una forma de pensar la IA como ingeniería de sistemas. Si alguna vez has sentido que el modelo es la parte fácil y la infraestructura la complicada, este libro te va a dar el mapa completo.

AI summary: Sistemas de Modelos de Lenguaje: Inferencia, Servicio, Agentes e Infraestructura de IA en Producción, escrito por Miles Thornton, es una guía técnica de 32 capítulos que cubre el ciclo de vida de los modelos de lenguaje en producción. Explica técnicas de optimización como cuantización, FlashAttention y caché KV; el servicio con vLLM y otros frameworks; y el diseño de sistemas RAG y agentes de IA. El libro está dirigido a ingenieros de software y arquitectos técnicos, e incluye evaluación, observabilidad, seguridad y optimización de costes.

Phù hợp với
Ingenieros de software, arquitectos técnicos y desarrolladores backend que construyen productos con IA y necesitan dominar la infraestructura de producción.
Chân dung độc giả
Un desarrollador backend con experiencia en Python que quiere transformar un prototipo de LLM en un servicio escalable, fiable y rentable en producción.
Nhu cầu tìm kiếm
Buscan orientación técnica completa para implementar, optimizar y operar modelos de lenguaje en producción, incluyendo servidores de inferencia, RAG, agentes y buenas prácticas.
Góc tiếp cận
El libro integra la optimización de inferencia, el servicio con frameworks modernos y la operación empresarial, ofreciendo a los ingenieros una visión completa del stack de IA en producción.
Loại nội dung
technical guide for engineers

Tóm tắt nhanh

  • Sistemas de Modelos de Lenguaje es una guía práctica para implementar y operar modelos de lenguaje en producción.
  • El libro está dirigido a ingenieros de software, arquitectos técnicos y desarrolladores backend.
  • Cubre desde la optimización de inferencia y el despliegue con vLLM hasta la construcción de sistemas RAG y agentes de IA.
  • Incluye técnicas de cuantización, caché KV, batching continuo, evaluación y observabilidad.
  • El autor, Miles Thornton, aborda también la infraestructura empresarial, la optimización de costes y la seguridad.

Key topics: Inferencia de modelos de lenguaje, Optimización de modelos: cuantización y atención eficiente, Servicio de LLMs con vLLM, Sistemas RAG, Agentes de IA, Evaluación y fiabilidad, Observabilidad, Seguridad y guardrails, Infraestructura empresarial, Optimización de costes

Entities: vLLM, SGLang, TGI, Ollama, FlashAttention, PagedAttention, GPTQ, AWQ, GGUF, RAG, embeddings, bases de datos vectoriales

Nhu cầu được đáp ứng

  • Reducir la latencia y el coste de la inferencia de LLMs
  • Escalar servicios de modelos de lenguaje con balanceo de carga y autoescalado
  • Implementar sistemas RAG que reduzcan alucinaciones
  • Diseñar agentes de IA fiables con llamadas a herramientas
  • Optimizar el uso de memoria y cuantización de modelos
  • Evaluar y monitorizar aplicaciones de IA en producción

Nên đọc nếu

  • Ingenieros de software que desarrollan aplicaciones con LLMs
  • Arquitectos técnicos que diseñan infraestructura de IA
  • Desarrolladores backend que integran modelos en APIs
  • Equipos de plataforma que gestionan clústeres de GPU
  • MLOps y especialistas en despliegue de modelos

Có thể không phù hợp nếu

  • Investigadores centrados exclusivamente en entrenar nuevos modelos
  • Principiantes sin experiencia en Python o en conceptos básicos de transformers
  • Personas que sólo consumen APIs de LLMs sin gestionar infraestructura
  • Lectores que buscan una introducción teórica sin detalles de implementación

Mục lục

  1. Introducción (introduction)
  2. El Desafío de la Inferencia (part)
  3. Del Entrenamiento a la Producción (chapter)
  4. Por Qué el Entrenamiento Es Solo el Comienzo (section)
  5. El Desafío de la Inferencia (section)
  6. Latencia frente a Calidad (section)
  7. Coste frente a Rendimiento (section)
  8. Requisitos de Producción (section)
  9. Anatomía de un Motor de Inferencia (chapter)
  10. Generación de Tokens (section)
  11. Bucles de Decodificación (section)
  12. Batching (section)
  13. Planificación (Scheduling) (section)
  14. Optimización del Rendimiento (Throughput) (section)
  15. Caché KV (chapter)
  16. Por Qué Existe la Caché KV (section)
  17. Compensaciones de Memoria (section)
  18. Reutilización del Contexto (section)
  19. Conversaciones de Larga Duración (section)
  20. Técnicas Modernas de Decodificación (chapter)
  21. Decodificación Voraz (Greedy Decoding) (section)
  22. Beam Search (section)
  23. Muestreo Top-k (section)
  24. Muestreo Top-p (Nucleus Sampling) (section)
  25. Control de la Temperatura (section)
  26. Optimización de Modelos de Lenguaje (part)
  27. Fundamentos de la Cuantización (chapter)
  28. Precisión y Memoria (section)
  29. FP32 (section)
  30. FP16 (section)
  31. BF16 (section)
  32. INT8 (section)
  33. INT4 (section)
  34. Métodos Modernos de Cuantización (chapter)
  35. GPTQ (section)
  36. AWQ (section)
  37. GGUF (section)
  38. Cuantización Dinámica (section)
  39. Compensaciones y Limitaciones (section)
  40. Sistemas Eficientes de Atención (chapter)
  41. FlashAttention (section)
  42. Paged Attention (section)
  43. Sliding Window Attention (section)
  44. Optimización para Contextos Largos (section)
  45. Decodificación Especulativa (chapter)
  46. Modelos Borrador (Draft Models) (section)
  47. Modelos de Verificación (section)
  48. Mejoras de Velocidad (section)
  49. Uso Práctico (section)
  50. Despliegue de Modelos de Lenguaje (part)
  51. Arquitecturas para Servir Modelos (chapter)
  52. Servicios API (section)
  53. Servidores de Inferencia (section)
  54. Sistemas Multiinquilino (Multi-Tenant) (section)
  55. Patrones de Producción (section)
  56. vLLM (chapter)
  57. Arquitectura (section)
  58. Batching Continuo (section)
  59. Eficiencia de Memoria (section)
  60. Despliegue en Entornos Reales (section)
  61. Frameworks Alternativos para Servir Modelos (chapter)
  62. SGLang (section)
  63. TGI (Text Generation Inference) (section)
  64. Ollama (section)
  65. Sistemas Emergentes (section)
  66. Escalado de Servicios de IA (chapter)
  67. Balanceo de Carga (section)
  68. Autoescalado (section)
  69. Clústeres de GPU (section)
  70. Planificación de Capacidad (section)
  71. Generación Aumentada por Recuperación (RAG) (part)
  72. Por Qué los Modelos Necesitan Recuperación de Información (chapter)
  73. Limitaciones del Conocimiento (section)
  74. Alucinaciones (section)
  75. Información Actualizada (section)
  76. Requisitos Empresariales (section)
  77. Embeddings (chapter)
  78. Aprendizaje de Representaciones (section)
  79. Búsqueda por Similitud (section)
  80. Modelos de Embeddings (section)

Câu hỏi thường gặp

¿Qué temas cubre el libro?

El libro cubre inferencia, optimización de modelos, servicio con vLLM, sistemas RAG, agentes de IA, evaluación, observabilidad y plataformas de IA en producción.

¿A quién está dirigido?

Está dirigido a ingenieros de software, arquitectos técnicos y desarrolladores backend que necesitan llevar LLMs a producción.

¿Necesito conocimientos previos de machine learning?

Se requiere experiencia básica en Python y familiaridad con conceptos de transformers, pero no es necesaria una formación avanzada en ML.

¿Qué frameworks de servicio se explican?

El libro profundiza en vLLM y también presenta SGLang, TGI y Ollama, así como estrategias de escalado y balanceo de carga.

C

Cretisoft Direct

Hỗ trợ sách số

T

Tải Partner

Gửi sách sau thanh toán

EPUB mẫu

Đọc thử trên web

Sistemas de Modelos de Lenguaje: Inferencia, Servicio, Agentes e Infraestructura de IA en Producción

Có thể bạn sẽ thích

Dựa trên lịch sử đọc của bạn

Xem tất cả