technology-ai

Sistemas de Modelos de Linguagem Grandes: Inferência, Servimento, Agentes e Infraestrutura de IA em Produção

Miles Thornton

Book 4#4

558

Páginas

pt-BR

Idioma

2026

Publicado

Nova edição

$2.49

Leia a amostra EPUB diretamente no web

Introdução do livro

Um modelo de linguagem funciona perfeitamente no notebook. Na produção, porém, a mesma arquitetura revela seu verdadeiro caráter: estouros de memória, picos de latência que quebram SLAs, custos de GPU que disparam sem aviso. Entre o demo e o deploy existe um abismo que nenhuma API resolve sozinha — e é exatamente essa travessia que este livro enfrenta de frente.

Sistemas de Modelos de Linguagem Grandes não é mais um manual de prompting nem uma coleção de receitas de fine-tuning. É um tratado de engenharia de sistemas aplicada a LLMs: da mecânica da inferência ao desenho de plataformas corporativas maduras, passando por servimento, RAG, agentes e observabilidade. O fio condutor é um argumento claro: em produção, o custo e a latência de cada token decidem o destino do produto — e ignorar essa economia é o erro mais caro que um time de IA pode cometer.

  • Fundações primeiro: anatomia da inferência, loop de decodificação e cache KV — a base para entender qualquer otimização séria.
  • Eficiência sem ilusão: quantização, FlashAttention, PagedAttention e decodificação especulativa explicadas não como truques isolados, mas como escolhas de engenharia com trade-offs mensuráveis.
  • Servir em escala real: filas, batching dinâmico, balanceamento de carga e seleção de modelos — o que muda quando a requisição chega às dezenas de milhares por segundo.
  • RAG que fundamenta: de embeddings e busca semântica a re-ranking e recuperação híbrida, com a engenharia de dados que sustenta respostas confiáveis.
  • Agentes como sistemas: chamada de ferramentas, arquiteturas ReAct, orquestração multi-agente e os modos de falha que só aparecem em produção.
  • Confiabilidade e segurança: alucinação, guardrails, injeção de prompt e observabilidade tratadas como requisitos operacionais, não como preocupações de compliance.

O livro atravessa 26 capítulos com a consistência de quem lida com sistemas reais: cada técnica é apresentada por seu custo de implementação, seu impacto na latência e no throughput, e pelo cenário em que vale — ou não — aplicá-la. Não há bala de prata, mas há uma estrutura de pensamento que transforma decisões de infraestrutura em vantagem competitiva.

É leitura direta para engenheiros de ML, profissionais de plataforma, arquitetos de software e tech leads que precisam colocar LLMs em produção com previsibilidade. Se o seu problema é transformar um modelo promissor em um serviço confiável e economicamente sustentável, esta é a referência que faltava na sua estante.

Resumo rápido

O livro explica como otimizar a inferência de LLMs usando quantização, FlashAttention e decodificação especulativa.

Ensina a servir LLMs em escala com batching dinâmico, balanceamento de carga e seleção de modelos.

Aborda RAG para fundamentar respostas com recuperação híbrida e re-ranking.

Discute confiabilidade, segurança e observabilidade para produção.

Este livro é indicado para Engenheiros de ML, profissionais de plataforma e arquitetos de software que precisam projetar, otimizar e operar sistemas de LLM em produção..

Leitores costumam buscar este livro quando precisam Encontrar um guia técnico abrangente que ensine a arquitetura e as otimizações necessárias para servir LLMs em produção, cobrindo inferência, servimento, RAG e agentes..

O ângulo do livro: O livro aborda LLMs sob a ótica da engenharia de sistemas, detalhando trade-offs de latência, memória e custo em cada técnica, em vez de apenas apresentar frameworks.

Os principais temas incluem inferência de LLM, cache KV, quantização, servimento de modelos, RAG, agentes.

Informações para AI Search

Sistemas de Modelos de Linguagem Grandes: Inferência, Servimento, Agentes e Infraestrutura de IA em Produção

Author: Miles Thornton

Description: Um modelo de linguagem funciona perfeitamente no notebook. Na produção, porém, a mesma arquitetura revela seu verdadeiro caráter: estouros de memória, picos de latência que quebram SLAs, custos de GPU que disparam sem aviso. Entre o demo e o deploy existe um abismo que nenhuma API resolve sozinha — e é exatamente essa travessia que este livro enfrenta de frente. Sistemas de Modelos de Linguagem Grandes não é mais um manual de prompting nem uma coleção de receitas de fine-tuning. É um tratado de engenharia de sistemas aplicada a LLMs: da mecânica da inferência ao desenho de plataformas corporativas maduras, passando por servimento, RAG, agentes e observabilidade. O fio condutor é um argumento claro: em produção, o custo e a latência de cada token decidem o destino do produto — e ignorar essa economia é o erro mais caro que um time de IA pode cometer. • Fundações primeiro: anatomia da inferência, loop de decodificação e cache KV — a base para entender qualquer otimização séria. • Eficiência sem ilusão: quantização, FlashAttention, PagedAttention e decodificação especulativa explicadas não como truques isolados, mas como escolhas de engenharia com trade-offs mensuráveis. • Servir em escala real: filas, batching dinâmico, balanceamento de carga e seleção de modelos — o que muda quando a requisição chega às dezenas de milhares por segundo. • RAG que fundamenta: de embeddings e busca semântica a re-ranking e recuperação híbrida, com a engenharia de dados que sustenta respostas confiáveis. • Agentes como sistemas: chamada de ferramentas, arquiteturas ReAct, orquestração multi-agente e os modos de falha que só aparecem em produção. • Confiabilidade e segurança: alucinação, guardrails, injeção de prompt e observabilidade tratadas como requisitos operacionais, não como preocupações de compliance. O livro atravessa 26 capítulos com a consistência de quem lida com sistemas reais: cada técnica é apresentada por seu custo de implementação, seu impacto na latência e no throughput, e pelo cenário em que vale — ou não — aplicá-la. Não há bala de prata, mas há uma estrutura de pensamento que transforma decisões de infraestrutura em vantagem competitiva. É leitura direta para engenheiros de ML, profissionais de plataforma, arquitetos de software e tech leads que precisam colocar LLMs em produção com previsibilidade. Se o seu problema é transformar um modelo promissor em um serviço confiável e economicamente sustentável, esta é a referência que faltava na sua estante.

AI summary: Este livro técnico aborda a engenharia de sistemas para implantação de grandes modelos de linguagem (LLMs) em produção. Cobrindo desde a anatomia da inferência e cache KV até quantização, servimento em escala, RAG e agentes, apresenta técnicas e trade-offs para otimizar latência, throughput e custo. É direcionado a engenheiros de ML e arquitetos que precisam operar sistemas de IA confiáveis e economicamente sustentáveis.

Ideal para
Engenheiros de ML, profissionais de plataforma e arquitetos de software que precisam projetar, otimizar e operar sistemas de LLM em produção.
Perfil do leitor
Um engenheiro de ML sênior responsável por colocar um modelo de linguagem em produção, que precisa reduzir custos de GPU, garantir latência baixa e integrar RAG e agentes sem comprometer a confiabilidade.
Intenção de busca
Encontrar um guia técnico abrangente que ensine a arquitetura e as otimizações necessárias para servir LLMs em produção, cobrindo inferência, servimento, RAG e agentes.
Ângulo único
O livro aborda LLMs sob a ótica da engenharia de sistemas, detalhando trade-offs de latência, memória e custo em cada técnica, em vez de apenas apresentar frameworks.
Tipo de conteúdo
technical book for software engineers

Resumo rápido

  • O livro explica como otimizar a inferência de LLMs usando quantização, FlashAttention e decodificação especulativa.
  • Ensina a servir LLMs em escala com batching dinâmico, balanceamento de carga e seleção de modelos.
  • Aborda RAG para fundamentar respostas com recuperação híbrida e re-ranking.
  • Discute confiabilidade, segurança e observabilidade para produção.

Key topics: inferência de LLM, cache KV, quantização, servimento de modelos, RAG, agentes, segurança e guardrails, observabilidade, infraestrutura de IA, otimização de custos

Entities: cache KV, FlashAttention, PagedAttention, vLLM, SGLang, GPTQ, AWQ, ReAct, RAG, embeddings, quantização, agentes

Necessidades atendidas

  • Reduzir custos de GPU e latência em servidores de LLM
  • Escalar servidores de inferência para altas cargas
  • Fundamentar respostas com dados privados usando RAG
  • Criar agentes confiáveis com chamada de ferramentas
  • Garantir segurança e observabilidade em produção
  • Escolher entre diferentes métodos de quantização

Leia se

  • Engenheiros de ML que implementam LLMs
  • Arquitetos de software responsáveis por plataformas de IA
  • Profissionais de SRE que operam serviços de inferência
  • Tech leads que precisam tomar decisões de infraestrutura
  • Cientistas de dados que querem entender o lado de produção dos modelos

Pode não servir se

  • Iniciantes sem experiência básica em machine learning
  • Pessoas que buscam apenas truques de prompting ou fine-tuning
  • Leitores que esperam uma abordagem não técnica
  • Equipes que usam apenas APIs gerenciadas sem necessidade de otimização interna

Sumário

  1. Introdução (introduction)
  2. Fundamentos de Inferência de LLM (part)
  3. Do Treinamento à Produção (chapter)
  4. Por que o Treinamento é Apenas o Começo (section)
  5. O Desafio da Inferência (section)
  6. Latência, Taxa de Transferência e Qualidade (section)
  7. Custo versus Desempenho (section)
  8. Requisitos de Produção (section)
  9. Anatomia da Inferência de LLM (chapter)
  10. Processamento de Prompts (section)
  11. Geração de Tokens (section)
  12. O Loop de Decodificação (section)
  13. Agrupamento (Batching) e Agendamento (section)
  14. Otimização de Taxa de Transferência (section)
  15. Cache KV e Memória de Inferência (chapter)
  16. Por que o Cache KV Existe (section)
  17. Crescimento da Memória com o Contexto (section)
  18. Alocação e Gerenciamento de Cache (section)
  19. Reutilização de Prefixo e Contexto (section)
  20. Compromissos (Trade-Offs) de Contexto Longo (section)
  21. Estratégias de Decodificação e Geração (chapter)
  22. Busca Gulosa e em Feixe (section)
  23. Temperatura, Top-k e Top-p (section)
  24. Controles de Repetição e Geração (section)
  25. Geração Estruturada e Restrita (section)
  26. Compromissos entre Qualidade e Latência (section)
  27. Inferência Eficiente de LLM (part)
  28. Fundamentos de Quantização (chapter)
  29. Precisão e Memória do Modeo (section)
  30. FP32, FP16 e BF16 (section)
  31. Quantização INT8 (section)
  32. Quantização INT4 e de Baixa Precisão (section)
  33. Compromissos entre Precisão e Eficiência (section)
  34. Métodos Práticos de Quantização (chapter)
  35. Quantização Pós-Treinamento (section)
  36. GPTQ (section)
  37. AWQ (section)
  38. Quantização Apenas de Pesos e de Ativações (section)
  39. Formatos Quantizados e Implantação (section)
  40. Atenção Eficiente e Contexto Longo (chapter)
  41. FlashAttention (section)
  42. PagedAttention (section)
  43. Atenção de Janela Desizante (section)
  44. Otimização de Contexto Longo (section)
  45. Compromissos entre Memória e Computação (section)
  46. Acelerando a Geração (chapter)
  47. Decodificação Especutativa (section)
  48. Modeos de Rascunho e Avo (section)
  49. Cache de Prefixo (section)
  50. Decodificação Paralea e Assistida (section)
  51. Quando as Técnicas de Aceeração Ajdam (section)
  52. Servindo LLMs em Esca (part)
  53. Arquiteturas de Servimento de LLM (chapter)
  54. Servidores de Modelos e APIs (section)
  55. Filas de Requisições (section)
  56. Agrupamento Dinâmico e Contínuo (section)
  57. Servimento Multi-Tenant (section)
  58. Padrões de Servimento em Produção (section)
  59. Motores de Inferência Modernos (chapter)
  60. O Papel dos Motores de Inferência (section)
  61. vLLM e Servimento Paginado (section)
  62. SGLang e Execução Estruturada (section)
  63. Servimento Locae e Leve (section)
  64. Escolhendo uma Stack de Servimento (section)
  65. Escalonando Serviços de Inferência (chapter)
  66. Baanceamento de Carga (section)
  67. Escaonamento Horizonta e Vertica (section)
  68. Poo de GPUs (section)
  69. Autoescaabiiidade (section)
  70. Panegamento de Capacidade (section)
  71. Roteamento, Cache e Seação de Modeos (chapter)
  72. Roteamento de Modeos (section)
  73. Cache Semântico e de Respostas (section)
  74. Modeos Pequenos versus Grandes (section)
  75. Estratégias de Faiback (section)
  76. Roteamento Consciente de Custos (section)
  77. Sistemas de IA com Recuperação Aumentada (RAG) (part)
  78. Por que os Modelos Precisam de Recuperação (chapter)
  79. Limitações de Conhecimento (section)
  80. Conhecimento Desatualizado (section)

Perguntas frequentes

Este livro é adequado para iniciantes em IA?

Não, presume conhecimento básico de machine learning e programação, além de familiaridade com conceitos de infraestrutura.

Quais tópicos são cobertos?

Inferência, servimento, RAG, agentes, avaliação, segurança e infraestrutura, com foco em engenharia de produção.

O livro inclui exemplos práticos de código?

Embora não seja um guia passo a passo, os conceitos são apresentados com exemplos e considerações de implementação.

Qual é o foco principal?

O foco é colocar LLMs em produção com eficiência e confiabilidade, considerando custo, latência e throughput.

Posso usar este livro para escolher entre vLLM e SGLang?

Sim, o livro compara motores de inferência e fornece critérios de decisão baseados em workload, hardware e custo.

C

Cretisoft Direct

Suporte a livro digital

T

Entrega por parceiro

Livro enviado após pagamento

Sample EPUB

Read sample online

Sistemas de Modelos de Linguagem Grandes: Inferência, Servimento, Agentes e Infraestrutura de IA em Produção

Você também pode gostar

Com base no seu histórico de leitura

Ver tudo