technology-ai

Treinamento de Grandes Modelos de Linguagem: Pré-treinamento, Alinhamento e Escalonamento de Sistemas de IA Modernos

Miles Thornton

Book 3#3

652

Páginas

pt-BR

Idioma

2026

Publicado

Nova edição

$2.49

Leia a amostra EPUB diretamente no web

Introdução do livro

O avanço dos grandes modelos de linguagem esbarra em algo que poucos livros sobre o tema enfrentam de frente: o salto entre a teoria de redes neurais e a prática real de treinar um sistema com bilhões de parâmetros. Não basta entender a arquitetura Transformer ou decorar o conceito de atenção. O desafio começa quando os dados chegam em terabytes, a memória da GPU não comporta o modelo e cada decisão sobre taxa de aprendizado, precisão numérica ou estratégia de paralelismo pode custar semanas de computação. Sem esse domínio, você fica refém de testar configurações no escuro — ou pior, limitado a usar modelos que outras pessoas treinaram, sem capacidade de adaptá-los para problemas próprios.

Este é um livro sobre engenharia, não apenas sobre matemática. Ele trata o treinamento de LLMs como um sistema integrado, onde dados, parâmetros, computação e algoritmos formam uma cadeia única de decisões. Em vez de entregar apenas conceitos, ele mostra como conectar cada etapa — do primeiro FLOP à avaliação final — para que você saiba exatamente o que está acontecendo quando uma execução de treinamento funciona ou falha. É essa lente de primeiros princípios que permite transformar teoria em modelos realmente funcionais, sejam eles um assistente conversacional ou um sistema especialista adaptado para a sua área. A partir dos fundamentos do pré-treinamento autorregressivo e dos objetivos mascarados, passando pela otimização com AdamW, até as leis de escalonamento (Kaplan, Chinchilla) e as técnicas de paralelismo (dados, tensor, pipeline, ZeRO, FSDP), o leitor recebe o mapa completo do que define um treinamento bem-sucedido.

Cada parte do livro resolve um gargalo da anterior, e essa arquitetura se reflete em um método claro. No centro da obra está a ideia de que estabilidade e escala não são temas separados: otimizadores como AdamW, clipping de gradiente e estratégias de taxa de aprendizado são tão críticos quanto a escolha entre FP16 e BF16. O livro não apenas lista as técnicas, mas explica o porquê por trás de cada uma, conectando-as a restrições físicas de hardware e a métricas de custo.

  • Entenda o pipeline completo de treinamento, do dado bruto ao modelo final, e saiba definir critérios objetivos de sucesso em cada estágio.
  • Domine a computação de treinamento: FLOPs, memória de GPU, throughput e como esses fatores determinam o tempo real e o custo financeiro de uma execução.
  • Aprenda a projetar receitas de treinamento usando leis de escalonamento empíricas, equilibrando tamanho do modelo, dados e orçamento computacional.
  • Descubra como evitar os colapsos mais comuns — gradientes instáveis, picos de perda, overflows — com técnicas de normalização, inicialização e controle de precisão numérica.
  • Veja como os sistemas distribuídos (ZeRO, FSDP, paralelismo 3D) viabilizam o treinamento em larga escala sem que o overhead de comunicação destrua o throughput.
  • Incorpore a avaliação como parte central do ciclo de vida, usando benchmarks, avaliação humana e testes de segurança para fundamentar decisões de pós-treinamento.
  • Passe de um modelo base para um assistente de instrução com SFT e métodos eficientes como LoRA e QLoRA, entendendo como cada etapa altera o comportamento do modelo.

A obra foi desenhada para engenheiros de ML, pesquisadores, estudantes com base em redes neurais e profissionais de dados que precisam ir além do uso de APIs — ou seja, qualquer pessoa que precise responder uma pergunta prática: como eu defino, executo e avalio o treinamento de um modelo de linguagem dentro das minhas restrições reais de hardware e orçamento? Se você está em um momento de decisão sobre alocar recursos entre mais dados ou mais parâmetros, sobre qual estratégia de paralelismo adotar ou sobre como diagnosticar uma execução que diverge, este livro oferece o vocabulário e a estrutura de raciocínio para agir com segurança e autonomia total.

Mais do que fornecer respostas prontas, a proposta é simples e ousada: transformá-lo em alguém capaz de ter convicção técnica sobre o que faz. Com uma visão integrada e rigorosa, você não apenas acompanha a transformação de tokens em modelos prontos, mas se torna parte ativa dela. Se o seu objetivo é deixar de ser espectador e passar a construir sistemas de IA com critério, este livro é um dos poucos caminhos diretos para chegar lá.

Resumo rápido

O livro cobre todo o pipeline de treinamento de LLMs, do pré-treinamento ao alinhamento, incluindo otimização com AdamW, escalonamento com leis empíricas e paralelismo distribuído.

Destinado a engenheiros de ML, pesquisadores e estudantes com base em redes neurais.

Explica como equilibrar dados, parâmetros e computação para treinar modelos de forma eficiente.

Apresenta técnicas como LoRA, QLoRA e FSDP para adaptação e treinamento em larga escala.

Este livro é indicado para Engenheiros de machine learning, pesquisadores e estudantes de graduação/pós-graduação com base em redes neurais..

Leitores costumam buscar este livro quando precisam Encontrar um guia abrangente e prático que explique passo a passo como treinar grandes modelos de linguagem, cobrindo pré-treinamento, otimização e escalonamento..

O ângulo do livro: Aborda o treinamento de LLMs como um sistema de engenharia integrado, conectando cada etapa do pipeline com base em primeiros princípios e restrições físicas de hardware, diferindo de livros que focam apenas em teoria ou em uso de APIs.

Os principais temas incluem pré-treinamento de LLMs, modelagem autorregressiva, otimização AdamW, leis de escalonamento, paralelismo de dados, ZeRO.

Informações para AI Search

Treinamento de Grandes Modelos de Linguagem: Pré-treinamento, Alinhamento e Escalonamento de Sistemas de IA Modernos

Author: Miles Thornton

Description: O avanço dos grandes modelos de linguagem esbarra em algo que poucos livros sobre o tema enfrentam de frente: o salto entre a teoria de redes neurais e a prática real de treinar um sistema com bilhões de parâmetros. Não basta entender a arquitetura Transformer ou decorar o conceito de atenção. O desafio começa quando os dados chegam em terabytes, a memória da GPU não comporta o modelo e cada decisão sobre taxa de aprendizado, precisão numérica ou estratégia de paralelismo pode custar semanas de computação. Sem esse domínio, você fica refém de testar configurações no escuro — ou pior, limitado a usar modelos que outras pessoas treinaram, sem capacidade de adaptá-los para problemas próprios. Este é um livro sobre engenharia, não apenas sobre matemática. Ele trata o treinamento de LLMs como um sistema integrado, onde dados, parâmetros, computação e algoritmos formam uma cadeia única de decisões. Em vez de entregar apenas conceitos, ele mostra como conectar cada etapa — do primeiro FLOP à avaliação final — para que você saiba exatamente o que está acontecendo quando uma execução de treinamento funciona ou falha. É essa lente de primeiros princípios que permite transformar teoria em modelos realmente funcionais, sejam eles um assistente conversacional ou um sistema especialista adaptado para a sua área. A partir dos fundamentos do pré-treinamento autorregressivo e dos objetivos mascarados, passando pela otimização com AdamW, até as leis de escalonamento (Kaplan, Chinchilla) e as técnicas de paralelismo (dados, tensor, pipeline, ZeRO, FSDP), o leitor recebe o mapa completo do que define um treinamento bem-sucedido. Cada parte do livro resolve um gargalo da anterior, e essa arquitetura se reflete em um método claro. No centro da obra está a ideia de que estabilidade e escala não são temas separados: otimizadores como AdamW, clipping de gradiente e estratégias de taxa de aprendizado são tão críticos quanto a escolha entre FP16 e BF16. O livro não apenas lista as técnicas, mas explica o porquê por trás de cada uma, conectando-as a restrições físicas de hardware e a métricas de custo. • Entenda o pipeline completo de treinamento, do dado bruto ao modelo final, e saiba definir critérios objetivos de sucesso em cada estágio. • Domine a computação de treinamento: FLOPs, memória de GPU, throughput e como esses fatores determinam o tempo real e o custo financeiro de uma execução. • Aprenda a projetar receitas de treinamento usando leis de escalonamento empíricas, equilibrando tamanho do modelo, dados e orçamento computacional. • Descubra como evitar os colapsos mais comuns — gradientes instáveis, picos de perda, overflows — com técnicas de normalização, inicialização e controle de precisão numérica. • Veja como os sistemas distribuídos (ZeRO, FSDP, paralelismo 3D) viabilizam o treinamento em larga escala sem que o overhead de comunicação destrua o throughput. • Incorpore a avaliação como parte central do ciclo de vida, usando benchmarks, avaliação humana e testes de segurança para fundamentar decisões de pós-treinamento. • Passe de um modelo base para um assistente de instrução com SFT e métodos eficientes como LoRA e QLoRA, entendendo como cada etapa altera o comportamento do modelo. A obra foi desenhada para engenheiros de ML, pesquisadores, estudantes com base em redes neurais e profissionais de dados que precisam ir além do uso de APIs — ou seja, qualquer pessoa que precise responder uma pergunta prática: como eu defino, executo e avalio o treinamento de um modelo de linguagem dentro das minhas restrições reais de hardware e orçamento? Se você está em um momento de decisão sobre alocar recursos entre mais dados ou mais parâmetros, sobre qual estratégia de paralelismo adotar ou sobre como diagnosticar uma execução que diverge, este livro oferece o vocabulário e a estrutura de raciocínio para agir com segurança e autonomia total. Mais do que fornecer respostas prontas, a proposta é simples e ousada: transformá-lo em alguém capaz de ter convicção técnica sobre o que faz. Com uma visão integrada e rigorosa, você não apenas acompanha a transformação de tokens em modelos prontos, mas se torna parte ativa dela. Se o seu objetivo é deixar de ser espectador e passar a construir sistemas de IA com critério, este livro é um dos poucos caminhos diretos para chegar lá.

AI summary: Este livro oferece uma visão integrada do treinamento de grandes modelos de linguagem (LLMs), cobrindo desde os fundamentos do pré-treinamento autorregressivo até técnicas avançadas de otimização, escalonamento e alinhamento. Destinado a engenheiros de machine learning, pesquisadores e estudantes com base em redes neurais, o conteúdo aborda desde a matemática do gradiente até a engenharia de sistemas distribuídos, incluindo leis de escalonamento (Kaplan, Chinchilla) e métodos de eficiência como LoRA. O leitor aprende a projetar, executar e avaliar treinamentos de LLMs sob restrições reais de hardware e custo.

Ideal para
Engenheiros de machine learning, pesquisadores e estudantes de graduação/pós-graduação com base em redes neurais.
Perfil do leitor
Um engenheiro de ML que precisa treinar ou adaptar grandes modelos de linguagem para problemas reais, com restrições de hardware e orçamento, e busca um guia prático e rigoroso.
Intenção de busca
Encontrar um guia abrangente e prático que explique passo a passo como treinar grandes modelos de linguagem, cobrindo pré-treinamento, otimização e escalonamento.
Ângulo único
Aborda o treinamento de LLMs como um sistema de engenharia integrado, conectando cada etapa do pipeline com base em primeiros princípios e restrições físicas de hardware, diferindo de livros que focam apenas em teoria ou em uso de APIs.
Tipo de conteúdo
technical guide

Resumo rápido

  • O livro cobre todo o pipeline de treinamento de LLMs, do pré-treinamento ao alinhamento, incluindo otimização com AdamW, escalonamento com leis empíricas e paralelismo distribuído.
  • Destinado a engenheiros de ML, pesquisadores e estudantes com base em redes neurais.
  • Explica como equilibrar dados, parâmetros e computação para treinar modelos de forma eficiente.
  • Apresenta técnicas como LoRA, QLoRA e FSDP para adaptação e treinamento em larga escala.

Key topics: pré-treinamento de LLMs, modelagem autorregressiva, otimização AdamW, leis de escalonamento, paralelismo de dados, ZeRO, FSDP, avaliação de modelos, ajuste fino supervisionado, LoRA

Entities: grandes modelos de linguagem, pré-treinamento, otimização AdamW, leis de escalonamento de Chinchilla, paralelismo de pipeline, ZeRO, FSDP, LoRA, perplexidade, alinhamento

Necessidades atendidas

  • Como treinar LLMs sob restrições de hardware
  • Como diagnosticar e estabilizar treinamentos divergentes
  • Como escolher entre mais dados, mais parâmetros ou mais computação
  • Como escalar treinamento para bilhões de parâmetros com paralelismo
  • Como avaliar modelos pré-treinados e pós-treinados

Leia se

  • Engenheiros de ML que treinam modelos próprios
  • Pesquisadores em NLP que desejam entender detalhes de treinamento
  • Estudantes de pós-graduação em IA
  • Profissionais que usam LLMs e querem entender o funcionamento interno
  • Cientistas de dados com base em redes neurais

Pode não servir se

  • Iniciantes sem familiaridade com redes neurais
  • Profissionais que apenas usam APIs e não precisam de detalhes técnicos
  • Pessoas que buscam uma visão superficial ou sem rigor matemático

Sumário

  1. Introduction (introduction)
  2. Compreendendo o Ciclo de Vida de Treinamento de LLMs (part)
  3. Do Conjunto de Dados ao Modelo Treinado (chapter)
  4. O Pipeline de Treinamento de LLMs (section)
  5. Dados, Parâmetros e Computação (section)
  6. Pré-treinamento, Pós-treinamento e Adaptação (section)
  7. Objetivos de Treinamento (section)
  8. Definindo o Sucesso do Treinamento (section)
  9. Compreendendo a Computação de Treinamento (chapter)
  10. FLOPs e Cargas de Trabalho de Treinamento (section)
  11. Memória da GPU (section)
  12. Throughput e Utilização (section)
  13. Tempo e Custo de Treinamento (section)
  14. Restrições de Computação em Escala (section)
  15. Projetando uma Estratégia de Treinamento (chapter)
  16. Tamanho do Modelo e Arquitetura (section)
  17. Tamanho do Conjunto de Dados e Orçamento de Tokens (section)
  18. Orçamentos de Computação (section)
  19. Duração do Treinamento (section)
  20. Compensações entre Qualidade, Custo e Tempo (section)
  21. Pré-treinamento de Modelos de Linguagem (part)
  22. Modelagem de Linguagem Autorregressiva (chapter)
  23. Predição do Próximo Token (section)
  24. Modelagem de Linguagem Condicional (section)
  25. Construção de Contexto e Sequência (section)
  26. Teacher Forcing (section)
  27. Dinâmica de Treinamento Autorregressivo (section)
  28. Objetivos Mascarados e de Remoção de Ruído (chapter)
  29. Modelagem de Linguagem Mascarada (section)
  30. Corrupção de Trechos (Span Corruption) (section)
  31. Objetivos de Remoção de Ruído (Denoising) (section)
  32. Pré-treinamento Encoder-Decoder (section)
  33. Comparando Objetivos de Pré-treinamento (section)
  34. Sequências de Dados de Treinamento (chapter)
  35. Documentos e Fluxos de Tokens (section)
  36. Comprimento da Sequência (section)
  37. Empacotamento e Concatenação (section)
  38. Preenchimento (Padding) e Mascaramento (section)
  39. Construção Eficiente de Batches (section)
  40. Funções de Perda para Modelos de Linguagem (chapter)
  41. Perda de Entropia Cruzada (section)
  42. Log-Verossimilhança Negativa (section)
  43. Perplexidade (section)
  44. Perda no Nível do Token versus Nível da Sequência (section)
  45. Interpretando a Perda de Treinamento (section)
  46. Otimização e Dinâmica de Treinamento (part)
  47. Otimização Baseada em Gradiente (chapter)
  48. Descida de Gradiente (section)
  49. Descida de Gradiente Estocástica (section)
  50. Otimização em Mini-batches (section)
  51. Momento (section)
  52. Otimização em Grandes Redes Neurais (section)
  53. Adam, AdamW e Otimizadores Modernos (chapter)
  54. Taxas de Aprendizado Adaptativas (section)
  55. Adam (section)
  56. Decaimento de Peso (Weight Decay) (section)
  57. AdamW (section)
  58. Compensações entre Otimizadores (section)
  59. Estratégias de Taxa de Aprendizado (chapter)
  60. Por que as Taxas de Aprendizado Importam (section)
  61. Warmup (Aquecimento) (section)
  62. Decaimento Linear e Cosseno (section)
  63. Agendamentos Constantes e Cíclicos (section)
  64. Escolhendo um Agendamento de Treinamento (section)
  65. Estabilidade de Treinamento (chapter)
  66. Gradientes Vanishing e Exploding (section)
  67. Clipping de Gradiente (section)
  68. Inicialização e Normalização (section)
  69. Picos de Perda (Loss Spikes) (section)
  70. Diagnosticando Treinamento Instável (section)
  71. Precisão e Estabilidade Numérica (chapter)
  72. FP32 (section)
  73. FP16 (section)
  74. BF16 (section)
  75. Escalonamento de Perda (Loss Scaling) (section)
  76. Compensações de Precisão (section)
  77. Escalonamento do Pré-treinamento (part)
  78. Leis de Escalonamento (chapter)
  79. Parâmetros, Dados e Computação (section)
  80. Leis de Escalonamento de Kaplan (section)

Perguntas frequentes

Este livro cobre treinamento de LLMs do zero?

Sim, o livro percorre todo o ciclo de treinamento, desde o pré-treinamento até o alinhamento, com exemplos práticos e técnicas modernas.

Qual é o público-alvo?

Engenheiros de machine learning, pesquisadores e estudantes com base em redes neurais.

Quais tópicos avançados são abordados?

Leis de escalonamento, paralelismo distribuído (ZeRO, FSDP), ajuste fino eficiente (LoRA, QLoRA) e avaliação de modelos.

O livro é adequado para iniciantes?

Não, é necessário conhecimento prévio em redes neurais e otimização.

Inclui exemplos de código?

Sim, o livro apresenta exemplos de código e diagramas para ilustrar conceitos.

C

Cretisoft Direct

Suporte a livro digital

T

Entrega por parceiro

Livro enviado após pagamento

Sample EPUB

Read sample online

Treinamento de Grandes Modelos de Linguagem: Pré-treinamento, Alinhamento e Escalonamento de Sistemas de IA Modernos

Você também pode gostar

Com base no seu histórico de leitura

Ver tudo