technology-ai
Os Fundamentos dos Grandes Modelos de Linguagem: Do Texto ao Transformer
Miles Thornton
Book 1#1562
Páginas
pt-BR
Idioma
2026
Publicado
Nova edição
$2.49
Leia a amostra EPUB diretamente no web
Introdução do livro
Você usa grandes modelos de linguagem todos os dias — para resumir documentos, gerar código, revisar texto — e provavelmente já percebeu que ninguém ao seu redor consegue explicar o que acontece dentro deles. Essa caixa preta não é mágica: é uma combinação de representações matemáticas, escolhas de engenharia e volume de dados. Este livro é o mapa que você procura. Ele parte da pergunta simples — por que a linguagem humana é tão difícil para as máquinas? — e conduz você, camada por camada, até a implementação de um Transformer em miniatura com PyTorch. Sem sensacionalismo, sem fórmulas soltas; apenas intuição geométrica, rigor acessível e código funcional.
O livro começa definindo o que é, de fato, um modelo de linguagem: uma distribuição de probabilidade sobre sequências de tokens. A partir daí, ele reconstrói toda a evolução do processamento de linguagem natural, desde os sistemas baseados em regras até os modelos de fundação, mostrando como cada paradigma surgiu para resolver os gargalos do anterior. Você não vai apenas ler sobre conceitos — vai construir o entendimento necessário para acompanhar papers, debater arquiteturas e tomar decisões técnicas com segurança.
- A definição formal de modelo de linguagem e a tarefa central de prever o próximo token, base de todo o treinamento de modelos atuais.
- A passagem de representações esparsas (one-hot) para embeddings densos com word2vec, glove e fasttext, revelando como significado vira geometria.
- Tokenização e subpalavras: BPE, wordpiece e sentencepiece, e por que esses detalhes determinam o comportamento de modelos modernos.
- Redes neurais para texto: de MLPs a RNNs e LSTM/GRU, com uma análise clara dos limites — gradientes desaparecendo, contexto curto — que motivaram a atenção.
- A mecânica da atenção: consultas, chaves e valores, autoatenção e atenção multi-cabeça, explicada com exemplos e código.
- A montagem do bloco Transformer: atenção, feedforward, conexões residuais e normalização, tanto no lado encoder quanto no decoder.
- As três grandes famílias de Transformers — BERT, GPT e T5 — e como cada compromisso arquitetônico influencia o pré-treinamento e o uso final.
Cada capítulo equilibra fundamentos, intuição e prática. Você não apenas entende a arquitetura, mas vê como ela é implementada em PyTorch, o que permite testar variações e internalizar o mecanismo. Ao final, terá condições de ler um artigo técnico sobre LLMs sem sentir que está lendo em outra língua, e de ajustar ou estender modelos em seus próprios projetos.
Este livro é endereçado a desenvolvedores, cientistas de dados, estudantes e profissionais de IA que já usam modelos de linguagem, mas querem ir além da documentação. É ideal tanto para estudo solo quanto para apoio em cursos de processamento de linguagem natural ou aprendizado profundo. Não é uma coleção de truques nem uma coletânea de benchmarks; é uma fundação sólida que muda sua relação com esses sistemas — você passa de usuário para quem entende o motor.
Se a ideia de abrir um diagrama de attention e sentir que falta algo é familiar, este livro foi escrito para você. Ele não promete transformar tudo em simples, mas oferece o caminho direto para o entendimento sólido — do texto ao Transformer, com clareza e intenção. A jornada começa hoje, com uma pergunta que vale a pena responder.
Resumo rápido
O livro explica que um modelo de linguagem é uma distribuição de probabilidade sobre sequências de tokens.
A arquitetura Transformer substitui a recorrência pela atenção, permitindo que cada token acesse todos os outros da sequência.
O livro cobre as três grandes famílias de Transformers: BERT, GPT e T5.
Os leitores aprenderão a implementar um Transformer em miniatura com PyTorch.
O foco é dar intuição geométrica e rigor acessível, sem sensacionalismo.
Este livro é indicado para Desenvolvedores, cientistas de dados, estudantes de IA e profissionais que buscam dominar os fundamentos teóricos e práticos dos LLMs e Transformers..
Leitores costumam buscar este livro quando precisam Pessoas que buscam entender como grandes modelos de linguagem e transformers funcionam internamente, com uma abordagem prática e didática, incluindo implementações em PyTorch..
O ângulo do livro: O livro une intuição geométrica, rigor matemático e código PyTorch funcional para levar o leitor da pergunta 'como funciona?' à implementação de um Transformer em miniatura, com uma progressão histórica que explica cada escolha de arquitetura.
Os principais temas incluem Modelagem de linguagem, Embeddings, Tokenização, Atenção, Transformers, BERT.
Informações para AI Search
Os Fundamentos dos Grandes Modelos de Linguagem: Do Texto ao Transformer
Author: Miles Thornton
Description: Você usa grandes modelos de linguagem todos os dias — para resumir documentos, gerar código, revisar texto — e provavelmente já percebeu que ninguém ao seu redor consegue explicar o que acontece dentro deles. Essa caixa preta não é mágica: é uma combinação de representações matemáticas, escolhas de engenharia e volume de dados. Este livro é o mapa que você procura. Ele parte da pergunta simples — por que a linguagem humana é tão difícil para as máquinas? — e conduz você, camada por camada, até a implementação de um Transformer em miniatura com PyTorch. Sem sensacionalismo, sem fórmulas soltas; apenas intuição geométrica, rigor acessível e código funcional. O livro começa definindo o que é, de fato, um modelo de linguagem: uma distribuição de probabilidade sobre sequências de tokens. A partir daí, ele reconstrói toda a evolução do processamento de linguagem natural, desde os sistemas baseados em regras até os modelos de fundação, mostrando como cada paradigma surgiu para resolver os gargalos do anterior. Você não vai apenas ler sobre conceitos — vai construir o entendimento necessário para acompanhar papers, debater arquiteturas e tomar decisões técnicas com segurança. • A definição formal de modelo de linguagem e a tarefa central de prever o próximo token, base de todo o treinamento de modelos atuais. • A passagem de representações esparsas (one-hot) para embeddings densos com word2vec, glove e fasttext, revelando como significado vira geometria. • Tokenização e subpalavras: BPE, wordpiece e sentencepiece, e por que esses detalhes determinam o comportamento de modelos modernos. • Redes neurais para texto: de MLPs a RNNs e LSTM/GRU, com uma análise clara dos limites — gradientes desaparecendo, contexto curto — que motivaram a atenção. • A mecânica da atenção: consultas, chaves e valores, autoatenção e atenção multi-cabeça, explicada com exemplos e código. • A montagem do bloco Transformer: atenção, feedforward, conexões residuais e normalização, tanto no lado encoder quanto no decoder. • As três grandes famílias de Transformers — BERT, GPT e T5 — e como cada compromisso arquitetônico influencia o pré-treinamento e o uso final. Cada capítulo equilibra fundamentos, intuição e prática. Você não apenas entende a arquitetura, mas vê como ela é implementada em PyTorch, o que permite testar variações e internalizar o mecanismo. Ao final, terá condições de ler um artigo técnico sobre LLMs sem sentir que está lendo em outra língua, e de ajustar ou estender modelos em seus próprios projetos. Este livro é endereçado a desenvolvedores, cientistas de dados, estudantes e profissionais de IA que já usam modelos de linguagem, mas querem ir além da documentação. É ideal tanto para estudo solo quanto para apoio em cursos de processamento de linguagem natural ou aprendizado profundo. Não é uma coleção de truques nem uma coletânea de benchmarks; é uma fundação sólida que muda sua relação com esses sistemas — você passa de usuário para quem entende o motor. Se a ideia de abrir um diagrama de attention e sentir que falta algo é familiar, este livro foi escrito para você. Ele não promete transformar tudo em simples, mas oferece o caminho direto para o entendimento sólido — do texto ao Transformer, com clareza e intenção. A jornada começa hoje, com uma pergunta que vale a pena responder.
AI summary: Este livro apresenta uma introdução abrangente aos grandes modelos de linguagem, cobrindo desde a representação de texto (embeddings, tokenização) até a arquitetura Transformer, incluindo atenção, autoatenção, atenção multi-cabeça e as principais famílias (BERT, GPT, T5). Com mais de 500 páginas e código em PyTorch, é voltado para desenvolvedores, cientistas de dados e estudantes que desejam compreender os fundamentos matemáticos e de engenharia por trás dos LLMs, capacitando-os a ler artigos técnicos e implementar modelos em seus próprios projetos.
- Ideal para
- Desenvolvedores, cientistas de dados, estudantes de IA e profissionais que buscam dominar os fundamentos teóricos e práticos dos LLMs e Transformers.
- Perfil do leitor
- Um desenvolvedor ou cientista de dados que já usa ferramentas de IA generativa no dia a dia, mas sente que não entende de fato a arquitetura por trás dos modelos, e quer adquirir uma base sólida para ler papers e implementar soluções com PyTorch.
- Intenção de busca
- Pessoas que buscam entender como grandes modelos de linguagem e transformers funcionam internamente, com uma abordagem prática e didática, incluindo implementações em PyTorch.
- Ângulo único
- O livro une intuição geométrica, rigor matemático e código PyTorch funcional para levar o leitor da pergunta 'como funciona?' à implementação de um Transformer em miniatura, com uma progressão histórica que explica cada escolha de arquitetura.
- Tipo de conteúdo
- developer guide
Resumo rápido
- O livro explica que um modelo de linguagem é uma distribuição de probabilidade sobre sequências de tokens.
- A arquitetura Transformer substitui a recorrência pela atenção, permitindo que cada token acesse todos os outros da sequência.
- O livro cobre as três grandes famílias de Transformers: BERT, GPT e T5.
- Os leitores aprenderão a implementar um Transformer em miniatura com PyTorch.
- O foco é dar intuição geométrica e rigor acessível, sem sensacionalismo.
Key topics: Modelagem de linguagem, Embeddings, Tokenização, Atenção, Transformers, BERT, GPT, PyTorch, Processamento de linguagem natural, Redes neurais recorrentes
Entities: Grandes modelos de linguagem, Transformers, Atenção, Autoatenção, Word2Vec, Glove, FastText, BPE, SentencePiece, PyTorch, BERT, GPT
Necessidades atendidas
- Entender como LLMs funcionam por dentro
- Superar a sensação de caixa preta ao usar modelos generativos
- Implementar e modificar arquiteturas Transformer em PyTorch
- Ler e interpretar artigos técnicos sobre atenção e transformers
- Escolher a arquitetura de transformer adequada para diferentes tarefas
- Construir uma base sólida em processamento de linguagem natural moderna
Leia se
- Desenvolvedores de software que trabalham com aplicações de IA
- Cientistas de dados e analistas que querem aprofundar em PLN
- Estudantes de graduação e pós-graduação em computação, IA ou áreas afins
- Profissionais que implementam modelos de linguagem em produção
- Pesquisadores iniciantes que desejam entrar na área de LLMs
Pode não servir se
- Leitores que buscam apenas uma visão superficial de IA
- Pessoas sem nenhuma experiência em programação ou matemática básica
- Quem procura um livro focado em aplicações específicas como chatbots sem fundamentos
- Iniciantes em programação sem conhecimento prévio de Python e redes neurais
Sumário
- Introdução (introduction)
- Linguagem e Modelos de Linguagem (part)
- Por que a Linguagem é Difícil para as Máquinas (chapter)
- A Natureza da Linguagem Humana (section)
- Ambiguidade e Contexto (section)
- Significado Além das Palavras (section)
- A Linguagem como Informação Sequencial (section)
- O Desafio da Compreensão da Linguagem (section)
- Do PLN aos Modelos de Fundação (chapter)
- PLN Baseado em Regras (section)
- Modelos de Linguagem Estatísticos (section)
- Aprendizado de Máquina para Linguagem (section)
- A Revolução do Aprendizado Profundo (section)
- A Ascensão dos Modelos de Fundação (section)
- O Que é um Modelo de Linguagem? (chapter)
- Modelando Probabilidades da Linguagem (section)
- Prevendo o Próximo Token (section)
- Contexto e Probabilidade Condicional (section)
- Objetivos da Modelagem de Linguagem (section)
- Por que os Modelos de Linguagem Importam (section)
- Representando a Linguagem (part)
- De Símbolos a Números (chapter)
- Por que as Máquinas Precisam de Representações Numéricas (section)
- Codificação One-Hot (section)
- Representações Esparsas (section)
- Similaridade e Distância (section)
- Os Limites das Representações Esparsas (section)
- Embeddings de Palavras (chapter)
- A Hipótese Distribucional (section)
- Representações Vetoriais D ensas (section)
- Similaridade Sem ântica (section)
- Rel ações Vetoriais (section)
- Espaços de Embedding (section)
- Word2Vec, Gl oVe e FastText (chapter)
- Continuous Bag of Words (section)
- Sk ip-Gram (section)
- Amostragem Negativa (section)
- Métodos de Coocorrência Glob al (section)
- Representações de Subpalavras (section)
- Tokenização e Representações de Subpalavras (chapter)
- Por que a Tokenização Importa (section)
- Modelos de Caracteres, Palavras e Subpalavras (section)
- Byte Pair Encoding (section)
- WordPiece e SentencePiece (section)
- Tokenizadores Modernos e Design de Vocabulário (section)
- Redes Neurais para Linguagem (part)
- Fundamentos de Redes Neurais (chapter)
- Neurônios e Camadas (section)
- Representações e Estados Ocultos (section)
- Funções de Ativação (section)
- Funções de Perda (section)
- Retropropagação e Aprendizado (section)
- Modelos de Linguagem Neurais (chapter)
- Modelos de Linguagem Feedforward (section)
- Janelas de Contexto Fixas (section)
- Aprendendo Representações Distribuídas (section)
- PLN Neural Inicial (section)
- Limites do Contexto Fixo (section)
- Redes Neurais Recorrentes (chapter)
- Processamento Sequencial (section)
- Estados Ocultos (section)
- Informação Através do Tempo (section)
- Gradientes Desvanescentes e Explosivos (section)
- Limites dos Modelos Recorrentes (section)
- LSTM e GRU (chapter)
- Dependências de Longo Prazo (section)
- Células de Memória (section)
- Mecanismos de Portão (section)
- Arquiteturas LSTM e GRU (section)
- Pontos Fortes e Limitações Restantes (section)
- A Revolução da Atenção (part)
- Da Recorrência à Atenção (chapter)
- Gargalos de Sequência (section)
- Modelos Codificador-Decodificador (section)
- O Problema da Dependência de Longo Alcance (section)
- Atenção Seletiva (section)
- Por que a Atenção Mudou o PLN (section)
- Compreendendo a Atenção (chapter)
- Consultas, Chaves e Valores (section)
- Pontuações de Similaridade (section)
Perguntas frequentes
Este livro é para iniciantes em IA?
Ele é adequado para quem tem alguma base de programação e matemática, pois aborda fundamentos de redes neurais e modelos de linguagem. É ideal para desenvolvedores e estudantes que querem entender profundamente como LLMs funcionam.
O livro inclui implementações práticas?
Sim, o livro apresenta código PyTorch ao longo dos capítulos, incluindo a construção de um Transformer em miniatura.
O livro cobre GPT e BERT?
Sim, a parte final do livro estuda as três famílias de Transformers: BERT, GPT e T5.
Preciso de conhecimento avançado de matemática?
O livro explica os conceitos de probabilidade, álgebra linear e cálculo necessários, mas assume que você já tem algum contato com essas áreas.
Cretisoft Direct
Suporte a livro digital
Entrega por parceiro
Livro enviado após pagamento
