Exemplo · apoio deste dia

Deep Dive into LLMs: Tokens, Pretraining & A Janela de Contexto como Memória de Trabalho

Andrej Karpathy · 3h 31m de vídeo · 2 min de leitura

apoio deste dia

meuflip

Pra quem compra, reforma e revende imóvel: o meuflip calcula a margem de cada negócio e deixa você conversar com a operação.

exemplo · o meuflip é um projeto meu, ninguém pagou por esta linha

01

O grande insight

Um LLM não é um banco de dados de fatos: é uma compressão com perda da internet. O que ele sabe pelos parâmetros é lembrança vaga; o que está na janela de contexto é memória de trabalho. Quer precisão, ponha a informação no contexto.

“Think of that knowledge in the parameters as something you read a month ago.” — Andrej Karpathy

02

Em 28 segundos

03

Números do dia

100.277
tokens no vocabulário do GPT-4

nem palavras, nem letras: fragmentos de bytes

44 TB
de texto filtrado no FineWeb

a internet que vira pesos no pretraining

3 meses
de pretraining em milhares de computadores

o post-training leva umas 3 horas

3
fases: pretraining, SFT, RL

o conhecimento entra na primeira

04

Conceitos do dia

Token
Unidade mínima que o modelo lê e escreve. Não é palavra nem letra: é um fragmento de bytes escolhido por frequência. Por isso contar os R de 'strawberry' foi difícil por tanto tempo: o modelo não vê as letras.
Pretraining
Fase em que o modelo aprende a prever o próximo token em trilhões de tokens da internet. É onde o conhecimento entra, e onde vai quase todo o dinheiro.
Post-training (SFT + RL)
Treino curto com conversas curadas por pessoas e, depois, aprendizado por reforço. Transforma o simulador de documentos num assistente com personalidade.
Context window
Os tokens que o modelo enxerga de uma vez. É a memória de trabalho: o que está ali é acessível direto, sem depender da lembrança vaga guardada nos parâmetros.
05

Resumo executivo

  1. 01

    LLMs não leem palavras nem letras: operam em tokens, fragmentos de bytes escolhidos por frequência. O vocabulário do GPT-4 tem 100.277 deles, e boa parte das esquisitices nasce aí.

  2. 02

    Pretraining é onde entra o conhecimento e quase todo o custo: cerca de três meses em milhares de computadores pra comprimir a internet, com perda, nos parâmetros.

  3. 03

    Post-training (SFT e RL) é bem mais barato, horas em vez de meses, e transforma um simulador de documentos da internet num assistente. A personalidade vem dos exemplos de conversa, não do pretraining.

  4. 04

    O que está nos parâmetros é lembrança vaga; o que está na janela de contexto é memória de trabalho. Por isso dizer 'não sei', buscar na web e colar a fonte no prompt reduzem alucinação.

06

O vídeo

07

Deep dive

  1. A raiz dos 'bugs' de LLM: o tokenizer

    Por que os modelos insistiam que 'strawberry' tem dois R, mesmo resolvendo questões de olimpíada de matemática? Duas fraquezas somadas: eles não veem caracteres, só tokens, e contam mal, porque cada token carrega pouca computação. Soletrar e contar pedem justamente o que o tokenizer esconde.

    → apliqueAntes de culpar o modelo por um erro de soletração ou contagem, cole o texto no tiktokenizer e olhe os tokens.

  2. Pretraining vs. post-training

    O pretraining leva uns três meses em milhares de computadores e custa milhões de dólares; o resultado é um simulador de documentos da internet, que continua texto em vez de responder. O post-training é bem mais curto e barato: o modelo continua treinando, agora em conversas escritas por pessoas seguindo instruções de rotulagem, e aprende a se comportar como assistente.

    → apliquePrecisa de conhecimento atualizado? Ponha no contexto (busca, documentos, ferramentas), não em treino.

  3. Lembrança vaga vs. memória de trabalho

    O conhecimento nos parâmetros é como algo que você leu há um mês: o que aparece muito fica, o resto vira lembrança vaga, e daí sai a alucinação. A janela de contexto é diferente: é memória de trabalho, acessível direto. Por isso uma busca na web, ou o texto colado no prompt, troca a lembrança pelo dado.

    → apliquePra resumir ou analisar um texto, cole o texto no prompt em vez de confiar no que o modelo lembra dele.

08

Antes e depois

O que a maioria acha

  • ×

    O LLM é um banco de dados gigante que consulta fatos.

  • ×

    O modelo lê palavras e letras como a gente.

  • ×

    O post-training deixa o modelo mais sabido.

  • ×

    Alucinação é um bug que vai ser corrigido.

O que o vídeo mostra

  • →

    É uma compressão com perda da internet. Fatos saem por lembrança, não por consulta.

  • →

    Ele vê tokens: fragmentos de bytes. Boa parte das esquisitices nasce aí.

  • →

    Ensina o formato de assistente. Conhecimento vem do pretraining.

  • →

    Alucinação nasce da lembrança vaga. Mitiga-se com 'não sei', busca e contexto.

09

Playground

10

Faça hoje

11

Do criador

Andrej Karpathy@karpathy Ex-diretor de IA da Tesla e cofundador da OpenAI. Hoje ensina de graça e constrói a Eureka Labs. Tudo que ele publica é aula.

curadoria independente · nenhum criador pagou pra estar aqui

Resumo independente. É o criador e quer ajustar algo? Fale com a gente.

12

Papers e recursos

#LLMs · #Tokenization · #Pretraining · #Karpathy · #ContextWindow

No vídeo do dia

Assinatura do vídeo do dia com a linha apoio · apresentado por meuflip

Último quadro do vídeo de 28 segundos que sai com cada dia. No formato vídeo, a assinatura ganha a linha apoio · apresentado por meuflip, só texto.