Exemplo · apoio deste dia
Deep Dive into LLMs: Tokens, Pretraining & A Janela de Contexto como Memória de Trabalho
Andrej Karpathy · 3h 31m de vídeo · 2 min de leitura
apoio deste dia
meuflipPra quem compra, reforma e revende imóvel: o meuflip calcula a margem de cada negócio e deixa você conversar com a operação.
exemplo · o meuflip é um projeto meu, ninguém pagou por esta linha
O grande insight
Um LLM não é um banco de dados de fatos: é uma compressão com perda da internet. O que ele sabe pelos parâmetros é lembrança vaga; o que está na janela de contexto é memória de trabalho. Quer precisão, ponha a informação no contexto.
“Think of that knowledge in the parameters as something you read a month ago.” — Andrej Karpathy
Em 28 segundos
Números do dia
- 100.277
- tokens no vocabulário do GPT-4
- 44 TB
- de texto filtrado no FineWeb
- 3 meses
- de pretraining em milhares de computadores
- 3
- fases: pretraining, SFT, RL
nem palavras, nem letras: fragmentos de bytes
a internet que vira pesos no pretraining
o post-training leva umas 3 horas
o conhecimento entra na primeira
Conceitos do dia
- Token
- Unidade mínima que o modelo lê e escreve. Não é palavra nem letra: é um fragmento de bytes escolhido por frequência. Por isso contar os R de 'strawberry' foi difícil por tanto tempo: o modelo não vê as letras.
- Pretraining
- Fase em que o modelo aprende a prever o próximo token em trilhões de tokens da internet. É onde o conhecimento entra, e onde vai quase todo o dinheiro.
- Post-training (SFT + RL)
- Treino curto com conversas curadas por pessoas e, depois, aprendizado por reforço. Transforma o simulador de documentos num assistente com personalidade.
- Context window
- Os tokens que o modelo enxerga de uma vez. É a memória de trabalho: o que está ali é acessível direto, sem depender da lembrança vaga guardada nos parâmetros.
Resumo executivo
- 01
LLMs não leem palavras nem letras: operam em tokens, fragmentos de bytes escolhidos por frequência. O vocabulário do GPT-4 tem 100.277 deles, e boa parte das esquisitices nasce aí.
- 02
Pretraining é onde entra o conhecimento e quase todo o custo: cerca de três meses em milhares de computadores pra comprimir a internet, com perda, nos parâmetros.
- 03
Post-training (SFT e RL) é bem mais barato, horas em vez de meses, e transforma um simulador de documentos da internet num assistente. A personalidade vem dos exemplos de conversa, não do pretraining.
- 04
O que está nos parâmetros é lembrança vaga; o que está na janela de contexto é memória de trabalho. Por isso dizer 'não sei', buscar na web e colar a fonte no prompt reduzem alucinação.
O vídeo
Deep dive
A raiz dos 'bugs' de LLM: o tokenizer
Por que os modelos insistiam que 'strawberry' tem dois R, mesmo resolvendo questões de olimpíada de matemática? Duas fraquezas somadas: eles não veem caracteres, só tokens, e contam mal, porque cada token carrega pouca computação. Soletrar e contar pedem justamente o que o tokenizer esconde.
→ apliqueAntes de culpar o modelo por um erro de soletração ou contagem, cole o texto no tiktokenizer e olhe os tokens.
Pretraining vs. post-training
O pretraining leva uns três meses em milhares de computadores e custa milhões de dólares; o resultado é um simulador de documentos da internet, que continua texto em vez de responder. O post-training é bem mais curto e barato: o modelo continua treinando, agora em conversas escritas por pessoas seguindo instruções de rotulagem, e aprende a se comportar como assistente.
→ apliquePrecisa de conhecimento atualizado? Ponha no contexto (busca, documentos, ferramentas), não em treino.
Lembrança vaga vs. memória de trabalho
O conhecimento nos parâmetros é como algo que você leu há um mês: o que aparece muito fica, o resto vira lembrança vaga, e daí sai a alucinação. A janela de contexto é diferente: é memória de trabalho, acessível direto. Por isso uma busca na web, ou o texto colado no prompt, troca a lembrança pelo dado.
→ apliquePra resumir ou analisar um texto, cole o texto no prompt em vez de confiar no que o modelo lembra dele.
Antes e depois
O que a maioria acha
- ×
O LLM é um banco de dados gigante que consulta fatos.
- ×
O modelo lê palavras e letras como a gente.
- ×
O post-training deixa o modelo mais sabido.
- ×
Alucinação é um bug que vai ser corrigido.
O que o vídeo mostra
- →
É uma compressão com perda da internet. Fatos saem por lembrança, não por consulta.
- →
Ele vê tokens: fragmentos de bytes. Boa parte das esquisitices nasce aí.
- →
Ensina o formato de assistente. Conhecimento vem do pretraining.
- →
Alucinação nasce da lembrança vaga. Mitiga-se com 'não sei', busca e contexto.
Playground
Faça hoje
Do criador
Andrej Karpathy@karpathy Ex-diretor de IA da Tesla e cofundador da OpenAI. Hoje ensina de graça e constrói a Eureka Labs. Tudo que ele publica é aula.
- cursoNeural Networks: Zero to Hero ↗
Gratuito. Constrói um GPT do zero em Python, vídeo a vídeo. Se este dia fez sentido, é o próximo passo natural.
- cursoLLM101n, da Eureka Labs ↗
O curso que ele está montando pra ensinar a construir um LLM inteiro. Ainda em desenvolvimento, vale acompanhar.
curadoria independente · nenhum criador pagou pra estar aqui
Resumo independente. É o criador e quer ajustar algo? Fale com a gente.
Papers e recursos
- paper
- github
#LLMs · #Tokenization · #Pretraining · #Karpathy · #ContextWindow

