LLMs, tokenização e inferência
Anatomia da requisição, geração, contexto, cache e custo de modelos de linguagem. - Capítulo: Do texto à resposta Aplicação: Caderno de campo operacional.
Do texto à resposta
Este capítulo acompanha uma solicitação desde os caracteres digitados até a resposta exibida. Ele mostra como o tokenizador produz IDs, como o modelo transforma esses IDs em vetores contextuais, como atenção e camadas geram logits e como uma regra de decodificação escolhe cada próximo token. Depois separa janela de contexto de memória permanente, token de LLM de credencial, embedding interno de embedding para busca e três caches com objetos distintos. O percurso termina no harness, que valida schema, fontes, identidade, autorização, custo e latência antes de aceitar a saída.
Caderno de campo: orçamento de contexto e inferência
Este caderno constrói um pipeline didático e determinístico para uma pergunta sobre a OS 1842. Você compara contexto insuficiente, contexto selecionado e despejo indiscriminado; calcula softmax e amostragem sobre logits inventados; e valida schema e groundedness como propriedades diferentes. O modo negativo provoca estouro do orçamento, cruzamento de tenant, promoção de prompt injection, saída estruturalmente inválida, afirmação sem suporte e chave de cache incompleta. O modo governado comprova seleção segura, abstenção, fallback para busca com trechos, autorização externa ao modelo e evidência reproduzível, sem usar chave de API.