FATO CONFIRMADO

Modelos atuais exigem roteamento por tarefa e avaliação

A orientação oficial da OpenAI apresenta GPT-5.6 Sol para trabalho complexo, Terra para equilíbrio entre qualidade e custo e Luna para alto volume sensível a preço. A família também introduz tool calling programático, cache explícito e multiagente beta.

Por que importa

O nome do modelo não deve virar arquitetura fixa. Compare qualidade, evidência, tokens, latência e custo em casos representativos; multiagente só ajuda quando o trabalho se divide com clareza e a avaliação detecta ganho real.

OpenAI Developers ↗
FATO CONFIRMADO

MCP adota núcleo stateless e endurece autorização

A especificação MCP 2026-07-28 introduziu núcleo sem sessão, requisições de múltiplas rodadas, roteamento por cabeçalhos, listas cacheáveis, extensões formais e mudanças de autorização.

Por que importa

Integrações devem registrar a versão do protocolo, migrar conscientemente e validar emissor, recurso, audience e política de ferramentas. Atualizar o SDK não substitui threat modeling nem menor privilégio.

Model Context Protocol ↗
FATO CONFIRMADO

Segurança agentic ganha taxonomia operacional própria

O OWASP Top 10 for Agentic Applications 2026 organiza riscos específicos de sistemas que planejam, usam ferramentas e executam ações em workflows complexos.

Por que importa

Prompt injection é apenas parte do problema. Objetivos, identidade, memória, cadeia de suprimentos, comunicação entre agentes, execução e confiança humana precisam de controles e testes adversariais próprios.

OWASP GenAI Security Project ↗
FATO CONFIRMADO

Orquestração transforma trabalho em uma fila verificável

A OpenAI publicou a especificação aberta Symphony: um quadro de projeto funciona como plano de controle, despachando tarefas para agentes Codex em workspaces isolados.

Por que importa

A novidade não elimina especificação nem revisão. Ela torna estado, isolamento, política de reexecução e evidência partes explícitas da orquestração. É útil para trabalho bem fatiado; não é justificativa para automatizar requisitos nebulosos.

OpenAI Engineering ↗
FATO CONFIRMADO

Sandbox torna-se parte nativa do harness de agentes

A evolução do OpenAI Agents SDK adicionou execução em sandbox e um Manifest para descrever o workspace portátil de um agente.

Por que importa

Ferramentas que leem arquivos, executam comandos e alteram estado precisam de fronteira de execução. Sandbox reduz impacto, mas continua dependendo de permissões, segredos mínimos, política de rede, logs e avaliação do resultado.

OpenAI ↗
FATO CONFIRMADO

Avaliar o resultado, não apenas o que o agente disse

A Anthropic separa transcript, outcome, agent harness, evaluation harness e evaluation suite. Um agente pode afirmar que concluiu uma ação sem que o estado real do ambiente confirme isso.

Por que importa

O Grimório trata PASS como evidência sobre o estado final. Traços ajudam no diagnóstico, mas testes determinísticos, graders calibrados e inspeção dos casos continuam necessários para evitar métricas enganosas.

Anthropic Engineering ↗
FATO CONFIRMADO

Harnesses precisam evoluir quando os modelos mudam

A Anthropic descreveu Managed Agents separando sessão, harness e sandbox e alertou que suposições codificadas no harness podem ficar obsoletas conforme o modelo melhora.

Por que importa

Mais mecanismos não significam automaticamente mais qualidade. Cada camada deve ter um teste que demonstre benefício e uma condição para ser removida quando virar apenas custo, latência ou fragilidade.

Anthropic Engineering ↗
FATO CONFIRMADO

WCAG 2.2 permanece a referência recomendada para acessibilidade Web

A W3C recomenda WCAG 2.2 e esclarece que seus critérios são testáveis e independentes de tecnologia, cobrindo diferentes deficiências e tipos de dispositivo.

Por que importa

Design contemporâneo não se resume a aparência. Foco visível e não encoberto, alvos adequados, autenticação acessível, contraste, teclado, zoom e movimento reduzido precisam entrar nos critérios de aceite e nos testes do frontend.

W3C ↗
FATO CONFIRMADO

Harness engineering em equipes agent-first

A OpenAI descreveu uma experiência em que humanos especificam intenção e projetam restrições, enquanto agentes escrevem código, testes, documentação e infraestrutura.

Por que importa

O ganho não vem de um prompt isolado: arquitetura verificável, regras mecânicas, observabilidade e ciclos curtos tornam o repositório legível e corrigível por agentes.

OpenAI Engineering ↗
FATO CONFIRMADO

Planejador, construtor e avaliador em execuções longas

A Anthropic relatou um harness de três papéis para aplicações longas, com contratos de sprint e avaliação em navegador real.

Por que importa

A própria pesquisa alerta para custo e complexidade: o avaliador agrega valor perto do limite do modelo; abaixo desse limite pode ser desperdício.

Anthropic Engineering ↗
COMUNIDADE / EXPERIMENTAL

Agent swarms como arquitetura excepcional

A Cursor publicou experimentos com árvores de planners e workers, memória compartilhada, revisão por lentes e controle de versão adaptado ao paralelismo.

Por que importa

É uma opção S3 para problemas decomponíveis e caros de verificar. Não substitui agente único, testes ou aprovação humana; os experimentos registram custos e falhas substanciais.

Cursor Research ↗
FATO CONFIRMADO

MCP amadurece como protocolo aberto

O Model Context Protocol está hospedado pela Linux Foundation e mantém especificação, documentação e SDKs oficiais em várias linguagens.

Por que importa

MCP padroniza a conexão com ferramentas e fontes de dados; ainda exige autenticação, consentimento, validação, menor privilégio e isolamento do executor.

Model Context Protocol ↗
FATO CONFIRMADO

IA muda o ecossistema, não os fundamentos

O Octoverse registrou crescimento de projetos de IA e a liderança do TypeScript por contribuidores em 2025.

Por que importa

Popularidade ajuda a descobrir ecossistemas, mas não prova qualidade. Licença, testes, segurança, manutenção e adequação ao problema continuam decisivos.

GitHub Octoverse ↗
Consulta universal

O que você quer encontrar?

Títulos, capítulos, conceitos, termos, laboratórios e ferramentas em uma única busca.

Digite pelo menos dois caracteres.