Agentes de IA raramente desobedecem um prompt.
O padrão real de falha é mais sutil: eles quase cumprem. Descrevem a ação em vez de executá-la, carregam a ferramenta e nunca chamam, se sentem 'prontos' após prosa com cara de relatório.
O erro que todo mundo comete: pedir
Joined June 2020
- Coloquei dois modelos de IA pra revisar o mesmo diff de código. Eles acharam 61 erros. Mas só 21 eram erros de fato. Os outros 40 eram falso positivos, consequência de pedir para LLM encontrar bugs. Montar um conselho de modelos pra revisar código antes do merge é crucial: 🧵
- Coloquei 3 LLMs pra verificar cada claim de um relatório quantitativo. Descobri que voto majoritário entre modelos erra de forma sistemática, e por um motivo que quase ninguém comenta. Nesta thread: como montar um juiz de conselho de LLMs que decide pela evidência, com o
- Texto bacana e tal mas ao invés de ter gastado milhares de palavras era só dizer: Use gstack




