[{"data":1,"prerenderedAt":76},["ShallowReactive",2],{"mdc-h5zdz3-key":3},{"data":4,"body":5},{},{"type":6,"children":7},"root",[8,16,21,26,31,36,41,46,51,56,61,66,71],{"type":9,"tag":10,"props":11,"children":12},"element","p",{},[13],{"type":14,"value":15},"text","No post passado eu falei do paper LLM-as-a-Verifier e prometi explicar a diferença entre a técnica deles e a do ActiveGenie.",{"type":9,"tag":10,"props":17,"children":18},{},[19],{"type":14,"value":20},"Os dois resolvem exatamente o mesmo problema: quando você pede para um LLM dar nota para duas respostas complexas, ele dá a mesma nota para as duas. O paper mediu isso, 27% de empates no Terminal-Bench V2 com escala discreta. E juiz que empata não ranqueia nada.",{"type":9,"tag":10,"props":22,"children":23},{},[24],{"type":14,"value":25},"A solução do paper: logprobs.",{"type":9,"tag":10,"props":27,"children":28},{},[29],{"type":14,"value":30},"Em vez de aceitar o token de nota que o modelo cuspiu, eles pegam a distribuição de probabilidade inteira sobre os tokens de score (numa escala de 1 a 20) e tiram a esperança. A nota deixa de ser um inteiro e vira contínua. Os empates vão a zero, e só de aumentar a granularidade a acurácia sobe de 73,1% para 77,5%.",{"type":9,"tag":10,"props":32,"children":33},{},[34],{"type":14,"value":35},"A solução do ActiveGenie: debate político.",{"type":9,"tag":10,"props":37,"children":38},{},[39],{"type":14,"value":40},"Em vez de pedir nota, eu não peço nota nenhuma. Os dois candidatos entram num debate estruturado: \"A\" apresenta seus pontos, \"B\" apresenta os dele, \"A\" contra-argumenta, \"B\" contra-argumenta, cada um faz as considerações finais, e um juiz imparcial decide. Não existe empate porque o formato não comporta empate, tem vencedor e tem perdedor.",{"type":9,"tag":10,"props":42,"children":43},{},[44],{"type":14,"value":45},"E aqui está o trade-off que ninguém comenta.",{"type":9,"tag":10,"props":47,"children":48},{},[49],{"type":14,"value":50},"Logprobs dão um sinal melhor: mais fino, calibrado e mais barato por comparação. Só tem um detalhe, GPT-5.5 e Claude Opus não expõem logprobs. Ou seja, uma chamada a mais, latência a mais e uma dependência de qual provider expõe o quê.",{"type":9,"tag":10,"props":52,"children":53},{},[54],{"type":14,"value":55},"O debate roda em qualquer lugar. Ele só precisa de texto entrando e texto saindo. É exatamente por isso que o ActiveGenie é model-agnostic desde o primeiro dia: você troca de provider numa linha de config e não reescreve nada. O preço é um sinal mais grosso, eu sei quem ganhou, mas não sei por quanta distância.",{"type":9,"tag":10,"props":57,"children":58},{},[59],{"type":14,"value":60},"Só que as duas não precisam viver separadas.",{"type":9,"tag":10,"props":62,"children":63},{},[64],{"type":14,"value":65},"Na última versão do ActiveGenie eu adicionei suporte a logprobs: se o modelo escolhido expõe a distribuição, o Comparator usa o sinal contínuo junto com o debate; se não expõe, ele cai apenas no debate. Você não precisa escolher entre técnica portátil e sinal fino, você usa o melhor sinal que aquele modelo, naquela chamada, consegue te dar.",{"type":9,"tag":10,"props":67,"children":68},{},[69],{"type":14,"value":70},"E isso me leva de volta ao mesmo ponto de sempre: o modelo importa menos do que o harness. Com a técnica certa em volta, dá para rodar um modelo pequeno, mais rápido e mais barato, e ainda assim entregar resultado consistente.",{"type":9,"tag":10,"props":72,"children":73},{},[74],{"type":14,"value":75},"A fronteira não está no modelo. Está no que você constrói em volta dele!",1788360945078]