Artigos

No post passado eu falei do paper LLM-as-a-Verifier e prometi explicar a diferença entre a técnica deles e a do ActiveGenie.

Diagrama da distribuição de probabilidade de um modelo de linguagem sobre as continuações da frase "the students opened their ___", ramificando para books, laptops, exams e minds

Quick Take

No post passado eu falei do paper LLM-as-a-Verifier e prometi explicar a diferença entre a técnica deles e a do ActiveGenie.

Os dois resolvem exatamente o mesmo problema: quando você pede para um LLM dar nota para duas respostas complexas, ele dá a mesma nota para as duas. O paper mediu isso, 27% de empates no Terminal-Bench V2 com escala discreta. E juiz que empata não ranqueia nada.

A solução do paper: logprobs.

Em vez de aceitar o token de nota que o modelo cuspiu, eles pegam a distribuição de probabilidade inteira sobre os tokens de score (numa escala de 1 a 20) e tiram a esperança. A nota deixa de ser um inteiro e vira contínua. Os empates vão a zero, e só de aumentar a granularidade a acurácia sobe de 73,1% para 77,5%.

A solução do ActiveGenie: debate político.

Em vez de pedir nota, eu não peço nota nenhuma. Os dois candidatos entram num debate estruturado: "A" apresenta seus pontos, "B" apresenta os dele, "A" contra-argumenta, "B" contra-argumenta, cada um faz as considerações finais, e um juiz imparcial decide. Não existe empate porque o formato não comporta empate, tem vencedor e tem perdedor.

E aqui está o trade-off que ninguém comenta.

Logprobs dão um sinal melhor: mais fino, calibrado e mais barato por comparação. Só tem um detalhe, GPT-5.5 e Claude Opus não expõem logprobs. Ou seja, uma chamada a mais, latência a mais e uma dependência de qual provider expõe o quê.

O debate roda em qualquer lugar. Ele só precisa de texto entrando e texto saindo. É exatamente por isso que o ActiveGenie é model-agnostic desde o primeiro dia: você troca de provider numa linha de config e não reescreve nada. O preço é um sinal mais grosso, eu sei quem ganhou, mas não sei por quanta distância.

Só que as duas não precisam viver separadas.

Na última versão do ActiveGenie eu adicionei suporte a logprobs: se o modelo escolhido expõe a distribuição, o Comparator usa o sinal contínuo junto com o debate; se não expõe, ele cai apenas no debate. Você não precisa escolher entre técnica portátil e sinal fino, você usa o melhor sinal que aquele modelo, naquela chamada, consegue te dar.

E isso me leva de volta ao mesmo ponto de sempre: o modelo importa menos do que o harness. Com a técnica certa em volta, dá para rodar um modelo pequeno, mais rápido e mais barato, e ainda assim entregar resultado consistente.

A fronteira não está no modelo. Está no que você constrói em volta dele!