[{"data":1,"prerenderedAt":103},["ShallowReactive",2],{"mdc--eglam9-key":3},{"data":4,"body":5},{},{"type":6,"children":7},"root",[8,16,21,34,64,69,74,79,84,89],{"type":9,"tag":10,"props":11,"children":12},"element","p",{},[13],{"type":14,"value":15},"text","A técnica em volta do modelo vale mais que o modelo de fronteira.",{"type":9,"tag":10,"props":17,"children":18},{},[19],{"type":14,"value":20},"Pesquisadores de Stanford, UC Berkeley e NVIDIA Research mostraram que dá para superar GPT-5.5, Claude Opus 4.8 e Gemini 3.1 Pro sem usar um modelo melhor, usando uma técnica de torneio, com as respostas batalhando em comparações 1x1.",{"type":9,"tag":10,"props":22,"children":23},{},[24,26,32],{"type":14,"value":25},"O nome é ",{"type":9,"tag":27,"props":28,"children":29},"strong",{},[30],{"type":14,"value":31},"Probabilistic Pivot Tournament",{"type":14,"value":33},", e funciona assim:",{"type":9,"tag":35,"props":36,"children":37},"ol",{},[38,44,49,54,59],{"type":9,"tag":39,"props":40,"children":41},"li",{},[42],{"type":14,"value":43},"O modelo gera N respostas candidatas para a mesma pergunta.",{"type":9,"tag":39,"props":45,"children":46},{},[47],{"type":14,"value":48},"Uma primeira passada rápida dá um score inicial para cada resposta.",{"type":9,"tag":39,"props":50,"children":51},{},[52],{"type":14,"value":53},"Com base nesse ranking, as respostas são divididas em dois grupos: as melhores (grupo pivô) e todo o resto.",{"type":9,"tag":39,"props":55,"children":56},{},[57],{"type":14,"value":58},"Cada não-pivô é comparado contra cada pivô, e os pivôs entre si, tudo em duelo 1x1.",{"type":9,"tag":39,"props":60,"children":61},{},[62],{"type":14,"value":63},"O resultado dos duelos gera o ranking final, e aí sim a melhor resposta é escolhida.",{"type":9,"tag":10,"props":65,"children":66},{},[67],{"type":14,"value":68},"Não é rápido, nem barato. Mas funciona: 86,5% no Terminal-Bench V2, contra 84,7% do GPT-5.5. E 78,2% no SWE-Bench Verified, contra 76,8% do Opus 4.5.",{"type":9,"tag":10,"props":70,"children":71},{},[72],{"type":14,"value":73},"E é isso que muda tudo: o melhor desempenho em uma tarefa não vem mais do modelo de fronteira, e sim do harness e da técnica que você constrói em volta dele.",{"type":9,"tag":10,"props":75,"children":76},{},[77],{"type":14,"value":78},"Se você me acompanha há um tempo, já conhece essa técnica de torneio, é o que o ActiveGenie usa para entregar resultado consistente. Escrevi a primeira versão do torneio em 3 de fevereiro de 2025, quase um ano e meio atrás.",{"type":9,"tag":10,"props":80,"children":81},{},[82],{"type":14,"value":83},"Tem uma diferença importante: o ActiveGenie usa debate político, e o paper usa logprobs. Mas isso merece um post só sobre.",{"type":9,"tag":10,"props":85,"children":86},{},[87],{"type":14,"value":88},"Até lá, testa o ActiveGenie. Não dependa de modelo de fronteira e conta alta, use um modelo menor com a técnica certa.",{"type":9,"tag":10,"props":90,"children":91},{},[92,94],{"type":14,"value":93},"Artigo: ",{"type":9,"tag":95,"props":96,"children":100},"a",{"href":97,"rel":98},"https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.05391",[99],"nofollow",[101],{"type":14,"value":102},"LLM-as-a-Verifier",1788360945108]