[{"data":1,"prerenderedAt":46},["ShallowReactive",2],{"mdc--9154re-key":3},{"data":4,"body":5},{},{"type":6,"children":7},"root",[8,16,21,26,31,36,41],{"type":9,"tag":10,"props":11,"children":12},"element","p",{},[13],{"type":14,"value":15},"text","Eu fiz um benchmark para o meu projeto pessoal, e claude opus e gpt sol são horríveis para o meu cenário.",{"type":9,"tag":10,"props":17,"children":18},{},[19],{"type":14,"value":20},"Você já fez o seu benchmark hoje? Essa é uma realidade rotineira para qualquer time que mantém uma feature usando LLM. Todo dia sai modelo novo, e se você está rodando um modelo na nuvem, pode ter atualização sem aviso prévio.",{"type":9,"tag":10,"props":22,"children":23},{},[24],{"type":14,"value":25},"No meu caso eu processo livros, rodando (por enquanto) duas pipelines: a primeira é bem trivial, quase uma classificação em duas etapas, e a outra é mais complexa, com extração de dados em cinco etapas.",{"type":9,"tag":10,"props":27,"children":28},{},[29],{"type":14,"value":30},"Curiosamente, um modelo de maio (gemini-3.1-flash-lite) é o melhor para o meu caso específico. Destaque também para o glm-5.3-flash (Ox Alpha), lançado recentemente. Já modelos mais poderosos, como gpt sol e opus 5, performam bem pior.",{"type":9,"tag":10,"props":32,"children":33},{},[34],{"type":14,"value":35},"Fica aqui mais um lembrete: pare de prestar atenção cega em benchmarks anunciados em larga escala. Raramente esses benchmarks públicos vão resolver um problema específico da sua empresa. Você é o responsável por saber o que o seu modelo de negócio precisa, fazer o seu próprio benchmark, e descobrir que a realidade é bem diferente.",{"type":9,"tag":10,"props":37,"children":38},{},[39],{"type":14,"value":40},"Como sempre, estou falando aqui de LLM integrada a um sistema, não de produtividade do dia a dia. Uso opus 5 e gpt sol todos os dias e não troco eles por nenhum outro, mas as tarefas do cotidiano e as tarefas que um sistema resolve são coisas bem diferentes.",{"type":9,"tag":10,"props":42,"children":43},{},[44],{"type":14,"value":45},"Como está o seu gold dataset hoje? Se você usa LLM dentro do sistema e não tem um, é simplesmente loucura.",1788360945071]