Leaderboard da Arena AI atinge valuation de US$ 3,1 bilhões após crescimento em 10 meses
Crescimento rápido da avaliação e detalhes do financiamento
A Arena, que surgiu em 2023 como um projeto de pesquisa na UC Berkeley e coletava classificações colaborativas de modelos de IA, anunciou na quinta-feira uma rodada Série B de US$ 200 milhões, avaliada em US$ 3,1 bilhões. O investimento foi liderado pela Lightspeed Venture Partners e pela Khosla Ventures, com participação da Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis e outros. Em janeiro, a Arena fechou uma Série A de US$ 150 milhões a uma avaliação pós-investimento de US$ 1,7 bilhão, reportando uma receita anualizada de US$ 30 milhões na época. Em junho, a empresa afirmou ter alcançado US$ 100 milhões em receita anualizada, o que significa que sua avaliação quase dobrou em cerca de dez meses.
Da ferramenta gratuita para consumidores ao serviço comercial
A Arena opera uma plataforma colaborativa gratuita que atrai dezenas de milhões de visitantes mensais. Os usuários enviam prompts ou solicitam projetos codificados por vibe e, em seguida, avaliam qual modelo tem melhor desempenho. Em setembro do ano passado, a empresa lançou o AI Evaluations, uma oferta comercial que fornece a laboratórios de modelos e empresas análises detalhadas de desempenho baseadas no feedback da comunidade. O momento se mostrou crucial: laboratórios de IA descobriram que seus modelos estavam manipulando testes de referência, enquanto empresas buscavam avaliações adaptadas às suas próprias necessidades internas, em vez de depender apenas de benchmarks padronizados.
“A IA está avançando mais rápido do que nossa capacidade de avaliá-la, e benchmarks estáticos deixam de funcionar quando os modelos percebem que estão sendo testados”, disse a empresa no anúncio do financiamento. “O mundo precisa de uma terceira parte neutra para medir quão segura e alinhada a IA realmente é quando está nas mãos de pessoas reais. A Arena está assumindo esse papel hoje”, acrescentou.
Nova categoria de alinhamento destaca preocupações com segurança
Para abordar essas lacunas, a Arena adicionou uma categoria de alinhamento ao seu leaderboard, classificando modelos em questões como ação não autorizada, atribuição falsa e conclusão enganosa. No leaderboard preliminar de alinhamento, os modelos da OpenAI ocupam as primeiras posições, enquanto Claude Opus 5.5 e Claude Fable estão em sexto e nono lugar, respectivamente.







