A Liquid AI anunciou em 25 de junho de 2026 o lançamento do LFM2.5-230M, um modelo de apenas 230 milhões de parâmetros construído sobre a arquitetura LFM2 que rivaliza com sistemas bem maiores em tarefas de extração de dados e raciocínio agentico. O bug que muitos profissionais enfrentam hoje é a dependência de nuvens distantes para rodar inteligências avançadas, o que gera latência, custos elevados e preocupações de privacidade. Este lançamento promete resolver exatamente isso ao colocar poder computacional sofisticado diretamente em celulares, robôs e placas de baixo consumo como o Raspberry Pi 5. Com velocidade de 213 tokens por segundo no Galaxy S25 Ultra e 42 tokens por segundo no Raspberry Pi 5, a solução já está disponível em versões base e pós-treinada no Hugging Face, pronta para integração com frameworks como llama.cpp e MLX.
O que torna o LFM2.5-230M diferente de tudo que vimos antes
O modelo foi pré-treinado em impressionantes 19 trilhões de tokens, incluindo uma fase de extensão de contexto para 32 mil tokens, e passou por refinamento supervisionado com destilação do modelo maior LFM2.5-350M, otimização direta de preferências e aprendizado por reforço em múltiplos domínios. Diferente dos transformers tradicionais, a arquitetura híbrida LFM2 foi projetada desde o início para eficiência em dispositivos de borda, o que significa que ele roda localmente sem precisar de servidores caros. Em benchmarks concretos, alcançou 22,51 pontos no CaseReportBench, superando o Qwen3.5-0.8B que marcou 13,83 e o Gemma 3 1B com apenas 2,28. Essa capacidade de extração de dados em dispositivos pequenos abre portas para aplicações agenticas reais, como seleção de habilidades em robôs humanoides Unitree G1 usando NVIDIA Jetson Orin.
Implicações futuras: do seu bolso para mundos como Westworld e jogos imersivos
Imagine, em poucos anos, um cenário inspirado em Westworld onde robôs e assistentes pessoais carregam inteligências locais tão ágeis quanto o LFM2.5-230M, tomando decisões em tempo real sem depender de conexão constante com a nuvem. Essa mesma tecnologia poderia alimentar companheiros de jogos em celulares que aprendem seu estilo de jogo e reagem de forma autêntica, criando experiências parecidas com as narrativas dinâmicas de séries como Black Mirror, mas já disponíveis hoje em dispositivos comuns. O fato de o modelo suportar inferência em ONNX, vLLM e SGLang significa que desenvolvedores podem integrá-lo rapidamente em apps agenticos, transformando desde tarefas simples de extração de relatórios até robôs que escolhem habilidades de forma autônoma. Essa evolução não é ficção distante: os números de velocidade e os benchmarks mostram que o futuro da IA embarcada já começou a ser construído.
Como começar a usar o modelo e preparar seu ambiente para o amanhã
Baixe as versões LFM2.5-230M ou LFM2.5-230M-Base diretamente do Hugging Face e experimente em seu próprio hardware, seja um smartphone Android ou uma placa Raspberry Pi 5. O suporte nativo a múltiplos motores de inferência permite que você teste diferentes otimizações sem complicação, conectando o modelo a fluxos de trabalho agenticos que rodam offline. Profissionais de tecnologia podem combinar essa ferramenta com abordagens semelhantes vistas em lançamentos recentes de modelos multimodais para laptops, ampliando as possibilidades de raciocínio local em projetos de automação e robótica. O passo prático seguinte é integrar o modelo em um protótipo simples, como um assistente de extração de dados que funciona sem internet, validando na prática a promessa de desempenho em dispositivos de borda.
A caixa de ferramentas para navegar essa nova era da IA local
Experimente o LFM2.5-230M hoje mesmo no Hugging Face para sentir na prática as velocidades de inferência em seu dispositivo. Monitore benchmarks como CaseReportBench e IFEval para medir ganhos reais em suas aplicações agenticas. Combine o modelo com hardware de baixo consumo, como o Raspberry Pi 5, e explore integrações com robôs ou apps móveis para construir protótipos antes que a concorrência o faça. O próximo passo é documentar seus resultados e compartilhar com a comunidade, transformando essa tecnologia em vantagem competitiva concreta para seu negócio ou carreira.