Ir al contenido

TurboFieldfare: corré Gemma 4 26B en tu Mac con solo 2GB de RAM

TurboFieldfare Gemma 4 IA local
30 de julio de 2026 por
TurboFieldfare: corré Gemma 4 26B en tu Mac con solo 2GB de RAM
Dalhyn Carrillo
| Todavía no hay comentarios

TurboFieldfare: el motor que ejecuta Gemma 4 26B en tu Mac con solo 2GB de RAM

Introducción

Imaginate correr un modelo de 26 mil millones de parámetros en una MacBook Air de 8 GB. Sin GPU dedicada, sin depender de la nube, sin pagar por tokens. Suena a ficción, pero es real. Se llama TurboFieldfare y acaba de explotar en Hacker News con más de 800 puntos.

Un desarrollador publicó este motor open-source en Swift + Metal que ejecuta el modelo Gemma 4 26B-A4B de Google usando apenas ~2 GB de RAM. Sí, leíste bien: 2 GB para un modelo que originalmente pesa 14.3 GB.

En este artículo te explico cómo funciona, por qué es un game-changer para desarrolladores, y cómo podés probarlo vos mismo hoy.

Lo que vas a aprender:

  1. Cómo TurboFieldfare logra correr un modelo enorme con tan poca RAM
  2. Qué rendimiento podés esperar según tu Mac
  3. Cómo instalarlo y usarlo en 5 minutos
  4. Por qué esto cambia las reglas del juego para el desarrollo de software
  5. ¿Cómo hace TurboFieldfare para correr Gemma 4 con solo 2GB de RAM?

    La magia está en una combinación de técnicas de optimización que hasta ahora solo se veían en laboratorios de IA:

    Arquitectura MoE (Mixture of Experts)

    El Gemma 4 26B-A4B no es un modelo monolítico. Usa una arquitectura de expertos mixtos: aunque tiene 26B parámetros en total, solo activa ~3.88B por cada token que genera. El modelo tiene un "router" que decide qué expertos activar según la consulta.

    Streaming de expertos desde SSD

    TurboFieldfare mantiene en RAM solo el core compartido de 1.35 GB y el KV cache. El resto de los expertos los streaminea desde el SSD token por token. Esto significa que el SSD hace de "memoria secundaria", y el motor solo carga lo que necesita en cada momento.

    Cuantización 4-bit

    Los pesos del modelo están cuantizados a 4-bit con MLX, grupo 64. El router usa 8-bit, y los expertos compartidos y enrutados también están en 4-bit. Esto reduce drásticamente el tamaño en memoria sin sacrificar demasiada calidad.

    Métrica                  Valor
    

    ─────────────────────────────────────────────
    Modelo Gemma 4 26B-A4B IT
    Parámetros totales 26B (~3.88B activos/token)
    Pesos en RAM ~2 GB (incluye KV cache 4K)
    Almacenamiento 14.3 GB en SSD
    Hardware mínimo Mac Apple Silicon, 8 GB RAM
    Plataforma macOS 26, Metal 4, Swift 6.2

    ¿Qué rendimiento puedo esperar?

    Los benchmarks publicados por el autor muestran resultados impresionantes para hardware de consumo:

    Mac RAM Tokens/segundo
    M2 MacBook Air 8 GB 5.1 - 6.3 tok/s
    M5 Pro 24 GB 31 - 35 tok/s

    Traducción al mundo real:

  • En una M2 Air: genera un párrafo de ~100 tokens en 15-20 segundos. No es rapidísimo, pero es usable para asistencias de código, análisis de documentos y consultas que no requieren respuesta inmediata.
  • En una M5 Pro: genera el mismo párrafo en ~3 segundos. Perfectamente usable como asistente en tiempo real.

El autor documentó 103 experimentos de optimización cubriendo kernels, caché, I/O, prefill y decode. Esto no es un proyecto de fin de semana — es trabajo de ingeniería serio.

Cómo instalar TurboFieldfare en tu Mac

Si tenés una Mac con Apple Silicon, el proceso es sorprendentemente simple:

git clone https://github.com/drumih/turbo-fieldfare.git

cd turbo-fieldfare
swift build -c release
.build/release/TurboFieldfareMac

En la primera ejecución, Swift Package Manager descarga y compila las dependencias del tokenizador. Una vez que la app se abre:

  • Elegí Download — TurboFieldfare descarga y reorganiza el modelo (~15 GB)
  • Cuando termine, elegí Load Model
  • Escribí tu prompt y presioná Generate
  • También incluye una CLI y un servidor compatible con la API de OpenAI, lo que significa que podés conectarlo como backend de cualquier herramienta que use OpenAI (como Cursor, Continue.dev, o scripts personalizados).

    ¿Por qué esto es importante para el desarrollo de software?

    Hasta ahora, correr modelos de lenguaje grandes localmente requería:

    1. Una GPU dedicada con 16-24 GB+ de VRAM (RTX 4090, Mac Studio)
    2. O depender de APIs en la nube (OpenAI, Anthropic, Google)
    3. TurboFieldfare rompe esa barrera. Una MacBook Air de 8 GB — la laptop más básica de Apple — puede correr un modelo de 26B parámetros. Esto tiene implicaciones enormes:

    4. Privacidad: tus datos nunca salen de tu máquina. Ideal para código sensible, documentos legales o información de clientes.
    5. Cero costos recurrentes: sin pagar por token. El costo es una sola vez (el hardware).
    6. Sin internet: funcional en aviones, cafeterías, o donde sea que estés codeando.
    7. Personalización: podés fine-tunear el modelo y tenerlo siempre disponible.

    Si te interesa la IA local, también te puede interesar nuestro artículo sobre IA para educación personalizada: Andrew Ng lanza LearnVector, donde exploramos cómo los modelos locales están transformando el aprendizaje.

    Limitaciones actuales

    No todo es perfecto. TurboFieldfare tiene limitaciones:

    1. Requiere macOS 26: si estás en una versión anterior, no funciona
    2. Modelo específico: solo corre Gemma 4 26B-A4B, no es un wrapper genérico como llama.cpp
    3. Velocidad variable: en Macs de gama baja, la generación es lenta
    4. Espacio en disco: necesitás ~15 GB libres para el modelo instalado
    5. Sin soporte de imágenes: el modelo es solo texto
    6. Igual, para ser la versión 1.0 de un proyecto open-source, es impresionante.

      Preguntas Frecuentes (FAQs)

    7. ¿TurboFieldfare funciona en Macs con Intel? → No. Solo Apple Silicon (M1, M2, M3, M4, M5). Requiere Metal 4, que no está disponible en Intel Macs.
    1. ¿Puedo usar TurboFieldfare con herramientas como Cursor o VS Code? → Sí. Incluye un servidor OpenAI-compatible. Configurás tu herramienta para que apunte a localhost y listo.
    1. ¿Cuánto espacio en disco necesito? → ~15 GB para el modelo instalado. El repositorio pesa casi nada (~100 MB).
    1. ¿Gemma 4 es mejor que otros modelos locales como Llama 3? → Depende del caso de uso. Gemma 4 26B es excelente para razonamiento y código, comparable a modelos de 7B-13B de otras familias en tareas específicas.
    1. ¿Vale la pena si ya uso ChatGPT? → Si trabajás con código sensible o querés evitar depender de APIs externas, sí. Para uso casual, ChatGPT sigue siendo más cómodo.

    Conclusión

    TurboFieldfare es más que un proyecto open-source ingenioso — es una muestra de hacia dónde va la IA: modelos cada vez más grandes corriendo en hardware cada vez más accesible.

    Tres puntos clave:

    1. Gemma 4 26B corre en Macs de 8 GB RAM con ~2 GB de uso de memoria
    2. El secreto está en la arquitectura MoE + streaming de expertos desde SSD + cuantización 4-bit
    3. Es open-source, gratis, y podés probarlo hoy mismo

    La era de la IA local no es el futuro. Es hoy. Y corre en tu Mac.

    ¿Ya probaste TurboFieldfare? Contame en los comentarios qué experiencia tuviste y en qué Mac lo corriste. Si querés más contenido como este, suscribite a la newsletter para recibir cada semana lo último en tecnología para desarrolladores LATAM.

    Iniciar sesión dejar un comentario