Ir al contenido

IA local: corré un modelo de 80B con solo 4 GB de RAM

IA local LLM Qwen
4 de agosto de 2026 por
IA local: corré un modelo de 80B con solo 4 GB de RAM
Dalhyn Carrillo
| Todavía no hay comentarios

IA local: corré un modelo de 80B con solo 4 GB de RAM

Introducción

Hace un año, correr un modelo de lenguaje grande de buena calidad en tu propia máquina era un sueño de ricos: necesitabas una GPU de miles de dólares o una suscripción a la nube que te facturaba por token. Hoy, un proyecto presentado en Hacker News corre un modelo de 80 mil millones de parámetros en 4.3 GB de RAM de una Mac, y un modelo de 35B directamente en un iPhone.

No, no es clickbait. Es la convergencia de dos tendencias: la cuantización cada vez más agresiva y los modelos open-weight cada vez más eficientes. Y para un emprendedor o dev LATAM, esto cambia las reglas del juego: menos dependencia de la nube, menos costos y más privacidad.

Lo que vas a aprender:

  • Qué es exactamente lo que logró Swiftlet (el proyecto del momento)
  • Cómo Cloudflare sirve modelos de frontera como Kimi y GLM más barato y rápido
  • Qué modelos podés correr hoy en tu hardware
  • Cuándo la IA local te conviene y cuándo no

La IA local dejó de ser un lujo

El 3 de agosto, un desarrollador publicó en Hacker News un proyecto llamado Swiftlet: correr un Qwen de 80B en una Mac con solo 4.3 GB de RAM, y un modelo de 35B en un iPhone. La publicación explotó (casi 200 puntos y una discusión de 400+ comentarios en horas) porque ataca el problema central de la IA local: la memoria.

Los modelos grandes no caben en la RAM de equipos normales, y los que caben suelen ser inutilizables de lentos. Swiftlet ataca ambos frentes con optimizaciones de cuantización y de plataforma (aprovechando al máximo la memoria unificada de Apple Silicon y los motores neuronales).

La discusión en Hacker News es la parte más honesta del asunto: hay escépticos que dicen que "es un espejismo", y defensores que recuerdan que así empiezan todas las revoluciones de hardware. Lo concreto: ya podés correr un modelo grande en una laptop normal, y el rendimiento mejora cada mes.

Cómo corren un modelo de 80B en 4 GB

La magia no es magia: es matemática aplicada a tres frentes.

1. Cuantización agresiva

Los pesos de un modelo se guardan normalmente en precisión de 16 bits. La cuantización los comprime a 8, 4 o incluso menos bits. Un Qwen 80B en 16 bits pesa ~160 GB; en 4 bits, ~45 GB; con técnicas más nuevas, la parte que se mantiene activa en memoria se reduce muchísimo más. Menos bits = menos memoria, a cambio de un poquito de precisión que en la práctica casi no se nota para la mayoría de tareas.

2. Arquitecturas de mezcla de expertos (MoE)

Los modelos modernos como Qwen, Kimi o GLM no activan todos sus parámetros en cada token: activan solo los "expertos" relevantes. Eso permite cargar un modelo enorme en disco y mantener en RAM solo los pesos que se usan. Es el mismo truco que usan los gigantes de la nube, ahora al alcance de una laptop.

3. Optimización de plataforma

Swiftlet aprovecha la memoria unificada de Apple Silicon: la CPU y la GPU comparten la misma RAM, así que no hay copias redundantes de los pesos. En el iPhone, además, usa el Neural Engine para acelerar la inferencia. Resultado: un 35B que corre en el bolsillo.

Lo que hace Cloudflare con Kimi y GLM

En paralelo, Cloudflare publicó esta semana cómo sirve a escala modelos de frontera open-weight (Kimi K2.6 de Moonshot y GLM de Z.ai) con tres técnicas: cuantizar el KV-cache a 8 bits (FP8), comprimir los pesos y proteger el caché compartido. Los números son contundentes:

  • El contexto admisible en memoria pasó de ~686.000 a ~1.37 millones de tokens (el doble)
  • El throughput subió ~41% con ~30% menos costo por token
  • Todo sin cambiar la precisión del modelo

¿Por qué te importa? Porque lo que Cloudflare hace a escala industrial es la misma optimización que después llega a las herramientas de escritorio. La frontera de la IA local se mueve más rápido que nunca.

Por qué esto importa para tu equipo

Si desarrollás software o automatizás procesos para tu negocio, la IA local te da tres ventajas concretas:

  1. Privacidad: tus datos no salen de tu máquina. Nada de pegar código o datos de clientes en un servidor de terceros.
  2. Costo predecible: pagás una vez por el hardware, no por token. Con los precios de los modelos en la nube subiendo —ya cubrimos cómo OpenAI empujó sus precios—, esto pesa cada vez más.
  3. Latencia y disponibilidad: sin conexión, sin colas, sin límites de rate. Funciona en el avión, en una finca, en cualquier lado.

No es casualidad que el tema explote justo cuando los agentes de IA en la nube se vuelven la apuesta de Google y OpenAI. La alternativa local es cada vez más viable para quien no quiere depender de un tercero.

Modelos que podés correr hoy

Modelo Tamaño Hardware mínimo Caso de uso
Qwen 35B (cuantizado) ~4 GB iPhone / laptop moderna Asistente personal, resúmenes
Qwen 80B (Swiftlet) ~4.3 GB RAM Mac con memoria unificada Razonamiento, código, análisis
Gemma 4 26B ~2 GB RAM Mac con 8 GB+ Asistencia de escritorio
Kimi K2.6 / GLM en la nube API (Cloudflare Workers AI) Producción a escala

El último caso te suena: ya te mostramos cómo correr Gemma 4 26B en una Mac con 2 GB de RAM. Lo de esta semana es la confirmación de que la tendencia no frena: cada mes baja la barrera de entrada.

Cuándo NO te conviene la IA local

Seamos directos: la IA local no es la respuesta a todo.

  • Velocidad: un 80B en 4 GB de RAM va lento. Para producción con alto tráfico, la nube sigue ganando por goleada.
  • Calidad de los modelos: los mejores modelos de frontera (los que viven en la nube) siguen superando a lo que cabe en una laptop.
  • Mantenimiento: instalás, actualizás, cuantizás, benchmarkeás. No es plug-and-play para todos.

La estrategia ganadora hoy es híbrida: local para lo sensible y lo rutinario, nube para lo pesado y lo que necesita el mejor modelo disponible.

Preguntas Frecuentes

  1. ¿Qué es la cuantización de un modelo de IA? → Es comprimir los pesos del modelo a menos bits (de 16 a 4, por ejemplo) para que ocupe menos memoria. Se pierde un poco de precisión, pero en la mayoría de tareas prácticas la diferencia es mínima y permite correr modelos enormes en hardware normal.
  1. ¿Necesito una GPU cara para correr IA local? → Ya no. Los proyectos como Swiftlet corren modelos de 80B en Macs con memoria unificada, y modelos chicos incluso en iPhone. Para modelos medianos, cualquier laptop con 8-16 GB de RAM alcanza con la cuantización adecuada.
  1. ¿Qué es un modelo open-weight? → Un modelo cuyos pesos están publicados para que cualquiera los descargue y ejecute (Qwen, Gemma, GLM, Kimi). A diferencia de los modelos cerrados, no dependés de la API de nadie: los corrés donde querés.
  1. ¿La IA local es más segura que usar ChatGPT? → Para datos sensibles, sí: la información nunca sale de tu máquina. Es la razón principal por la que muchas empresas con datos de clientes están mirando la IA local como opción.
  1. ¿Cuánto cuesta empezar con IA local? → Si ya tenés una Mac o laptop con 8+ GB de RAM, $0: las herramientas como Ollama, llama.cpp y Swiftlet son gratuitas y open source. El costo es tu tiempo para configurarla.

Conclusión

La IA local pasó de ser una curiosidad de nerds a una opción seria para equipos chicos:

  1. La barrera bajó: un modelo de 80B ya corre en 4 GB de RAM, y los 35B van en un iPhone.
  2. La nube no desaparece: las optimizaciones de Cloudflare demuestran que la nube también mejora; el ganador es el que combina ambas.
  3. Privacidad y costo: la IA local es la respuesta para datos sensibles y presupuestos ajustados.

¿Ya probaste correr un modelo local en tu máquina? Contame en los comentarios cuál fue tu experiencia, y si querés más guías prácticas de IA para tu negocio, suscribite a la newsletter.

Iniciar sesión dejar un comentario