· Lectura de 9 minutos
Los modelos de IA que casi nadie te menciona, y por qué te deberían importar
Cuando alguien piensa en IA piensa en ChatGPT o en Gemini. Pero buena parte del trabajo pesado que hoy hacen chatbots, buscadores internos y herramientas de redacción corre sobre modelos que nunca vas a ver mencionados en una valla: DeepSeek, Qwen, Llama. Y la razón por la que importan no es técnica, es de plata.
Son modelos abiertos: la empresa que los entrenó publica los pesos —los números que definen cómo el modelo razona— para que cualquiera los use libremente, incluso con fines comerciales. Eso es distinto de GPT o Claude, a los que solo se accede pagando por cada consulta a través de su dueño.
La brecha con los modelos cerrados ya casi no existe
Durante 2024 la conversación era «los modelos abiertos van dos años atrás». Ya no. En tareas del día a día —resumir un texto, clasificar un correo, redactar una respuesta estándar— los modelos abiertos de 2026 rinden prácticamente igual que los modelos de pago más caros. La diferencia real hoy no está en qué tan bien piensan, está en cuánto cuesta cada consulta.
Y ahí la diferencia es enorme. La versión Flash de DeepSeek cobra 0,14 dólares por millón de tokens de entrada y 0,28 de salida. El Gemini 3.6 Flash de Google, que es un modelo cerrado y el caballo de batalla de la casa, cobra 1,50 y 7,50 por lo mismo: diez veces más a la entrada y veintisiete a la salida. Los dos hacen bien las tareas normales de un negocio.
Qué hay disponible hoy (8 de agosto de 2026)
Este terreno se mueve rápido, así que conviene fechar lo que se dice. A la fecha de esta actualización, lo que está publicado y se puede descargar:
- DeepSeek-V4, desde el 24 de abril de 2026, en dos versiones —Pro y Flash— con licencia MIT y los pesos en Hugging Face. La Pro tiene 1,6 billones de parámetros pero solo activa unos 49.000 millones por consulta, que es lo que la hace barata de operar. La Flash es mucho más pequeña —284.000 millones de parámetros, 13.000 activos— y cuesta 0,14 dólares por millón de tokens de entrada frente a los 0,435 de la Pro.
- Qwen 3.8-Max, de Alibaba, anunciado el 3 de agosto de 2026: 2,4 billones de parámetros y un contexto de un millón de tokens. Es la primera vez que Alibaba promete abrir los pesos de un modelo de su gama Max, junto con un Qwen3.8-27B mucho más pequeño que es el que de verdad se puede instalar en un servidor propio. Con una advertencia importante: cuando se escribe esto los pesos todavía no están publicados —Alibaba los anunció para la semana del 10 de agosto—, así que por ahora Qwen 3.8-Max solo se usa pagando su API, a 2 dólares el millón de tokens de entrada y 6 el de salida.
- Laguna S 2.1, de Poolside, publicado el 22 de julio de 2026 con licencia OpenMDW-1.1. Está hecho específicamente para programar: 118.000 millones de parámetros de los que activa 8.000 por token, y un contexto de un millón de tokens, que es lo que permite pasarle un proyecto entero y no un archivo suelto.
El modelo más interesante del verano es el pequeño, no el grande
El 31 de julio DeepSeek publicó una versión reentrenada de la Flash, la V4-Flash-0731. No cambió el diseño ni el tamaño: es el mismo modelo de 284.000 millones de parámetros, reentrenado para tareas de agente y de programación. Y le ganó a la V4-Pro de la propia casa en los nueve bancos de prueba de agentes.
Los números concretos: 82,7 puntos en Terminal Bench 2.1 frente a los 72,1 de la Pro. En DeepSWE pasó de 7,3 a 54,4. El precio no se movió, y para quien ya llamaba a la API no hubo nada que migrar —mismo nombre, misma clave, mismo punto de entrada—. No es que le gane a todo: contra Claude Opus 4.8 pierde en los nueve, por 5,7 puntos de media.
Eso es lo que hace interesante el caso, y por qué no se suele contar así. Durante dos años el argumento fue «modelo más grande, mejor resultado». Aquí el modelo cinco veces más pequeño y tres veces más barato de su propia empresa le pasó por encima al grande sin añadir un solo parámetro, solo con mejor entrenamiento posterior. Si el tamaño ya no predice el resultado, elegir «el más grande que me alcance» dejó de ser una estrategia.
Si vas a probar solo uno para tareas de texto de tu negocio, empieza por el más pequeño de la familia Qwen: es el que más fácil corre sin infraestructura. Si lo que quieres es que te ayude a programar, Laguna S 2.1 y la V4-Flash son los dos que están pensados para eso.
Un millón de tokens no es una cifra abstracta: es, aproximadamente, unas 700.000 palabras. Suficiente para clasificar miles de correos de soporte o generar cientos de primeras respuestas a clientes. Que eso cueste centavos en vez de dólares cambia qué tareas se vuelven rentables automatizar.
Quién está usando esto realmente
DeepSeek, en particular, se adoptó fuerte en el sudeste asiático y en África: mercados donde el soporte a varios idiomas, la posibilidad de instalarlo localmente y el costo importan más que tener la marca más conocida. Es la misma lógica que le aplica a cualquier negocio en Latinoamérica que factura en pesos o soles y paga la IA en dólares.
Qwen, del lado chino de Alibaba, se volvió una referencia para quien necesita atender a clientes en varios idiomas sin pagar de más: las versiones que ya tienen los pesos publicados salen con licencia Apache 2.0, que permite uso comercial sin regalías, algo que no todos los modelos ofrecen. Llama, de Meta, sigue siendo el modelo abierto más desplegado dentro de empresas grandes, justamente porque llegó primero y el ecosistema de herramientas alrededor ya está maduro.
Lo que estos nombres no significan para ti: no hace falta que sepas cuál es "mejor" en abstracto, igual que no necesitas saber qué procesador tiene tu laptop para usarla. Lo que importa es que la herramienta que uses —un chatbot de soporte, un asistente de redacción, un buscador interno— probablemente corre sobre uno de estos modelos por debajo, sin que la marca que te lo vende te lo diga.
¿Debería tu negocio instalar uno de estos modelos?
Casi seguro que no directamente. Autoalojar un modelo abierto —tenerlo corriendo en tu propio servidor— exige comprar o rentar tarjetas gráficas costosas y a alguien que las mantenga. Eso solo compensa cuando el volumen de consultas es altísimo y constante, algo que aplica a pocas empresas medianas y a casi ninguna pyme.
El hardware necesario bajó mucho desde que se escribió esto: con Qwen3.8-27B ya cabe un modelo bueno en una tarjeta de consumo. La conclusión, sin embargo, no cambia — hicimos la cuenta con nuestro propio consumo y el punto de equilibrio está alrededor de quinientos mensajes diarios.
Lo que sí aplica es que muchos proveedores —incluidos algunos que quizás ya usas sin saberlo— ofrecen estos mismos modelos abiertos servidos por API, sin que tengas que administrar nada. El ahorro de costo por token se mantiene, la complejidad de infraestructura desaparece. Es la diferencia entre construir tu propia planta eléctrica y simplemente pagar una tarifa más barata en el recibo de la luz.
Dónde se nota esto en la práctica
Un negocio con presencia digital normal —una web, un correo de soporte, redes sociales— tiene tres puntos donde esto ya está entrando, lo pida o no. El primero es el soporte al cliente: clasificar y responder las preguntas repetidas de siempre ("¿tienen envío a domicilio?", "¿cuál es el horario?") es exactamente el tipo de tarea donde un modelo barato rinde igual que uno caro.
El segundo es la redacción de primeras versiones: descripciones de producto, respuestas a reseñas, borradores de publicaciones. El tercero, más silencioso, es la búsqueda interna: poder preguntarle a tus propios documentos —catálogos, políticas, contratos— en vez de buscarlos a mano. Ninguno de los tres necesita el modelo más caro del mercado.
Lo que sí conviene revisar antes de meterse
La licencia importa más de lo que parece. MIT y Apache 2.0 —las que usan DeepSeek y Qwen respectivamente— permiten uso comercial libre. Otros modelos abiertos traen condiciones más restrictivas sobre cuántos usuarios puedes tener antes de necesitar un acuerdo comercial aparte. Vale la pena que quien te instale la herramienta te confirme bajo qué licencia corre lo que estás usando, no solo el nombre de marketing.
También importa dónde se procesan los datos. Un modelo servido desde un proveedor con infraestructura en otro continente implica que la información de tus clientes viaja hasta allá y vuelve. Para la mayoría de negocios no es un problema; para quien maneja datos sensibles — salud, finanzas, datos de menores— sí es una pregunta que hay que hacer antes, no después.
La conclusión incómoda es que la ventaja ya no está en usar IA —eso lo está haciendo todo el mundo— sino en usar la IA correcta para cada tarea, sin pagar precio de modelo de punta por un trabajo que un modelo cinco veces más barato resuelve igual de bien. Esperar a que «se ponga más barato todavía» casi nunca compensa: el costo ya bajó lo suficiente como para empezar hoy con algo pequeño y medible.
Y una advertencia sobre el precio, que es lo que más se compara y lo que menos decide: el costo por token es la mitad de la cuenta. La otra mitad es cuántos tokens necesita cada modelo para terminar el trabajo, y ahí las diferencias son mayores que en el precio. Está con números en cuánto cuesta de verdad una tarea con IA.
Si tu web o tu proceso de atención a clientes todavía dependen de revisar todo a mano, en nuestro Diagnóstico Digital revisamos gratis en qué punto concreto valdría la pena meter algo de esto, sin venderte el paquete más caro que exista.