En los artículos anteriores aprendimos dos conceptos fundamentales sobre la inteligencia artificial ejecutada de forma local. Primero, entendimos qué es un modelo de IA, cómo funciona el proceso de inferencia y por qué los parámetros representan el conocimiento adquirido durante el entrenamiento. Posteriormente, analizamos el hardware necesario para ejecutar estos modelos y vimos cómo la CPU, la GPU, la RAM y la VRAM trabajan de manera conjunta para procesar las solicitudes.
Ahora surge una pregunta muy importante: si existen cientos de modelos disponibles, ¿cómo elegir el más adecuado para nuestras necesidades?
La respuesta no consiste simplemente en descargar el modelo más grande que encontremos. Al igual que ocurre con cualquier otra herramienta tecnológica, cada modelo posee fortalezas, limitaciones y requisitos diferentes. Comprender estas diferencias es esencial para construir una plataforma de inteligencia artificial local eficiente, equilibrada y capaz de ofrecer el mejor rendimiento según el hardware disponible.

¿Qué significa que un modelo sea de 7B, 14B o 70B?
Cuando buscamos modelos de inteligencia artificial es muy común encontrar nombres como:
- Qwen 3 8B
- Llama 70B
- DeepSeek 32B

El número que acompaña al nombre del modelo representa, aproximadamente, la cantidad de parámetros con los que fue entrenado.
| Tamaño del modelo | Cantidad aproximada de parámetros |
| 7B | 7 mil millones |
| 14B | 14 mil millones |
| 32B | 32 mil millones |
| 70B | 70 mil millones |
Como vimos en el primer artículo de esta serie, los parámetros son los valores numéricos donde el modelo almacena el conocimiento aprendido durante el entrenamiento.
En términos generales, un mayor número de parámetros permite representar relaciones más complejas entre conceptos, comprender mejor determinados contextos y resolver tareas de mayor dificultad.
Sin embargo, esto no significa que un modelo más grande sea siempre la mejor opción.
Más grande no siempre significa mejor Durante los primeros años del auge de la inteligencia artificial generativa era común pensar que un modelo con más parámetros produciría necesariamente mejores resultados.Hoy sabemos que la realidad es mucho más compleja.
La calidad de un modelo depende de múltiples factores, entre ellos:
- La arquitectura utilizada.
- La calidad de los datos de entrenamiento.
- Las técnicas empleadas durante el entrenamiento.
- Los procesos de ajuste posterior (Fine-Tuning).
- El grado de especialización para determinadas tareas.
Por esta razón, un modelo moderno de tamaño medio puede superar ampliamente a modelos mucho más grandes desarrollados hace apenas unos años. El tamaño continúa siendo un criterio importante, pero ya no es el único factor que determina el rendimiento de un modelo de IA.
La ventana de contexto: una métrica frecuentemente ignorada Cuando conversamos con un modelo de inteligencia artificial, este no analiza únicamente la pregunta que acabamos de escribir.También recibe información adicional como:
- La conversación previa.
- Las instrucciones del sistema.
- Documentos adjuntos.
- Resultados de búsquedas.
- Información proporcionada por otras aplicaciones.

Toda esa información conforma lo que se conoce como contexto. La ventana de contexto determina la cantidad máxima de información que el modelo puede procesar simultáneamente. Los tamaños más habituales son:
- 8K tokens
- 32K tokens
- 128K tokens
- 256K tokens
- 1 millón de tokens o incluso más
Una ventana de contexto amplia permite trabajar con documentos extensos, conversaciones largas o bases de conocimiento completas sin que el modelo pierda información relevante durante el proceso. Para aplicaciones empresariales basadas en documentos, este aspecto suele ser incluso más importante que el número de parámetros.
Tipos de modelos de inteligencia artificial No todos los modelos fueron diseñados para resolver los mismos problemas. Elegir el tipo adecuado es tan importante como seleccionar su tamaño.
Modelos de propósito general Son los asistentes conversacionales tradicionales y representan el mejor punto de partida para la mayoría de los usuarios.
Están optimizados para tareas como:
- Preguntas y respuestas.
- Redacción de textos.
- Elaboración de resúmenes.
- Traducción.
- Asistencia general.
Si estás comenzando en el mundo de la IA local, este tipo de modelos suele ser la mejor elección.
Modelos especializados en programación Estos modelos fueron entrenados utilizando enormes cantidades de código fuente.Sobresalen en tareas como:
- Generación de código.
- Explicación de programas.
- Refactorización.
- Depuración de errores.
- Generación de documentación técnica.
Son especialmente útiles para desarrolladores de software.
Modelos de razonamiento Los modelos de razonamiento incorporan técnicas diseñadas para resolver problemas complejos mediante procesos más estructurados.Normalmente destacan en:
- Matemáticas.
- Lógica.
- Planificación.
- Resolución paso a paso.
- Problemas de análisis.
En muchos casos generan respuestas más elaboradas, aunque también requieren mayor tiempo de procesamiento.
Modelos multimodales Estos modelos pueden trabajar con más de un tipo de información al mismo tiempo.Por ejemplo:
- Texto.
- Imágenes.
- Audio.
- Video.
Gracias a estas capacidades es posible construir asistentes capaces de interpretar fotografías, capturas de pantalla, documentos escaneados e incluso contenido multimedia.
Modelos de Embeddings A diferencia de los anteriores, estos modelos no fueron diseñados para conversar.Su objetivo consiste en transformar la información en vectores numéricos que posteriormente pueden utilizarse para:
- Búsquedas semánticas.
- Sistemas RAG (Retrieval Augmented Generation).
- Clasificación automática de documentos.
- Motores de recomendación.
- Agrupación inteligente de información.
Actualmente constituyen uno de los componentes fundamentales en muchas soluciones empresariales de inteligencia artificial.
Cuantización: ejecutar modelos más grandes utilizando menos hardware Uno de los conceptos más importantes dentro del mundo de la IA local es la cuantización.Recordemos que cada parámetro ocupa espacio en memoria.Si logramos representar esos parámetros utilizando menos bits, podremos reducir considerablemente el consumo de memoria sin modificar el conocimiento aprendido por el modelo.A este proceso se le conoce como cuantización.Gracias a esta técnica, hoy es posible ejecutar modelos que anteriormente solo podían funcionar en costosos servidores con múltiples GPU.
¿Cómo funciona la cuantización? Imaginemos un modelo almacenado originalmente utilizando 16 bits por cada parámetro.Si reducimos esa representación a 8 bits o incluso a 4 bits:
- Disminuye el espacio ocupado.
- Se reduce el consumo de memoria.
- Disminuyen los requisitos de hardware.
- Aumenta la velocidad de carga del modelo.

Aunque existe una pequeña pérdida de precisión, en muchos casos la diferencia es prácticamente imperceptible para tareas de uso general. Por esta razón, la cuantización se ha convertido en una de las tecnologías más importantes para democratizar la ejecución local de modelos de inteligencia artificial.
Formatos de cuantización más comunes Los formatos más utilizados actualmente son los siguientes:
| Formato | Características |
| FP16 | Máxima precisión habitual |
| BF16 | Similar a FP16 con optimizaciones para hardware moderno |
| Q8 | Muy alta calidad con menor consumo de memoria |
| Q6 | Excelente equilibrio entre calidad y rendimiento |
| Q5 | Muy popular para uso general |
| Q4 | Máxima reducción del consumo de memoria |
En la práctica, muchas versiones Q4 ofrecen resultados sorprendentemente buenos y representan la mejor opción para la mayoría de los usuarios que desean ejecutar modelos localmente.
¿Cuánta memoria necesita un modelo? Los requisitos pueden variar dependiendo de la implementación utilizada y del software empleado para ejecutarlo. Sin embargo, la siguiente tabla sirve como una referencia bastante útil.
| Modelo | VRAM aproximada |
| 7B Q4 | 4–6 GB |
| 14B Q4 | 8–10 GB |
| 32B Q4 | 18–24 GB |
| 70B Q4 | 40–48 GB |
Estas cifras son aproximadas, pero permiten estimar rápidamente si una determinada tarjeta gráfica será capaz de ejecutar un modelo específico.
Cómo elegir el modelo adecuado Antes de descargar cualquier modelo conviene responder cuatro preguntas fundamentales.
1. ¿Qué tarea quiero resolver? No todos los modelos sirven para lo mismo.Por ejemplo:
- Conversar.
- Programar.
- Analizar documentos.
- Procesar imágenes.
- Resolver problemas matemáticos.
- Generar contenido.
Elegir un modelo especializado suele producir mejores resultados que utilizar uno de propósito general.
2. ¿Cuánta memoria tengo disponible? La cantidad de VRAM disponible en la tarjeta gráfica suele convertirse en la principal limitación para ejecutar modelos de IA localmente.Conocer este dato evitará descargar modelos que simplemente no podrán ejecutarse en nuestro equipo.
3. ¿Necesito velocidad o precisión? En algunos escenarios puede resultar más conveniente utilizar un modelo pequeño que responda en pocos segundos.En otros casos, especialmente cuando la precisión es crítica, puede justificarse utilizar un modelo más grande aunque el tiempo de respuesta sea mayor.mEncontrar el equilibrio adecuado dependerá del tipo de aplicación que estemos desarrollando.
4. ¿Trabajaré con documentos extensos? Si la respuesta es sí, probablemente la ventana de contexto será un criterio más importante que el número de parámetros.Para aplicaciones que procesan manuales técnicos, contratos, libros o grandes bases documentales, disponer de una ventana de contexto amplia puede marcar una diferencia significativa.
Elegir un modelo de inteligencia artificial implica mucho más que seleccionar el mayor número de parámetros disponible. Aspectos como el tamaño del modelo, la ventana de contexto, el nivel de especialización, la cuantización y los recursos de hardware disponibles influyen directamente en la experiencia final y en el rendimiento obtenido. Comprender estos conceptos permitirá tomar decisiones mucho más acertadas al construir una plataforma de IA local, evitando consumir recursos innecesarios y aprovechando al máximo el hardware disponible.
En el próximo artículo daremos el siguiente paso y responderemos una pregunta fundamental:
¿Qué software necesito para descargar, administrar y ejecutar modelos de inteligencia artificial de forma local?
Analizaremos herramientas como LM Studio, Ollama, llama.cpp y vLLM, explicando sus principales características, ventajas y en qué escenarios conviene utilizar cada una.

