Inteligencia Artificial2026-08-24•6 min de lectura

58 modelos de IA gratis: los probé y esto es lo que nadie te cuenta

NVIDIA tiene una plataforma donde puedes usar decenas de modelos de IA gratis. Los medí con una tarea real de una de mis apps y te cuento lo que pasa cuando los pruebas de verdad.

RFP
Rocío F. PeralDesarrolladora Full-Stack & Especialista en IA
Mapa visual con más de 58 modelos de Inteligencia Artificial disponibles en la plataforma NVIDIA Build
Mapa visual con más de 58 modelos de Inteligencia Artificial disponibles en la plataforma NVIDIA Build

NVIDIA tiene una plataforma donde puedes usar decenas de modelos de IA gratis. DeepSeek, GLM, MiniMax, Llama, Gemma, Nemotron, GPT-OSS. Sin tarjeta, sin contador de días de prueba, con tu propia API key.

Eso ya lo sabrás si has pasado por LinkedIn esta semana.

Lo que no vas a leer en esos posts es lo que pasa cuando los pruebas de verdad. Yo los medí con una tarea real de una de mis apps. Aquí está el script para que lo hagas tú, y los números que me salieron a mí.

Aviso antes de empezar: los modelos que menciono son los de hoy, 24 de agosto de 2026. Cuando leas esto habrán cambiado. Esa volatilidad no es un detalle molesto del artículo, es media tesis del artículo.

Lo básico, rápido

NVIDIA Build (build.nvidia.com) aloja modelos de IA en su propia infraestructura y te deja usarlos gratis a través de una API.

La clave técnica está en un detalle que suena aburrido y no lo es: la API usa el mismo formato que la de OpenAI. Cualquier código o herramienta que ya sepa hablar con OpenAI habla con NVIDIA cambiando dos cosas. La URL base y la clave.

Probar un modelo nuevo cuesta cambiar una cadena de texto. Cinco segundos. Sin refactorizar nada.

Y un matiz que conviene tener claro: de esos 58 modelos gratuitos, unos 25 sirven para trabajar con texto. El resto son de embeddings, reconocimiento de voz, OCR, texto a voz, vídeo, detección de contenido inseguro y estructuras de proteínas. Cuando alguien dice «58 modelos de chat gratis», no ha mirado el catálogo.

Montarlo:

1
Cuenta gratuita en build.nvidia.com y verificas el email.
2
Generas tu clave en build.nvidia.com/settings/api-keys. Empieza por nvapi- y solo se ve una vez, así que cópiala en ese momento.
3
Instalas la librería. Es la de OpenAI, sí, aunque vayas a llamar a NVIDIA: pip install openai.

Si estás en Windows y python te da errores raros, usa py: py -m pip install openai. A mí me pasa por tener tres instalaciones de Python solapadas.

Compruebas que la clave funciona:

bashTerminal Output
curl integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer nvapi-TU-CLAVE" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "meta/llama-3.3-70b-instruct",
    "messages": [{"role": "user", "content": "Hola"}]
  }'

Por qué "el mejor modelo" no existe

Cuando alguien pregunta cuál es el mejor modelo, la respuesta honesta es incómoda: depende de tu tarea, y probablemente no coincide con la mía.

Te pongo un caso real. En Voltio, mi app de entrenamiento, hay una función donde el usuario sube su rutina como puede: un Excel, un PDF que le pasó su entrenador, una foto del papel del gimnasio, o texto pegado de un WhatsApp. La IA tiene que sacar de ahí una estructura limpia. Ejercicios, series, repeticiones, RIR.

Esa tarea castiga cosas muy concretas. Necesita leer contexto desordenado sin inventarse datos, devolver JSON válido siempre, y no cambiarme el nombre de un ejercicio por otro parecido. Un modelo puede ser una bestia razonando matemáticas y fallarme aquí.

Los benchmarks públicos miden tareas que no son la mía. Y las tuyas tampoco.

El script

Cópialo en un archivo probar.py, cambia el texto de TAREA por lo tuyo y ejecútalo con py probar.py. No hace falta que entiendas cada línea.

pythonTerminal Output
import os, json, time
from openai import OpenAI

client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key=os.environ["NVIDIA_API_KEY"],
)

# --- LO UNICO QUE TIENES QUE CAMBIAR: tu tarea real -----------------
TAREA = """Extrae la rutina de este texto y devuelve solo JSON valido
con esta forma: [{"ejercicio": "", "series": 0, "reps": "", "rir": 0}]

Texto: Lunes pecho. Press banca 4x8 dejando 2 en recamara,
aperturas 3x12 rir 1, fondos 3 al fallo."""

CANDIDATOS = [
    "deepseek-ai/deepseek-v4-flash-0731",
    "z-ai/glm-5.2",
    "minimaxai/minimax-m3",
    "nvidia/nemotron-3.5-lightning-30b-a3b",
    "meta/llama-3.3-70b-instruct",
]
# --------------------------------------------------------------------

vivos = {m.id for m in client.models.list()}

for modelo in CANDIDATOS:
    if modelo not in vivos:
        print(modelo + " -> ya no esta en el catalogo, lo salto")
        continue

    inicio = time.time()
    try:
        r = client.chat.completions.create(
            model=modelo,
            messages=[{"role": "user", "content": TAREA}],
            temperature=0.1,
            timeout=45,
        )
    except Exception as e:
        print(modelo + " -> " + str(e)[:100])
        continue

    salida = r.choices[0].message.content
    segundos = round(time.time() - inicio, 2)

    try:
        json.loads(salida.strip())
        veredicto = "JSON limpio"
    except Exception:
        veredicto = "hay que limpiarlo antes de parsearlo"

    print(modelo + "  |  " + str(segundos) + "s  |  " + veredicto)
    time.sleep(2)   # el tramo gratuito limita las peticiones

Fíjate en la línea de vivos. Antes de llamar a nada, el script pregunta qué modelos existen y se salta los que ya no. Esa línea te ahorra el 404 que te vas a comer si copias identificadores de cualquier lista, incluida la mía.

La clave no la escribas dentro del archivo. En PowerShell, antes de ejecutar:

powershellTerminal Output
$env:NVIDIA_API_KEY = "nvapi-tu-clave"
py probar.py

Lo que me salió a mí

Aquí es donde este artículo se separa del resto. Tres modelos, tres intentos cada uno, mi tarea real de Voltio:

ModeloResultadoTiempo
deepseek-ai/deepseek-v4-flash-0731no llegó a respondermás de 70s
minimaxai/minimax-m3bloqueado por límite de peticiones—
nvidia/nemotron-3.5-lightning-30b-a3b3 de 3 correctas21,78s de media

Léelo otra vez. Un modelo no contestó en más de setenta segundos. Otro me bloqueó a los pocos intentos. Y el que sí funcionó, que se llama Lightning y es el rápido de su familia, tardó casi veintidós segundos de media, con un pico de veinticinco y ocho.

Para comparar: la misma tarea contra un modelo de pago se resuelve en dos o tres segundos.

No es que los modelos sean malos. Es que el tramo gratuito está saturado. Estás en una cola, compartiendo GPU con todo el que ha leído el mismo post que tú.

Eso cambia para qué sirve esto. No es una alternativa barata a un modelo de pago. Es un banco de pruebas para saber si tu tarea es viable antes de gastarte un euro. Que no es poco, pero es otra cosa.

Las tres preguntas antes de elegir candidatos

¿Cuánto texto va a tragar de una vez? Si vas a meterle documentos largos o un histórico grande, necesitas ventana de contexto amplia. La familia Nemotron 3 (nano, super, ultra) llega al millón de tokens y está en el tramo gratuito. Si tus prompts son cortos, esto no te importa nada.

¿Tiene que usar herramientas o solo escribir? No es lo mismo pedirle un texto que pedirle que llame a tu API, procese la respuesta y decida el siguiente paso. Eso se llama function calling. Mistral Nemotron está pensado para eso, y GLM-5.2 está afinado para encadenar pasos sin perderse.

¿Qué duele más si falla, la lentitud o el error? Después de la tabla de arriba, esta pregunta ya no es teórica.

La letra pequeña

El catálogo cambia, y más rápido de lo que parece. Tengo dos pruebas de esta misma semana. La primera: escribí este artículo con tres modelos de ejemplo y, al ejecutar el script, uno me devolvió un 410 —fin de vida, fecha 12 de mayo de 2026— y los otros dos un 404, porque el identificador ya no existía. Tres de tres. La segunda: al filtrar el catálogo por gratuitos, seis de los 58 llevaban la etiqueta «Deprecation in 1d». Un día. Ahí, a la vista, en la misma lista de la que iba a copiar los identificadores.

No todos los modelos están disponibles desde España. Al abrir un modelo de visión me salió un cartel: This NIM is unavailable in your location. Sin más explicación. Si estás fuera de Estados Unidos, cuenta con que parte del catálogo no es para ti.

Unas 40 peticiones por minuto. Suficiente para trabajar tú. Insuficiente para un proceso automatizado o para agentes que disparan varias llamadas a la vez.

No hay acuerdo de nivel de servicio. Para prototipar y aprender, perfecto. Para el backend de una app con usuarios reales pagando, no.

No hay fine-tuning. Usas el modelo tal cual está publicado.

Y no, NVIDIA no hace esto por amor al arte. Es la puerta de entrada a NVIDIA AI Enterprise, su producto de pago. Prototipas gratis, y cuando el proyecto crece te esperan ahí. Me parece un trato razonable mientras lo sepas.

Cómo lo uso yo

No he sustituido nada con esto. Sigo usando la API de Anthropic en lo que está en producción, porque necesito fiabilidad y no me la juego.

Lo que sí ha cambiado es la fase de antes. Cuando llega una función nueva y no tengo claro si un modelo puede resolverla, monto el script con la tarea concreta, lanzo cuatro o cinco y miro los resultados. Cuesta diez minutos y cero euros.

A veces descubro que la tarea es más difícil de lo que pensaba. Otras confirmo que compensa el modelo de pago. Las dos respuestas valen. La diferencia es que ahora la tengo medida en vez de intuida.

Eso es lo que me llevo de NVIDIA Build. No es que sea gratis. Es que puedo equivocarme barato antes de decidir.

Si estás integrando IA en algo y no tienes claro por dónde tirar, escríbeme y lo vemos.

quizPreguntas Frecuentes (FAQ)

Preguntas Frecuentes

❓¿Qué es NVIDIA Build?

Es la plataforma de NVIDIA (build.nvidia.com) que permite probar y evaluar más de 58 modelos de Inteligencia Artificial (DeepSeek, Llama 3.3, GLM-5.2, MiniMax-M3, Nemotron 3.5) de forma gratuita mediante una API compatible con la especificación de OpenAI.

❓¿Es realmente gratis usar la API de NVIDIA Build?

Sí, ofrece créditos y acceso gratuito sin requerir tarjeta de crédito. Está pensado para pruebas, prototipado y evaluación técnica, con un límite aproximado de 40 peticiones por minuto.

❓¿Se puede usar la API de NVIDIA para producción?

No es recomendable para producción crítica, ya que no ofrece acuerdo de nivel de servicio (SLA), los modelos del catálogo pueden retirarse con poco aviso y el tramo gratuito sufre saturación por colas de procesamiento.

❓¿Por qué algunos modelos fallan o responden despacio?

El tramo gratuito está compartido entre miles de usuarios, lo que provoca tiempos de respuesta más altos (hasta 20s-70s) y bloqueos por límites de frecuencia o saturación de GPUs.

RFP

Sobre la autora: Rocío F. Peral

Desarrolladora Full-Stack especializada en integrar IA (API de Anthropic Claude), PHP 8.3, MySQL y React en productos digitales reales. Más de 14 años liderando centros de formación y creando soluciones tecnológicas.

¿Tienes un proyecto en mente?

Cuéntame tu idea y diseñemos la arquitectura ideal para tu software o integración de IA.

Iniciar proyectoarrow_forward