¿Debe comprar una GPU y autoalojar un LLM de código abierto, o simplemente seguir pagando por token mediante una API? Depende del volumen. Ingrese su uso mensual y su hardware, y esta calculadora le mostrará el punto de equilibrio: el momento en que poseer la GPU resulta más económico que la factura de la API.
Su uso
Su sistema de autohospedaje
| Costo de la API (su volumen) | — |
| Costo de autohospedaje (GPU amortizada) | — |
| Costo de autohospedaje (electricidad) | — |
| Costo total de autohospedaje por mes | — |
Ejecuciones de autohospedaje modelos de código abierto (pesos gratuitos), por lo que esta comparación enfrenta el costo por token de la API con la posesión de hardware. Supone que su GPU puede manejar dicho volumen (una sola GPU tiene un límite máximo de tokens/segundo) y omite el tiempo dedicado a la configuración y mantenimiento. Consulte qué modelos puede ejecutar realmente una GPU en nuestra Calculadora de VRAM, y los precios actuales de las APIs en la calculadora de costos.
Recuerde: la autohospedación implica ejecuciones modelos de código abierto, así que tenga en cuenta la diferencia de calidad frente a una API de vanguardia — y utilice nuestra Calculadora de VRAM para confirmar que su GPU puede ejecutar realmente el modelo que desea.
Respuesta rápida: ¿Es más barato alojar un LLM de forma local o usar una API?
Depende casi por completo de su volumen mensual sostenido de tokens. Para la mayoría de los usuarios, una API alojada es más barata: por debajo de aproximadamente 50 millones de tokens al mes, el precio por token supera el costo de comprar y ejecutar una GPU. El autoalojamiento solo resulta rentable con volúmenes altos y constantes —típicamente decenas o cientos de millones de tokens al mes para alimentar agentes, trabajos por lotes o a todo un equipo—, donde una GPU de propiedad propia, bien aprovechada, amortiza su costo inicial frente a una inferencia efectivamente ilimitada. El punto de equilibrio es un rango, no una línea fija: varía según el tamaño del modelo, la categoría de la GPU, el precio de la electricidad y, sobre todo, el grado de utilización de la tarjeta.
- Bajo volumen (menos de ~50 millones de tokens/mes): la API gana casi siempre.
- Zona de decisión (~50–500 millones de tokens/mes): una verdadera moneda al aire, pero solo merece la pena autoalojar si dispone de tiempo de ingeniería dedicado para gestionarlo.
- Alto volumen sostenido (agentes, procesamiento por lotes o todo un equipo, 500 millones+ de tokens/mes): una GPU de propiedad propia bien aprovechada puede reducir el costo de inferencia hasta en un ~5×.
- Una GPU solo se paga a sí misma si se mantiene ocupada: una tarjeta inactiva sigue generando su costo total de inversión inicial y consumo eléctrico.
- Las APIs «flash» de bajo presupuesto o con modelos pequeños son tan económicas que rara vez justifican el autoalojamiento, independientemente del volumen.
Preguntas frecuentes
¿Cuándo se paga a sí misma una GPU local?
Una GPU se paga a sí misma cuando sus gastos mensuales sostenidos en una API equivalente para un modelo abierto superan sistemáticamente el costo total de poseerla. Una GPU de consumo de aproximadamente 2.000–2.500 USD repartida durante tres años equivale a unos 55–70 USD mensuales, más 30–60 USD en electricidad; así, poseerla cuesta aproximadamente 85–130 USD mensuales en total. Si sus gastos comparables en API permanecen por debajo de esa cifra, la API es más barata; una vez que superan claramente ese umbral —del orden de varios cientos de dólares al mes—, la tarjeta recupera su costo inicial de 2.000–2.500 USD en aproximadamente un año y comienza a ahorrar dinero a partir de entonces.
¿Cuánta VRAM necesito para ejecutar un LLM localmente?
Con cuantización de 4 bits, calcule aproximadamente 0,5–0,6 GB de VRAM por mil millones de parámetros, más espacio adicional para la caché KV, que crece con la longitud del contexto. En la práctica, un modelo de 7B necesita unos 8 GB, uno de 13B requiere 12–16 GB y un modelo de 70B en 4 bits necesita aproximadamente 40–48 GB. Esto significa que un modelo de 7–13B cabe en una sola tarjeta de 8–16 GB, pero un modelo de 70B en 4 bits es demasiado grande para cualquier GPU de consumo individual —ni siquiera una tarjeta de 32 GB es suficiente—, por lo que se requieren dos tarjetas de 24 GB, una tarjeta de estación de trabajo de 48 GB o un modelo más pequeño y cuantizado de forma más agresiva.
¿Cuáles son los costos ocultos del autoalojamiento de un LLM?
El precio de la GPU es solo una parte: una vez que se suman la electricidad, la refrigeración y, especialmente, el tiempo de ingeniería, el autoalojamiento suele costar entre 3 y 5 veces la cifra bruta de alquiler de la GPU. Planifique entre 10 y 20 horas mensuales para configuración, supervisión y mantenimiento; ese esfuerzo laboral, junto con el costo de una tarjeta inactiva entre tareas, es lo que hace fracasar la mayoría de las estimaciones ingenuas de punto de equilibrio.
¿El tamaño del modelo cambia el punto de equilibrio?
Sí. Los modelos más grandes requieren GPUs más potentes o más caras, lo que eleva la inversión inicial que debe amortizarse, pero también tienen los precios por token más altos en las APIs, lo que desplaza el punto de equilibrio hacia volúmenes menores. Un modelo pequeño de 7–13B es barato de autoalojar, pero también lo es mediante API, por lo que normalmente ganan las APIs; un modelo abierto de 70B o superior es donde una GPU de propiedad propia, bien aprovechada, tiende a ofrecer los mayores ahorros.
¿Hace la electricidad demasiado cara el autoalojamiento?
Normalmente no: la energía es un ítem secundario frente al hardware. Una sola GPU de escritorio funcionando a plena carga consume aproximadamente 400–600 W, lo que, a tarifas eléctricas típicas, supone solo unos 30–60 USD mensuales si opera de forma continua. El costo dominante del autoalojamiento es la inversión inicial en hardware y el tiempo de ingeniería necesario para operarlo, no la electricidad.
¿Debe un pequeño equipo o una startup autoalojar o usar una API?
Empiece con una API. Hasta que tenga un volumen alto y predecible y alguien encargado de gestionar la infraestructura, el precio por token es más barato, permite lanzar productos más rápido y no implica riesgo inicial. El autoalojamiento merece reconsiderarse únicamente cuando su factura mensual es alta y estable —normalmente una vez que supera consistentemente los decenas de millones de tokens al mes con un modelo abierto comparable.
Más herramientas gratuitas de Convly
Obtén los datos antes que nadie
Un correo electrónico semanal: qué modelos de IA cambiaron de precio, qué midieron realmente las nuevas pruebas de rendimiento y qué GPU vale la pena comprar. Sin sensacionalismo, sin relleno.
Gratis. Cancela tu suscripción con un solo clic. Nunca vendemos ni compartimos tu dirección.
