Calculadora de costes de entrenamiento
Estima los gastos de entrenamiento de modelos con GPU, épocas y tamaños de conjunto de datos, gratis y 100 % privado en tu navegador. Usa la fórmula FLOP estándar del sector Chinchilla 6ND con utilización de FLOP del modelo configurable. Compara fine-tuning completo, LoRA y QLoRA en más de 12 instancias en la nube de AWS, GCP, Azure, Lambda Labs, RunPod y Vast.ai. Obtén el coste total de entrenamiento, el tiempo en reloj de pared, los tokens por segundo y una comparativa de proveedores ordenada.
Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.
7B model fine-tune on 1B tokens - single 8× A100 node
Training Type
Model & Dataset
Effective Tokens
1.0B
dataset × epochs
GPU Cluster
Additional Costs
Estimated Total Training Cost
Compute Cost
$382.93
Overhead
$57.44
Storage + Network
$70.00
GPU Hours
93
Wall-Clock Time
11.7 hrs
11.7 hrs total
Tokens / Second
23,771
across 8 GPUs
Cost / Billion Tokens
$440.37
compute only
Training Computation Summary
Cloud Instance Comparison
Same GPU count as selected, sorted cheapest first| Instance | Wall-Clock | Compute Cost | Total |
|---|---|---|---|
Vast.ai1× RTX 4090 (avg) NVIDIA RTX 4090 | 3.7 days | $30.93 | $35.57 |
Lambda Labs8× H100 SXM NVIDIA H100 SXM | 1.8 hrs | $49.37 | $56.78 |
RunPod1× H100 SXM NVIDIA H100 SXM | 14.7 hrs | $51.44 | $59.15 |
Vast.ai1× A100 80 GB (avg) NVIDIA A100 80 GB | 3.9 days | $130.88 | $150.51 |
RunPod1× A100 80 GB NVIDIA A100 80 GB | 3.9 days | $153.31 | $176.31 |
AWSp5.48xlarge (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
GCPa3-highgpu-8g (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureND H100 v5 (8× H100) NVIDIA H100 SXM | 1.8 hrs | $181.13 | $208.30 |
AzureNC A100 v4 (1× A100) NVIDIA A100 80 GB | 3.9 days | $343.08 | $394.54 |
AWSp4d.24xlarge (8× A100) Selected NVIDIA A100 40 GB | 11.7 hrs | $382.93 | $440.37 |
* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.
Cómo se estima el cómputo de entrenamiento
El punto de partida es la fórmula Chinchilla 6ND: FLOP = 6 × parámetros × tokens de entrenamiento. De ahí se derivan tiempo y coste.
La MFU es el factor de corrección clave: convierte los FLOP teóricos en tiempo real aprovechando solo una fracción del pico de la GPU.
- FLOP = 6 × parámetros del modelo × tokens de entrenamiento.
- Tiempo = FLOP ÷ (TFLOPS de pico × MFU × número de GPU).
- Coste = tiempo × precio por hora de la instancia.
Fine-tuning completo frente a LoRA y QLoRA
El ajuste completo actualiza todos los pesos y exige mucha memoria y cómputo. LoRA y QLoRA entrenan una fracción mínima de parámetros y reducen drásticamente el coste.
- Fine-tuning completo: máxima calidad, máximo coste.
- LoRA: entrena matrices adaptadoras, coste mucho menor.
- QLoRA: cuantiza la base y reduce además la VRAM necesaria.
Elegir instancia y modo de pago
Compara proveedores y tipos de instancia antes de lanzar el trabajo. La diferencia de precio por hora entre proveedores puede ser enorme para el mismo entrenamiento.
- Define tamaño de modelo, tokens de entrenamiento y tipo de ajuste.
- Elige el clúster de GPU y una MFU realista.
- Compara el coste total entre proveedores e instancias.
- Valora spot si puedes tolerar interrupciones con checkpoints frecuentes.
Preguntas frecuentes
Estima el gasto total de cómputo de entrenar o ajustar un modelo de aprendizaje automático. Usa la fórmula FLOP de Chinchilla 6ND (FLOP = 6 × parámetros del modelo × tokens de entrenamiento), combinada con las especificaciones del clúster de GPU y la utilización de FLOP del modelo, para estimar el tiempo y el coste total de cómputo en la nube.
La ley de escalado Chinchilla (Hoffmann et al., 2022) estableció que entrenar un transformer requiere aproximadamente 6 × N × D FLOP, donde N es el número de parámetros y D el número de tokens de entrenamiento. La fórmula cubre la pasada forward (2ND FLOP) y la backward (4ND FLOP para calcular y aplicar gradientes). Es la base estándar de cualquier calculadora seria de coste de entrenamiento.
La MFU es la fracción del TFLOPS máximo teórico de la GPU que un entrenamiento alcanza realmente. Una ejecución perfectamente optimizada en H100 llega a un 50-55 % de MFU. Las ejecuciones de producción con comunicación multinodo suelen lograr un 40-50 %. Las mal optimizadas o limitadas por memoria pueden caer al 25-35 %. Para una estimación conservadora usa 35-40 %; con FlashAttention y pipelines de datos eficientes, el 45-50 % es realista.
A escala óptima de Chinchilla (7B parámetros × ~140B tokens), usando 8× A100 80GB en Lambda Labs (~10,32 $/h por nodo): FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21 FLOP. Con un 40 % de MFU en 8× A100 (312 TFLOPS cada una): tiempo ≈ 165 horas → coste ≈ 1 700 $. Con instancias spot de AWS, baja a ~600 $. Esta calculadora genera esas estimaciones automáticamente.
LoRA (Low-Rank Adaptation) congela los pesos base y añade pequeñas matrices adaptadoras entrenables. Como solo el 0,1-5 % de los parámetros tienen gradientes, los FLOP de la pasada backward caen drásticamente. Para un modelo de 7B con un 1 % de parámetros entrenables sobre 500M de tokens, los FLOP efectivos de LoRA son aproximadamente 1/50 de los del fine-tuning completo, reduciendo el tiempo de días a horas en una sola A100.
Las instancias spot ahorran un 55-70 % pero pueden ser interrumpidas por el proveedor. Son adecuadas para trabajos con checkpointing frecuente (cada 30-60 minutos) y lógica de reinicio. Para entrenamientos críticos con plazos ajustados, bajo demanda es más seguro. Para experimentos con presupuesto ajustado y ajustes de menos de 24 horas, las spot suelen dar mejor retorno y merecen el riesgo.
Sí. La calculadora funciona 100 % en tu navegador. El tamaño del modelo, los parámetros del conjunto de datos, las configuraciones de GPU y todas las proyecciones de coste se calculan localmente en tu dispositivo y nunca se envían a ningún servidor. No requiere cuenta ni registro y no se conserva ningún dato. Los datos de tu planificación de entrenamiento permanecen totalmente privados.
Son direccionalmente precisas para planificar. Los costes reales dependen de la MFU alcanzada (que varía según arquitectura, longitud de secuencia, tamaño de lote y topología de comunicación), la disponibilidad spot del proveedor, la sobrecarga de checkpoints y los reinicios por fallos. Para una estimación más ajustada, ejecuta un piloto corto (1 000 pasos), mide la MFU real y los tokens por segundo y extrapola. La calculadora permite introducir tu MFU medida.