Saltar al contenido
Aback Tools Logo

Calculadora de costes de entrenamiento

Estima los gastos de entrenamiento de modelos con GPU, épocas y tamaños de conjunto de datos, gratis y 100 % privado en tu navegador. Usa la fórmula FLOP estándar del sector Chinchilla 6ND con utilización de FLOP del modelo configurable. Compara fine-tuning completo, LoRA y QLoRA en más de 12 instancias en la nube de AWS, GCP, Azure, Lambda Labs, RunPod y Vast.ai. Obtén el coste total de entrenamiento, el tiempo en reloj de pared, los tokens por segundo y una comparativa de proveedores ordenada.

Training Cost Calculator

Estimate model training expenses using the Chinchilla FLOP formula. Configure model size, dataset tokens, epochs, GPU cluster, and training type (full fine-tune, LoRA, QLoRA) - then compare costs across cloud providers. All calculations run locally in your browser.

7B model fine-tune on 1B tokens - single 8× A100 node

Training Type

Model & Dataset

B params
B tokens
epochs

Effective Tokens

1.0B

dataset × epochs

GPU Cluster

GPU: NVIDIA A100 40 GBVRAM: 40 GBFP16: 312 TFLOPSOn-Demand: $32.77/hrSpot: $11.47/hr
GPUs
40%
10%70%

Additional Costs

$
$
%

Estimated Total Training Cost

$510.3711.7 hrs wall-clock

Compute Cost

$382.93

Overhead

$57.44

Storage + Network

$70.00

GPU Hours

93

Cheapest option: Vast.ai 1× RTX 4090 (avg) - $35.57 (saves $404.79)

Wall-Clock Time

11.7 hrs

11.7 hrs total

Tokens / Second

23,771

across 8 GPUs

Cost / Billion Tokens

$440.37

compute only

Training Computation Summary

Model Size7B params
Dataset (effective)1.0B tokens
Training TypeFull Fine-Tune
Total FLOPs42.00 EFLOPs
Cluster8× NVIDIA A100 40 GB
Instances1 × p4d.24xlarge (8× A100)
MFU40%
Spot / PreemptibleNo
Effective $/hr$32.77/instance/hr
Instance Hours11.7 hrs

Cloud Instance Comparison

Same GPU count as selected, sorted cheapest first
InstanceWall-ClockCompute CostTotal
Vast.ai1× RTX 4090 (avg)
NVIDIA RTX 4090
3.7 days$30.93$35.57
Lambda Labs8× H100 SXM
NVIDIA H100 SXM
1.8 hrs$49.37$56.78
RunPod1× H100 SXM
NVIDIA H100 SXM
14.7 hrs$51.44$59.15
Vast.ai1× A100 80 GB (avg)
NVIDIA A100 80 GB
3.9 days$130.88$150.51
RunPod1× A100 80 GB
NVIDIA A100 80 GB
3.9 days$153.31$176.31
AWSp5.48xlarge (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
GCPa3-highgpu-8g (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureND H100 v5 (8× H100)
NVIDIA H100 SXM
1.8 hrs$181.13$208.30
AzureNC A100 v4 (1× A100)
NVIDIA A100 80 GB
3.9 days$343.08$394.54
AWSp4d.24xlarge (8× A100) Selected
NVIDIA A100 40 GB
11.7 hrs$382.93$440.37

* Comparison uses each instance's native GPU count. On-demand pricing unless Spot is enabled. Storage and networking not included.

Disclaimer: Training cost estimates use the Chinchilla 6ND FLOPs approximation and may differ from actual results depending on architecture-specific overheads, communication patterns, optimizer choice, and hardware-specific MFU. Cloud prices are approximate and change frequently - verify with provider pricing pages. All calculations run locally in your browser; no data is sent to any server.

Cómo se estima el cómputo de entrenamiento

El punto de partida es la fórmula Chinchilla 6ND: FLOP = 6 × parámetros × tokens de entrenamiento. De ahí se derivan tiempo y coste.

La MFU es el factor de corrección clave: convierte los FLOP teóricos en tiempo real aprovechando solo una fracción del pico de la GPU.

  • FLOP = 6 × parámetros del modelo × tokens de entrenamiento.
  • Tiempo = FLOP ÷ (TFLOPS de pico × MFU × número de GPU).
  • Coste = tiempo × precio por hora de la instancia.

Fine-tuning completo frente a LoRA y QLoRA

El ajuste completo actualiza todos los pesos y exige mucha memoria y cómputo. LoRA y QLoRA entrenan una fracción mínima de parámetros y reducen drásticamente el coste.

  • Fine-tuning completo: máxima calidad, máximo coste.
  • LoRA: entrena matrices adaptadoras, coste mucho menor.
  • QLoRA: cuantiza la base y reduce además la VRAM necesaria.

Elegir instancia y modo de pago

Compara proveedores y tipos de instancia antes de lanzar el trabajo. La diferencia de precio por hora entre proveedores puede ser enorme para el mismo entrenamiento.

  1. Define tamaño de modelo, tokens de entrenamiento y tipo de ajuste.
  2. Elige el clúster de GPU y una MFU realista.
  3. Compara el coste total entre proveedores e instancias.
  4. Valora spot si puedes tolerar interrupciones con checkpoints frecuentes.

Preguntas frecuentes

Estima el gasto total de cómputo de entrenar o ajustar un modelo de aprendizaje automático. Usa la fórmula FLOP de Chinchilla 6ND (FLOP = 6 × parámetros del modelo × tokens de entrenamiento), combinada con las especificaciones del clúster de GPU y la utilización de FLOP del modelo, para estimar el tiempo y el coste total de cómputo en la nube.

La ley de escalado Chinchilla (Hoffmann et al., 2022) estableció que entrenar un transformer requiere aproximadamente 6 × N × D FLOP, donde N es el número de parámetros y D el número de tokens de entrenamiento. La fórmula cubre la pasada forward (2ND FLOP) y la backward (4ND FLOP para calcular y aplicar gradientes). Es la base estándar de cualquier calculadora seria de coste de entrenamiento.

La MFU es la fracción del TFLOPS máximo teórico de la GPU que un entrenamiento alcanza realmente. Una ejecución perfectamente optimizada en H100 llega a un 50-55 % de MFU. Las ejecuciones de producción con comunicación multinodo suelen lograr un 40-50 %. Las mal optimizadas o limitadas por memoria pueden caer al 25-35 %. Para una estimación conservadora usa 35-40 %; con FlashAttention y pipelines de datos eficientes, el 45-50 % es realista.

A escala óptima de Chinchilla (7B parámetros × ~140B tokens), usando 8× A100 80GB en Lambda Labs (~10,32 $/h por nodo): FLOP ≈ 6 × 7e9 × 140e9 ≈ 5,88e21 FLOP. Con un 40 % de MFU en 8× A100 (312 TFLOPS cada una): tiempo ≈ 165 horas → coste ≈ 1 700 $. Con instancias spot de AWS, baja a ~600 $. Esta calculadora genera esas estimaciones automáticamente.

LoRA (Low-Rank Adaptation) congela los pesos base y añade pequeñas matrices adaptadoras entrenables. Como solo el 0,1-5 % de los parámetros tienen gradientes, los FLOP de la pasada backward caen drásticamente. Para un modelo de 7B con un 1 % de parámetros entrenables sobre 500M de tokens, los FLOP efectivos de LoRA son aproximadamente 1/50 de los del fine-tuning completo, reduciendo el tiempo de días a horas en una sola A100.

Las instancias spot ahorran un 55-70 % pero pueden ser interrumpidas por el proveedor. Son adecuadas para trabajos con checkpointing frecuente (cada 30-60 minutos) y lógica de reinicio. Para entrenamientos críticos con plazos ajustados, bajo demanda es más seguro. Para experimentos con presupuesto ajustado y ajustes de menos de 24 horas, las spot suelen dar mejor retorno y merecen el riesgo.

Sí. La calculadora funciona 100 % en tu navegador. El tamaño del modelo, los parámetros del conjunto de datos, las configuraciones de GPU y todas las proyecciones de coste se calculan localmente en tu dispositivo y nunca se envían a ningún servidor. No requiere cuenta ni registro y no se conserva ningún dato. Los datos de tu planificación de entrenamiento permanecen totalmente privados.

Son direccionalmente precisas para planificar. Los costes reales dependen de la MFU alcanzada (que varía según arquitectura, longitud de secuencia, tamaño de lote y topología de comunicación), la disponibilidad spot del proveedor, la sobrecarga de checkpoints y los reinicios por fallos. Para una estimación más ajustada, ejecuta un piloto corto (1 000 pasos), mide la MFU real y los tokens por segundo y extrapola. La calculadora permite introducir tu MFU medida.