Simulador de compresión de diccionario
Cree un diccionario de compresión personalizado a partir de sus propios datos de muestra, luego comprima una cadena de destino usando ese diccionario y vea cómo se compara con GZIP simple. El simulador de compresión de diccionarios modela cómo funcionan los diccionarios compartidos Brotli y Zstandard, mostrando las frases principales extraídas, los bytes guardados por reemplazo y una comparación de tamaño de cuatro vías. Se ejecuta completamente en su navegador sin necesidad de registrarse.
Dictionary Compression Simulator
Build a custom compression dictionary from sample data, then compress a target string using that dictionary. See how dictionary coding compares to plain GZIP - and how combining both achieves maximum compression. Runs entirely in your browser.
Load an example:
Paste logs, templates, or any repetitive data
Paste new data of the same type as the sample
Dictionary Settings
Longer phrases capture more context but require more sample data. Larger dictionaries improve compression but add overhead.
¿Por qué utilizar nuestro simulador de compresión de diccionarios?
- Creación y compresión de diccionarios instantáneos: pegue datos de muestra y una cadena de destino para crear instantáneamente un diccionario de compresión personalizado y simular la compresión, completamente en su navegador. El simulador de compresión de diccionario extrae las frases principales por bytes guardados y muestra los resultados en segundos sin necesidad de cargarlas en el servidor.
- Simulador de compresión de diccionario seguro en línea: sus datos de muestra y cadenas de destino nunca salen de su dispositivo. El simulador de compresión de diccionario se ejecuta completamente en su navegador: sin cargas de servidor, sin transmisión de datos, 100% privado. Seguro para cargas útiles de API, datos de registro y contenido propietario.
- Comparación de compresión de cuatro vías: el simulador de compresión de diccionario muestra cuatro resultados uno al lado del otro: tamaño original, solo GZIP, solo diccionario y diccionario + GZIP combinados, para que pueda ver exactamente cuánto contribuye cada técnica y si un diccionario compartido vale la pena para sus datos.
- 100% gratis para siempre: el simulador de compresión de diccionario es completamente gratuito, sin registro, sin nivel premium, sin límites de tamaño de datos y sin anuncios. Simule la compresión de diccionario para cargas útiles ilimitadas sin costo alguno, para siempre.
Casos de uso comunes del simulador de compresión de diccionarios
- Planificación de compresión de respuestas de API: pegue una muestra de sus respuestas de API como datos de entrenamiento y una nueva respuesta como objetivo. El simulador de compresión de diccionario muestra cuánto reduciría un diccionario compartido el tamaño del cable en comparación con GZIP simple, fundamental para puntos finales API de alta frecuencia donde la sobrecarga de arranque en frío de GZIP es significativa.
- Análisis de compresión de líneas de registro: utilice líneas de registro históricas como datos de muestra y nuevas entradas de registro como destino. El simulador de compresión de diccionario identifica las frases más repetidas en sus registros (marcas de tiempo, nombres de campos, códigos de estado) y muestra cuánto reduciría un diccionario compartido los costos de almacenamiento de registros.
- Evaluación del diccionario compartido Brotli: evalúe si un diccionario compartido Brotli (compatible con Chrome 117+ a través de la especificación de transporte de diccionario de compresión) beneficiaría a su aplicación web. El simulador de compresión de diccionario modela el mismo enfoque de extracción de frases que utiliza Brotli para su diccionario estático.
- Entrenamiento del diccionario Zstandard: antes de ejecutar zstd --train en su servidor, use el simulador de compresión del diccionario para estimar el beneficio de la compresión y la configuración óptima de longitud de frase para su tipo de datos. Esto le ayuda a decidir si los gastos generales de formación están justificados para su caso de uso.
- Compresión de mensajes WebSocket: para aplicaciones WebSocket que envían muchos mensajes pequeños del mismo esquema, el simulador de compresión de diccionario muestra cuánto reduciría un diccionario compartido el tamaño del mensaje en comparación con GZIP por mensaje, lo cual es especialmente valioso para aplicaciones de chat y fuentes de datos en tiempo real.
- Educación sobre algoritmos de compresión: el simulador de compresión de diccionarios es una excelente herramienta educativa para comprender cómo funciona la codificación de diccionarios LZ77, Brotli y Zstandard. Vea exactamente qué frases se extraen, cuántas sustituciones se realizan y cómo el preprocesamiento del diccionario amplifica la compresión GZIP.
¿Qué es la compresión del diccionario?
La compresión de diccionario es una técnica en la que las subcadenas que aparecen con frecuencia se reemplazan por breves referencias a un diccionario de compresión prediseñado. En lugar de codificar cada carácter individualmente, el compresor dice "use la frase n.º 42 del diccionario", una referencia de 2 bytes que reemplaza una cadena de 20 bytes. Algoritmos como LZ77, Brotli y Zstandard utilizan codificación de diccionario internamente. La idea clave es que un diccionario compartido (preacordado entre el compresor y el descompresor) elimina el problema del arranque en frío que hace que GZIP sea ineficaz para cargas pequeñas. Nuestro simulador de compresión de diccionario modela este proceso utilizando un análisis de frecuencia de n-gramas en sus datos de muestra.
Cómo funciona nuestro simulador de compresión de diccionarios
- 1 Pegue datos de muestra y una cadena de destino: los datos de muestra se utilizan para crear el diccionario; utilice datos representativos del mismo tipo que los que desea comprimir (por ejemplo, respuestas API anteriores, líneas de registro, plantillas HTML). El objetivo es la cadena que desea comprimir. Ambos se procesan íntegramente en su navegador; no se envían datos a ningún servidor.
- 2 Haga clic en "Simular compresión del diccionario": el simulador de compresión del diccionario extrae todos los n-gramas (subcadenas de longitud configurable) de los datos de muestra, cuenta su frecuencia y los clasifica según el total de bytes guardados. Un pase de deduplicación codicioso elimina subfrases redundantes. Las N frases principales forman el diccionario.
- 3 Compare los resultados: el simulador muestra cuatro tamaños (original, solo GZIP, solo diccionario y diccionario + GZIP) con un gráfico de barras visual, una cuadrícula de estadísticas y una tabla de las principales frases del diccionario con su frecuencia y bytes guardados. Los tamaños de GZIP son exactos (API nativa de CompressionStream).
Lo que se mide
- Frases del diccionario: las N subcadenas principales de los datos de muestra clasificadas por el total de bytes guardados - (longitud de la frase - 2) × frecuencia. El −2 representa el costo de referencia inversa de 2 bytes que reemplaza cada aparición de frase.
- Reemplazos realizados: el número total de apariciones de frases reemplazadas en la cadena de destino. Más reemplazos significan que los datos de destino coinciden estrechamente con los datos de muestra, una buena señal de la eficacia del diccionario.
- Información general del diccionario: el tamaño total del diccionario en sí (bytes de frase + índice de 2 bytes por entrada). Este es un costo único compartido entre todos los mensajes comprimidos; insignificante cuando se comprimen muchas cargas útiles.
- Tamaños GZIP (exactos): tamaños comprimidos GZIP reales calculados utilizando la API CompressionStream nativa del navegador, tanto para el destino original como para el destino preprocesado por diccionario.
Compresión de diccionario frente a GZIP estándar
El GZIP estándar crea su propia tabla de referencia LZ77 desde cero para cada carga útil comprimida. Para archivos grandes, esto funciona bien: el compresor tiene suficientes datos para encontrar patrones repetidos. Pero para cargas útiles pequeñas (menos de 1 KB), domina la sobrecarga de arranque en frío de GZIP y las relaciones de compresión son pobres. Un diccionario compartido resuelve esto precargando el compresor con patrones conocidos antes de que vea los datos de destino. Esta es la razón por la que Brotli logra una mejor compresión que GZIP para el contenido web: su diccionario estático integrado de más de 13.000 cadenas HTML, CSS y JavaScript le da una ventaja en cada respuesta. El simulador de compresión de diccionarios le permite crear y probar su propio diccionario específico de un dominio para obtener el mismo efecto.
Preguntas frecuentes
Un simulador de compresión de diccionario crea un diccionario de compresión personalizado a partir de datos de muestra y lo utiliza para comprimir una cadena de destino, lo que muestra cuánto más pequeña es la salida en comparación con GZIP simple. Nuestro simulador de compresión de diccionarios gratuito en línea se ejecuta completamente en su navegador, no es necesario registrarse.
La compresión del diccionario es una técnica en la que las subcadenas que aparecen con frecuencia se reemplazan por breves referencias a un diccionario prediseñado. Algoritmos como Brotli y Zstandard admiten diccionarios compartidos: un conjunto previamente acordado de frases comunes que tanto el compresor como el descompresor conocen, lo que permite una compresión mucho mejor para cargas útiles pequeñas o repetitivas.
La compresión del diccionario es más efectiva para muchas cargas pequeñas del mismo tipo: respuestas API, líneas de registro, registros JSON, plantillas HTML. Solo GZIP tiene problemas con cargas pequeñas porque necesita crear su propio diccionario desde cero para cada mensaje. Un diccionario compartido elimina este problema de arranque en frío.
Sí, completamente. El simulador de compresión de diccionario se ejecuta completamente en su navegador. Sus datos de muestra y cadenas de destino nunca se cargan en ningún servidor y nunca salen de su dispositivo. Todo el procesamiento se realiza localmente con total privacidad.
Sí, 100% gratis, para siempre. Sin registro, sin cuenta, sin nivel premium, sin límites de tamaño de datos y sin anuncios. Simule la compresión del diccionario para cargas útiles ilimitadas y completamente gratis.
El simulador de compresión de diccionario extrae las subcadenas más frecuentes (n-gramas) de sus datos de muestra, clasificadas por el total de bytes guardados. Utiliza un paso de deduplicación codicioso para evitar entradas redundantes: se omiten frases más cortas que son subcadenas de frases más largas ya seleccionadas. Puede controlar la longitud mínima y máxima de la frase y el número total de entradas del diccionario.
El diccionario en sí ocupa espacio: cada frase debe almacenarse para que el descompresor pueda buscarla. El simulador de compresión del diccionario muestra la sobrecarga del diccionario en bytes. Esta sobrecarga es un costo único compartido entre todos los mensajes comprimidos, por lo que se vuelve insignificante cuando se comprimen muchas cargas útiles del mismo tipo.
Brotli (RFC 7932) tiene un diccionario estático incorporado de más de 13.000 cadenas web comunes. Zstandard admite diccionarios compartidos personalizados mediante el comando zstd --train. El simulador de compresión de diccionario modela este concepto: crea un diccionario específico de dominio a partir de tus propios datos de muestra y muestra el beneficio de la compresión sobre GZIP genérico.