Descripción
Este manual es una recopilación integral de prácticas recomendadas para utilizar DWS. Para cada tarea, se proporciona una descripción detallada de la solución y los procedimientos de operación. Consulte este manual según la tarea que se deba realizar.
Importación y exportación
| Documento | Descripción |
|---|---|
| Describe cómo importar datos a DWS y exportar datos de DWS mediante herramientas. | |
| Transferencia de datos entre buckets de OBS y clústeres de DWS | Describe cómo cargar datos de muestra en OBS, acceder a datos en buckets de OBS mediante tablas externas de OBS, importar datos a DWS o exportar datos de una tabla de DWS a un bucket de OBS. |
| Uso de GDS para importar datos de una tabla de un servidor remoto a un clúster de DWS | Describe cómo utilizar GDS para importar datos de un servidor remoto a DWS. |
| Importación de datos de tablas desde MRS Hive a un clúster de DWS | Describe cómo habilitar DWS para acceder o leer remotamente las fuentes de datos de MRS mediante una tabla externa de HDFS. |
| Habilitación del acceso entre clústeres de Hive Metastore a través de un esquema externo | Describe cómo habilitar un clúster de almacenamiento y cómputo desacoplado para acceder remotamente a los metadatos de HiveMetaStore mediante un esquema externo. |
| Importación de datos de tablas desde DLI a un clúster de DWS | Describe cómo importar datos de DLI a DWS mediante la función de tabla externa de DWS. |
| Exportación de datos ORC de un clúster de DWS a un clúster de MRS | Describe cómo exportar datos en formato ORC a MRS mediante una tabla externa de HDFS. |
Migración de datos
| Documento | Descripción |
|---|---|
| Describe cómo migrar datos de tablas de Oracle a DWS. | |
| Describe cómo utilizar Cloud Data Migration (CDM) para migrar datos de MySQL a DWS por lotes. | |
| Describe cómo utilizar un trabajo de Flink de DLI para sincronizar datos de MySQL con DWS en tiempo real. | |
| Uso de CDM para migrar datos de Hologres a un clúster de DWS | Describe cómo utilizar CDM para migrar datos de Hologres a DWS. |
| Uso de Kettle para migrar tablas pequeñas de AWS Redshift a un clúster de DWS | Describe cómo utilizar la herramienta de código abierto Kettle para migrar datos de AWS Redshift a DWS. |
| Uso de CDM para migrar datos de AnalyticDB for MySQL a un clúster de DWS | Describe cómo utilizar CDM para migrar datos de AnalyticDB for MySQL a DWS. |
| Describe cómo utilizar un trabajo de Flink de DLI para sincronizar datos de consumo de DMS for Kafka con DWS en tiempo real. | |
| Describe cómo migrar 15 millones de filas de datos entre dos clústeres de DWS en cuestión de minutos, basándose en la alta concurrencia de importación y exportación de GDS. |
Análisis de datos
| Documento | Descripción |
|---|---|
| Uso de DWS para consultar rutas de vehículos en puntos de control de tráfico en segundos | Describe cómo analizar los vehículos que pasan por los puntos de control. En esta práctica, 890 millones de registros de datos de los puntos de control se cargan en una única tabla de base de datos en DWS para realizar consultas precisas y difusas, lo que demuestra la capacidad de DWS para realizar consultas de alto rendimiento de datos históricos. |
| Uso de DWS para analizar los requisitos de la cadena de suministro de una empresa | Describe cómo cargar el conjunto de datos de ejemplo desde OBS a un clúster de DWS y realizar consultas de datos, lo que demuestra el análisis de múltiples tablas y el análisis temático de DWS en escenarios de análisis de datos. |
| Uso de DWS para analizar el estado operativo de una tienda departamental | Describe cómo cargar los datos comerciales diarios de cada tienda minorista desde OBS a la tabla correspondiente en un clúster de DWS y, a continuación, resumir y consultar los KPI, como los ingresos de la tienda, el flujo de clientes, el ranking de ventas mensuales, la tasa de conversión mensual del flujo de clientes, la relación precio-alquiler mensual y las ventas por unidad de área. |
| Describe cómo instalar Power BI en un ECS de Windows y conectarlo a DWS mediante un gateway de datos local. |
Almacenamiento y cómputo desacoplados
| Documento | Descripción |
|---|---|
| Describe la optimización del rendimiento y las precauciones de los clústeres con almacenamiento y cómputo desacoplados. | |
| Uso de la caché de disco para mejorar el rendimiento de las consultas | Describe la caché de disco de DWS. En los clústeres de DWS con almacenamiento y cómputo desacoplados, los datos de servicio se almacenan en buckets de OBS. Si los usuarios acceden con frecuencia a OBS, puede producirse un cuello de botella de rendimiento. Puede utilizar la función de caché de disco local de DWS para almacenar los datos de uso frecuente en la caché y ordenar los datos con alto tráfico en función de la frecuencia de uso real para mejorar el rendimiento de las consultas. |
Desarrollo de datos
| Documento | Descripción |
|---|---|
| Describe los almacenes de datos híbridos y las tablas HStore. Basados en capacidades de análisis y consulta de datos a gran escala, los almacenes de datos híbridos de DWS ofrecen alta concurrencia, alto rendimiento, baja latencia y bajo costo en el procesamiento de transacciones. Las tablas HStore desempeñan un papel clave en la transformación digital de Internet, IoT y las industrias tradicionales. | |
| Conversión de una tabla de series temporales en una tabla HStore | Describe las ventajas de las tablas HStore sobre las tablas de series temporales en términos de importación de datos, relación de compresión y rendimiento de consultas. Por lo tanto, se recomienda reemplazar las tablas de series temporales por tablas HStore. |
| Describe el almacenamiento híbrido de filas y columnas proporcionado por DWS. Puede almacenar datos en formato de fila y columna en una sola tabla. Los datos de los dos formatos se mantienen de forma independiente y se actualizan de forma sincrónica. El optimizador de consultas selecciona el modo de acceso óptimo en función de la ruta de la consulta real. Describe cómo los usuarios diseñan y utilizan estructuras de almacenamiento híbridas de filas y columnas en función de escenarios típicos y comparaciones de rendimiento para una gestión eficiente de los datos. | |
| Reducción de costos mediante la conmutación del almacenamiento de datos fríos y calientes en DWS | Describe cómo DWS clasifica los datos en datos calientes y fríos por tiempo, según la frecuencia de uso de los datos, para mejorar el rendimiento del análisis y reducir los costos. |
| Describe cómo DWS gestiona automáticamente las particiones. Según los parámetros de nivel de tabla (period y ttl), DWS puede crear automáticamente particiones y eliminar particiones caducadas. Esta función está disponible para tablas particionadas por tiempo (como pedidos y datos de IoT). Esta función libera a los usuarios del mantenimiento de tablas particionadas, lo que reduce significativamente los costos de O&M y mejora el rendimiento de las consultas. | |
| Describe cuándo y cómo utilizar la función de reconstrucción automática de vistas. Los objetos de la tabla base no se pueden modificar de forma independiente debido a la dependencia de la vista y la tabla. Para resolver este problema, DWS admite el desacoplamiento y la reconstrucción de vistas. | |
| Describe cómo utilizar índices GIN para buscar tipos de arreglo y JSONB, así como la manera de realizar búsquedas de texto completo. | |
| Describe la función de encriptación de SQL proporcionada por DWS. La encriptación de datos se utiliza ampliamente en los sistemas de información para evitar el acceso no autorizado y la fuga de datos. Como núcleo de un sistema de información, DWS también proporciona funciones de encriptación de datos, que incluye la encriptación transparente y la encriptación de funciones SQL. | |
| Describe cómo utilizar vistas para permitir que varios usuarios accedan a datos específicos dentro de una tabla determinada, lo que garantiza la gestión de permisos de datos y la seguridad. |
Gestión de bases de datos
| Documento | Descripción |
|---|---|
| Proporciona un ejemplo de aplicación del modelo de control de acceso basado en roles (RBAC) a DWS. RBAC otorga permisos a los roles para que los usuarios puedan obtener los permisos de estos roles asociándose con ellos. | |
| Describe cómo configurar usuarios de solo lectura en la consola para gestionar permisos de cuenta. Estos usuarios pueden ver y conectarse a clústeres, pero no pueden ejecutar acciones de alto riesgo, como eliminarlos. | |
| Describe los permisos de los administradores del sistema y los usuarios comunes, así como cómo crear usuarios y consultar información de usuarios. | |
| Proporciona ejemplos de SQL para consultar tablas y bases de datos. | |
| Describe prácticas recomendadas y ejemplos para crear y gestionar secuencias. |
Ajuste del rendimiento
| Documento | Descripción |
|---|---|
| Describe cómo optimizar el rendimiento de las tablas en DWS mediante el diseño adecuado de la estructura de las tablas (por ejemplo, seleccionando el modelo de tabla, el modo de almacenamiento de tablas, el nivel de compresión, el modo de distribución, la columna de distribución, la tabla particionada y el agrupamiento local). | |
| Describe cómo ajustar las sentencias SQL de acuerdo con ciertas reglas para mejorar la ejecución de SQL y garantizar resultados correctos. | |
| Describe los índices de mapa de bits de DWS. Las consultas puntuales en columnas de alta selectividad, como claves primarias, números de pedido e ID de usuario, son comunes en las aplicaciones del mundo real. La indexación de estas columnas es el enfoque estándar para optimizar el rendimiento de las consultas. Sin embargo, en escenarios de gran volumen de datos, estructura de tabla amplia o importación por lotes, el mecanismo de indexación convencional tiene un rendimiento deficiente. Para resolver estos problemas, DWS proporciona índices de mapa de bits livianos a nivel de columna para tablas HStore. Estos índices aceleran las consultas y minimizan los costos de espacio y escritura. Son especialmente adecuados para optimizar el rendimiento de las consultas puntuales en columnas. | |
| Uso del motor Turbo para mejorar el rendimiento de las consultas de datos | Describe el motor Turbo. En comparación con el motor de ejecución de almacenamiento de columnas original, el motor Turbo optimiza los formatos de almacenamiento en memoria y en disco para cadenas y tipos numéricos, y mejora el rendimiento de operadores comunes como sort, aggregate (agg), join y scan. Esto duplica el rendimiento general del executor y reduce significativamente los costos de computación. |
| Proporciona métodos para consultar el sesgo de datos. | |
| Describe cómo utilizar la vista PG_STAT_ACTIVITY para analizar y localizar problemas de SQL, como conexiones SQL excesivas, tiempo de consulta SQL prolongado y bloqueo de consultas SQL, que los desarrolladores pueden encontrar durante el desarrollo. |
Gestión de carga de recursos y clústeres
| Documento | Descripción |
|---|---|
| Vinculación de diferentes grupos de recursos a dos tipos de trabajos para equilibrar la carga en DWS | Demuestra cómo utilizar DWS para la gestión de recursos, lo que ayuda a las empresas a eliminar los cuellos de botella en las consultas simultáneas. Los trabajos de SQL pueden ejecutarse sin problemas sin afectarse entre sí y consumir menos recursos que antes. |
| Opciones de escalamiento para DWS con una arquitectura de almacenamiento y cómputo acoplados | Describe la escalabilidad, una característica crítica de DWS. Indica que DWS puede aumentar o disminuir los recursos de cómputo y almacenamiento para satisfacer la demanda cambiante, logrando un equilibrio entre el rendimiento y el costo. |
| Esta sección describe cómo agregar o eliminar almacenes virtuales (VW) para clústeres de DWS con almacenamiento y cómputo desacoplados. De esta manera, los VW pueden escalarse automáticamente hacia adentro o hacia afuera en función de los picos de servicio, lo que permite un uso flexible y ahorros de costos. | |
| Describe la función de monitoreo de SQL principales de DWS. La función se utiliza para localizar consultas SQL lentas en la base de datos, detectar colas de trabajos que afectan a la CPU, el disco y los recursos de E/S, y dar sugerencias sobre cómo optimizar o intervenir manualmente estas tareas de SQL para mejorar el rendimiento del clúster. |
Gestión de seguridad
| Documento | Descripción |
|---|---|
| Proporciona orientación para mejorar la seguridad general de los datos de servicio cuando se utiliza DWS. |