3 pasos clave para replicar la experiencia de gobernanza de datos de ByteDance
El equipo de plataforma de datos de ByteDance cuenta cómo pasaron de una gobernanza de datos centralizada, lenta y de alto impacto en el negocio, a un modelo de 'autogobierno distribuido' por unidad de negocio.
DataLeap es el kit de gobernanza de investigación y desarrollo de big data de la plataforma de datos inteligentes VeDI de Volcano Engine: “ayuda a los usuarios a completar rápidamente todo el ciclo de construcción de una plataforma central de datos, incluyendo integración, desarrollo, operaciones, gobernanza, gestión de activos y seguridad de datos”. Este artículo comparte la experiencia de gobernanza de datos de ByteDance en tres pasos: enfoque de gobernanza, construcción de la plataforma y evolución hacia capacidades inteligentes.
Oportunidades y desafíos
La gobernanza de datos tiene cuatro dificultades típicas al momento de implementarse:
- Tensión entre el beneficio de la gobernanza y el impacto en el negocio: la gobernanza requiere modificar sistemas de negocio y procesos de producción existentes.
- Alta dificultad de gestión organizacional: involucra muchos roles, un alcance amplio y cadenas de dependencia largas.
- Alta dificultad para hacer cumplir los estándares: depende del esfuerzo humano para avanzar, y la capacidad de las personas involucradas es despareja.
- Falta de herramientas adaptadas: falta una visión global y herramientas de gobernanza flexibles.
Particularidades de ByteDance:
- Muchas líneas de negocio, crecimiento rápido, iteración ágil.
- La cultura OKR empuja a que toda la organización participe en la planificación de la gobernanza.
- El negocio es lo primero: la calidad de los datos tiene un impacto grande sobre el negocio.
Paso 1: repensar el enfoque de gobernanza de datos — autogobierno distribuido
Concepto central
Frente a los problemas de la gobernanza tradicional, propusimos el enfoque de “autogobierno distribuido de datos” (分布式数据自治), con estas características principales:
- Gobernanza por unidad de negocio: garantiza que el impacto sobre el negocio sea acotado.
- Consolidar la experiencia de gobernanza: mediante herramientas de producto, se vuelve reglamentada, sistematizada y automatizada.
- Alta adaptabilidad: cubre múltiples escenarios como estabilidad, calidad, seguridad, costo y alertas.
Comparación con la gobernanza centralizada
| Dimensión | Gobernanza centralizada | Autogobierno distribuido |
|---|---|---|
| Impacto en el negocio | Alto | Bajo |
| Tiempo de implementación | Largo | Corto |
| Eficiencia | Baja | Alta |
| Inversión de personas | Alta | Baja |
Paso 2: construir una plataforma integral con doble camino de gobernanza
Arquitectura de tres capas de la plataforma
Primera capa: capa de vistas
- Vista de activos de datos, vista de gerencia, vista de quien ejecuta.
Segunda capa: capa de soluciones — doble camino
Camino uno: proceso planificado (planificación proactiva)
Características: activos claros, reglas ricas, flujo completo, beneficio medible con precisión.
Flujo: definir el objetivo → definir el plan → el sistema detecta problemas → se asignan a los responsables → se recolecta el efecto de la gobernanza.
Implementación central:
-
Activos claros
- Panorama de gobernanza: describe la situación concreta de los activos en distintas dimensiones (almacenamiento, cómputo, tasa de alertas de tareas, etc.).
- Puntaje de salud: dividido en tres niveles (puntaje de salud de almacenamiento, de cómputo, de calidad).
-
Reglas ricas
- “Cubre 4 grandes dimensiones — almacenamiento, cómputo, calidad y alertas — con más de 50 reglas.”
- Incluye reglas globales, reglas personalizadas y reglas de minería (descubrimiento automático).
-
Flujo completo
- Gobernanza de tareas: soporta cerrar, ajustar, tunear parámetros y optimizar cadenas.
- Estándares de tablas: gestión de tablas y transferencia de activos.
- Ciclo de vida: integrado con los componentes de almacenamiento (HDFS, Hive, etc.).
- Calidad de datos: conectado con la plataforma de reglas de calidad.
-
Beneficio medible con precisión
- Recolecta eventos de gobernanza a partir de un framework de centro de eventos.
- Se conecta mediante suscripción de mensajes, procesando de forma offline y en cómputo en línea.
Principios de la arquitectura técnica:
- Consulta de datos unificada.
- Combinación flexible de reglas.
- Desacoplamiento de operaciones.
- Beneficio de gobernanza medible con precisión.
Camino dos: proceso reactivo (descubrimiento por el sistema)
Características: gobernanza posterior al hecho, resumen de problemas, consolidación de experiencia.
Flujo: llega una alerta → se muestran los mensajes agregados → se busca y determina la causa raíz → se contacta al responsable → mejora y resumen.
Diferencia central: el servicio de mensajería integra en un servicio unificado los mensajes de todos los productos relacionados con la plataforma de big data, con soporte para agregación de mensajes y estrategias de escalamiento urgente.
Tercera capa: capa de herramientas
Cubre escenarios de calidad, seguridad, costo, estabilidad y alertas, conectando los servicios base que potencian a ambos caminos.
Paso 3: acceso abierto y evolución hacia capacidades inteligentes
Acceso abierto
Framework de cuatro cuadrantes
Dividido según el tipo de metadatos y de reglas:
| Cuadrante | Metadatos | Reglas | Forma de procesamiento |
|---|---|---|---|
| Primer cuadrante | Metadatos estándar | Expresiones | El motor de reglas se adapta directamente |
| Segundo cuadrante | Metadatos de terceros | Expresiones | Debe seguir el estándar de integración |
| Tercer cuadrante | Metadatos estándar | Paquetes de algoritmos | Se invoca mediante paquete o plugin |
| Cuarto cuadrante | Metadatos de terceros | Paquetes de algoritmos | Se define un estándar de entrada/salida |
El área de negocio es responsable de procesar la parte de integración, completando la configuración y el mapeo de datos; el resultado se calcula mediante expresiones o paquetes de algoritmos y se entrega en una salida unificada.
Aterrizaje de capacidades inteligentes
1. Recomendación de SLA para tareas
- Problema: existen miles de nodos río arriba y río abajo, y es difícil estimar el tiempo de entrega.
- Solución: mediante la relación de linaje de datos, se encuentra la ruta crítica y se asigna un margen de SLA según el peso del tiempo de ejecución. Ya patentamos este método, y funciona bien en producción.
2. Monitoreo de umbrales dinámicos
- Problema: en feriados o días de campaña aparecen fluctuaciones normales, pero el monitoreo tradicional genera falsos positivos con facilidad.
- Solución: “a partir del historial de datos, inferimos distintos tipos de distribución y ofrecemos distintos métodos de predicción según cada uno.”
- Tipos de distribución de datos: monótono no decreciente (tablas de snapshot), alta fluctuación (tablas de logs), relativamente estable (tablas de dimensiones).
- Métodos de predicción: media móvil, suavizado exponencial, autorregresión, detección por período comparable.
3. Identificación de tareas similares
- Problema: el negocio es enorme, y no se sabe si ya existen tareas similares.
- Solución: serializamos y vectorizamos el AST del SQL, calculamos similitud coseno, y así podemos fusionar o dar de baja tareas duplicadas.
Resumen de arquitectura
Sistema de arquitectura de tres capas
Capa de producto
- Distingue entre la vista de gerencia y la vista de quien ejecuta.
- Sigue el modelo de doble camino:
- Planificado: definir objetivo → seleccionar reglas → implementar gobernanza → medir beneficio → resumir experiencia.
- Reactivo: suscribirse a mensajes → detectar el problema → implementar gobernanza → registrar el problema → resumir y revisar.
Capa de servicios
- Módulos de servicio de datos, ejecución de tareas, servicio de mensajería, centro de eventos, servicio de integración, entre otros.
Capa de componentes de datos
- Construcción del repositorio de metadatos.
- Adaptación de componentes de big data.
Mirando hacia adelante
1. Pulir la experiencia
- Camino planificado: activos más claros, reglas más ricas, flujo más optimizado, beneficio medido con más precisión.
- Camino reactivo: reforzar el resumen y la consolidación de experiencia, para facilitar su reutilización.
2. Tres direcciones de apertura de capacidades
- Métricas personalizadas: puntaje de salud personalizado, organización personalizada.
- Soluciones personalizadas: pulir el flujo de integración de reglas personalizadas, abrir la capacidad de reglas.
- Conectar con el negocio: completar la construcción de la plataforma desde la perspectiva del negocio.
3. Gobernanza de datos potenciada
- Ampliar las reglas de minería (descubrimiento automático).
- Construir modelos inteligentes para hacer más análisis predictivo.
Gran parte de las capacidades y prácticas de gobernanza de datos integral descritas en este artículo ya están disponibles públicamente a través de Volcano Engine DataLeap.
Adaptación del artículo original del equipo de Plataforma de Datos de ByteDance (字节跳动数据平台), “火山引擎 DataLeap:3 个关键步骤,复制字节跳动一站式数据治理经验”, publicado a través de Volcano Engine.