3 pasos clave para replicar la experiencia de gobernanza de datos de ByteDance

El equipo de plataforma de datos de ByteDance cuenta cómo pasaron de una gobernanza de datos centralizada, lenta y de alto impacto en el negocio, a un modelo de 'autogobierno distribuido' por unidad de negocio.

DataLeap es el kit de gobernanza de investigación y desarrollo de big data de la plataforma de datos inteligentes VeDI de Volcano Engine: “ayuda a los usuarios a completar rápidamente todo el ciclo de construcción de una plataforma central de datos, incluyendo integración, desarrollo, operaciones, gobernanza, gestión de activos y seguridad de datos”. Este artículo comparte la experiencia de gobernanza de datos de ByteDance en tres pasos: enfoque de gobernanza, construcción de la plataforma y evolución hacia capacidades inteligentes.

Oportunidades y desafíos

La gobernanza de datos tiene cuatro dificultades típicas al momento de implementarse:

  1. Tensión entre el beneficio de la gobernanza y el impacto en el negocio: la gobernanza requiere modificar sistemas de negocio y procesos de producción existentes.
  2. Alta dificultad de gestión organizacional: involucra muchos roles, un alcance amplio y cadenas de dependencia largas.
  3. Alta dificultad para hacer cumplir los estándares: depende del esfuerzo humano para avanzar, y la capacidad de las personas involucradas es despareja.
  4. Falta de herramientas adaptadas: falta una visión global y herramientas de gobernanza flexibles.

Particularidades de ByteDance:

  • Muchas líneas de negocio, crecimiento rápido, iteración ágil.
  • La cultura OKR empuja a que toda la organización participe en la planificación de la gobernanza.
  • El negocio es lo primero: la calidad de los datos tiene un impacto grande sobre el negocio.

Paso 1: repensar el enfoque de gobernanza de datos — autogobierno distribuido

Concepto central

Frente a los problemas de la gobernanza tradicional, propusimos el enfoque de “autogobierno distribuido de datos” (分布式数据自治), con estas características principales:

  1. Gobernanza por unidad de negocio: garantiza que el impacto sobre el negocio sea acotado.
  2. Consolidar la experiencia de gobernanza: mediante herramientas de producto, se vuelve reglamentada, sistematizada y automatizada.
  3. Alta adaptabilidad: cubre múltiples escenarios como estabilidad, calidad, seguridad, costo y alertas.

Comparación con la gobernanza centralizada

Dimensión Gobernanza centralizada Autogobierno distribuido
Impacto en el negocio Alto Bajo
Tiempo de implementación Largo Corto
Eficiencia Baja Alta
Inversión de personas Alta Baja

Paso 2: construir una plataforma integral con doble camino de gobernanza

Arquitectura de tres capas de la plataforma

Primera capa: capa de vistas

  • Vista de activos de datos, vista de gerencia, vista de quien ejecuta.

Segunda capa: capa de soluciones — doble camino

Camino uno: proceso planificado (planificación proactiva)

Características: activos claros, reglas ricas, flujo completo, beneficio medible con precisión.

Flujo: definir el objetivo → definir el plan → el sistema detecta problemas → se asignan a los responsables → se recolecta el efecto de la gobernanza.

Implementación central:

  1. Activos claros

    • Panorama de gobernanza: describe la situación concreta de los activos en distintas dimensiones (almacenamiento, cómputo, tasa de alertas de tareas, etc.).
    • Puntaje de salud: dividido en tres niveles (puntaje de salud de almacenamiento, de cómputo, de calidad).
  2. Reglas ricas

    • “Cubre 4 grandes dimensiones — almacenamiento, cómputo, calidad y alertas — con más de 50 reglas.”
    • Incluye reglas globales, reglas personalizadas y reglas de minería (descubrimiento automático).
  3. Flujo completo

    • Gobernanza de tareas: soporta cerrar, ajustar, tunear parámetros y optimizar cadenas.
    • Estándares de tablas: gestión de tablas y transferencia de activos.
    • Ciclo de vida: integrado con los componentes de almacenamiento (HDFS, Hive, etc.).
    • Calidad de datos: conectado con la plataforma de reglas de calidad.
  4. Beneficio medible con precisión

    • Recolecta eventos de gobernanza a partir de un framework de centro de eventos.
    • Se conecta mediante suscripción de mensajes, procesando de forma offline y en cómputo en línea.

Principios de la arquitectura técnica:

  • Consulta de datos unificada.
  • Combinación flexible de reglas.
  • Desacoplamiento de operaciones.
  • Beneficio de gobernanza medible con precisión.

Camino dos: proceso reactivo (descubrimiento por el sistema)

Características: gobernanza posterior al hecho, resumen de problemas, consolidación de experiencia.

Flujo: llega una alerta → se muestran los mensajes agregados → se busca y determina la causa raíz → se contacta al responsable → mejora y resumen.

Diferencia central: el servicio de mensajería integra en un servicio unificado los mensajes de todos los productos relacionados con la plataforma de big data, con soporte para agregación de mensajes y estrategias de escalamiento urgente.

Tercera capa: capa de herramientas

Cubre escenarios de calidad, seguridad, costo, estabilidad y alertas, conectando los servicios base que potencian a ambos caminos.

Paso 3: acceso abierto y evolución hacia capacidades inteligentes

Acceso abierto

Framework de cuatro cuadrantes

Dividido según el tipo de metadatos y de reglas:

Cuadrante Metadatos Reglas Forma de procesamiento
Primer cuadrante Metadatos estándar Expresiones El motor de reglas se adapta directamente
Segundo cuadrante Metadatos de terceros Expresiones Debe seguir el estándar de integración
Tercer cuadrante Metadatos estándar Paquetes de algoritmos Se invoca mediante paquete o plugin
Cuarto cuadrante Metadatos de terceros Paquetes de algoritmos Se define un estándar de entrada/salida

El área de negocio es responsable de procesar la parte de integración, completando la configuración y el mapeo de datos; el resultado se calcula mediante expresiones o paquetes de algoritmos y se entrega en una salida unificada.

Aterrizaje de capacidades inteligentes

1. Recomendación de SLA para tareas

  • Problema: existen miles de nodos río arriba y río abajo, y es difícil estimar el tiempo de entrega.
  • Solución: mediante la relación de linaje de datos, se encuentra la ruta crítica y se asigna un margen de SLA según el peso del tiempo de ejecución. Ya patentamos este método, y funciona bien en producción.

2. Monitoreo de umbrales dinámicos

  • Problema: en feriados o días de campaña aparecen fluctuaciones normales, pero el monitoreo tradicional genera falsos positivos con facilidad.
  • Solución: “a partir del historial de datos, inferimos distintos tipos de distribución y ofrecemos distintos métodos de predicción según cada uno.”
  • Tipos de distribución de datos: monótono no decreciente (tablas de snapshot), alta fluctuación (tablas de logs), relativamente estable (tablas de dimensiones).
  • Métodos de predicción: media móvil, suavizado exponencial, autorregresión, detección por período comparable.

3. Identificación de tareas similares

  • Problema: el negocio es enorme, y no se sabe si ya existen tareas similares.
  • Solución: serializamos y vectorizamos el AST del SQL, calculamos similitud coseno, y así podemos fusionar o dar de baja tareas duplicadas.

Resumen de arquitectura

Sistema de arquitectura de tres capas

Capa de producto

  • Distingue entre la vista de gerencia y la vista de quien ejecuta.
  • Sigue el modelo de doble camino:
    • Planificado: definir objetivo → seleccionar reglas → implementar gobernanza → medir beneficio → resumir experiencia.
    • Reactivo: suscribirse a mensajes → detectar el problema → implementar gobernanza → registrar el problema → resumir y revisar.

Capa de servicios

  • Módulos de servicio de datos, ejecución de tareas, servicio de mensajería, centro de eventos, servicio de integración, entre otros.

Capa de componentes de datos

  • Construcción del repositorio de metadatos.
  • Adaptación de componentes de big data.

Mirando hacia adelante

1. Pulir la experiencia

  • Camino planificado: activos más claros, reglas más ricas, flujo más optimizado, beneficio medido con más precisión.
  • Camino reactivo: reforzar el resumen y la consolidación de experiencia, para facilitar su reutilización.

2. Tres direcciones de apertura de capacidades

  1. Métricas personalizadas: puntaje de salud personalizado, organización personalizada.
  2. Soluciones personalizadas: pulir el flujo de integración de reglas personalizadas, abrir la capacidad de reglas.
  3. Conectar con el negocio: completar la construcción de la plataforma desde la perspectiva del negocio.

3. Gobernanza de datos potenciada

  • Ampliar las reglas de minería (descubrimiento automático).
  • Construir modelos inteligentes para hacer más análisis predictivo.

Gran parte de las capacidades y prácticas de gobernanza de datos integral descritas en este artículo ya están disponibles públicamente a través de Volcano Engine DataLeap.

Adaptación del artículo original del equipo de Plataforma de Datos de ByteDance (字节跳动数据平台), “火山引擎 DataLeap:3 个关键步骤,复制字节跳动一站式数据治理经验”, publicado a través de Volcano Engine.

Light