Saltar a contenido

Ejemplo: cadena de tratamiento datawarehouse

Este ejemplo presenta el flujo de trabajo estándar para construir una cadena de tratamiento de datos de extremo a extremo en la plataforma: un repositorio Git para versionar el proyecto Apache Hop, una base PostgreSQL como destino, Apache Hop GUI para diseñar el pipeline, un Apache Hop Server para ejecutarlo, y una planificación recurrente para automatizarlo.

Visión general

  1. Crear un repositorio Git.
  2. Crear una base de datos.
  3. Lanzar Apache Hop GUI, con el repositorio como parámetro.
  4. Crear un pipeline en Hop GUI.
  5. Lanzar un Apache Hop Server sobre el mismo repositorio y la misma rama.
  6. Crear un job recurrente sobre ese pipeline.
  7. Supervisar el resultado.

1. Crear un repositorio Git

Desde la página Git, sección Mi cuenta Git, Crear un repositorio — personal o en una organización. Este repositorio versionará el proyecto Apache Hop (pipelines .hpl, workflows .hwf, conexiones y metadatos).

2. Crear una base de datos

Desde el catálogo (Nueva app), despliegue la plantilla PostgreSQL — véase Desplegar una aplicación. Es la base de datos destino en la que el pipeline escribirá los datos. Anote el nombre de la aplicación: identifica la conexión PostgreSQL expuesta automáticamente a Apache Hop (véase el siguiente paso).

3. Lanzar Hop GUI con el repositorio como parámetro

Despliegue la plantilla Apache Hop (GUI). En la sección Origen Git del formulario:

  • Instancia Forgejo: la instancia gestionada por la plataforma;
  • Repositorio: el repositorio creado en el paso 1;
  • Rama: déjelo vacío para la rama predeterminada.

Una vez que la aplicación esté en Running, ábrala (Abrir): el proyecto Hop se sincroniza con este repositorio/rama, y las conexiones hacia las bases PostgreSQL, servidores Hop y buckets S3 del namespace se aprovisionan automáticamente en los metadatos del proyecto.

Tip

Si la base creada en el paso 2 no aparece de inmediato como conexión en Hop, use Resincronizar conexiones Hop en la tarjeta de la aplicación (véase Aplicaciones) en lugar de esperar la sincronización periódica.

4. Crear un pipeline

En Hop GUI, cree un nuevo pipeline (.hpl) usando como destino la conexión PostgreSQL aprovisionada en el paso anterior, y luego confírmelo (commit) en el repositorio (Hop GUI incluye un cliente Git integrado). Este archivo es lo que el Hop Server ejecutará en los siguientes pasos.

5. Lanzar un Hop Server sobre el mismo repositorio/rama

Despliegue la plantilla Apache Hop Server, con la misma configuración de origen Git que en el paso 3 (misma instancia Forgejo, mismo repositorio, misma rama) — el Hop Server debe ver exactamente el mismo proyecto, pipeline incluido, que el usado en Hop GUI.

6. Crear un job recurrente sobre el pipeline

Abra Jobs Hop desde la tarjeta del Hop Server, y luego, en Jobs recurrentes planificados, cree una planificación que apunte al pipeline creado en el paso 4 (intervalo o expresión cron) — véase Apache Hop Server: jobs y programación para el detalle de los campos.

7. Supervisar el resultado

Desde la misma página Jobs Hop:

  • la columna Última ejecución de la planificación confirma que se dispara como se esperaba;
  • el historial enumera cada ejecución con su estado (Completado, Fallido…) — haga clic en una fila para ver el detalle gráfico del pipeline y los logs completos;
  • el panel superior de la página ofrece una vista instantánea de los jobs en curso/en espera y de la carga de la instancia.