Exemple : chaîne de traitement datawarehouse¶
Cet exemple présente le flux de travail standard pour construire une chaîne de traitement de données de bout en bout sur la plateforme : un dépôt Git pour versionner le projet Apache Hop, une base PostgreSQL comme cible, Apache Hop GUI pour concevoir le pipeline, un Apache Hop Server pour l'exécuter, et une planification récurrente pour l'automatiser.
Vue d'ensemble¶
- Créer un dépôt Git.
- Créer une base de données.
- Lancer Apache Hop GUI, avec le dépôt en paramètre.
- Créer un pipeline dans Hop GUI.
- Lancer un Apache Hop Server sur le même dépôt et la même branche.
- Créer un job récurrent sur ce pipeline.
- Surveiller le résultat.
1. Créer un dépôt Git¶
Depuis la page Git, section Mon compte Git, Créer un dépôt — personnel ou dans une organisation. Ce dépôt versionnera le projet Apache Hop (pipelines .hpl, workflows .hwf, connexions et métadonnées).
2. Créer une base de données¶
Depuis le catalogue (Nouvelle app), déployez le template PostgreSQL — voir Déployer une application. C'est la base cible dans laquelle le pipeline écrira les données. Notez le nom de l'application : c'est lui qui identifie la connexion PostgreSQL exposée automatiquement à Apache Hop (voir étape suivante).
3. Lancer Hop GUI avec le dépôt en paramètre¶
Déployez le template Apache Hop (GUI). Dans la section Source Git du formulaire :
- Instance Forgejo : l'instance gérée par la plateforme ;
- Dépôt : le dépôt créé à l'étape 1 ;
- Branche : laissez vide pour la branche par défaut.
Une fois l'application Running, ouvrez-la (Ouvrir) : le projet Hop est synchronisé sur ce dépôt/branche, et les connexions vers les bases PostgreSQL, serveurs Hop et buckets S3 du namespace sont provisionnées automatiquement dans les métadonnées du projet.
Tip
Si la base créée à l'étape 2 n'apparaît pas tout de suite comme connexion dans Hop, utilisez Resynchroniser les connexions Hop sur la carte de l'application (voir Applications) plutôt que d'attendre la synchronisation périodique.
4. Créer un pipeline¶
Dans Hop GUI, créez un nouveau pipeline (.hpl) utilisant la connexion PostgreSQL provisionnée à l'étape précédente comme cible, puis commitez-le sur le dépôt (Hop GUI intègre un client Git). Ce fichier est ce que le Hop Server exécutera aux étapes suivantes.
5. Lancer un Hop Server sur le même dépôt/branche¶
Déployez le template Apache Hop Server, avec la même configuration Source Git qu'à l'étape 3 (même instance Forgejo, même dépôt, même branche) — le Hop Server doit voir exactement le même projet, pipeline compris, que celui utilisé dans Hop GUI.
6. Créer un job récurrent sur le pipeline¶
Ouvrez Jobs Hop depuis la carte du Hop Server, puis, dans Jobs récurrents planifiés, créez une planification pointant vers le pipeline créé à l'étape 4 (intervalle ou expression cron) — voir Apache Hop Server : jobs et planification pour le détail des champs.
7. Surveiller le résultat¶
Depuis la même page Jobs Hop :
- la colonne Dernière exécution de la planification confirme qu'elle se déclenche comme prévu ;
- l'historique liste chaque exécution avec son statut (
Terminé,Échoué…) — cliquez une ligne pour le détail graphique du pipeline et les logs complets ; - le bandeau en haut de page donne une vue instantanée des jobs en cours/en attente et de la charge de l'instance.