AccueilBlogTest technique Airflow
Guide recrutement data

Test technique Airflow : ce qu'on évalue vraiment en entretien

Airflow orchestre la plupart des pipelines data. Mais entre enchaîner trois tâches et concevoir des DAGs idempotents, reproductibles et monitorés, l'écart de fiabilité est énorme. Voici ce qu'on évalue.

Data Builder·Juillet 2025·10 min de lecture·Data Engineer

Un bon profil Airflow pense d'abord fiabilité : que se passe-t-il quand une tâche échoue à 3h du matin ? L'idempotence et la reprise séparent les profils solides des autres. Cinq dimensions.

1DAGs et scheduling

Question discriminante

Qu'est-ce que le catchup, et pourquoi la date logique compte-t-elle plus que la date d'exécution ?

  • Un DAG décrit des tâches et leurs dépendances, planifiées par schedule.
  • La date logique (intervalle traité) pilote la logique, pas l'heure d'exécution.
  • catchup — rejouer les intervalles manqués ; à activer en connaissance de cause.
  • Écrire des tâches paramétrées par la date logique pour être rejouables.

2Tâches et dépendances

Question discriminante

Comment structurez-vous les dépendances d'un DAG lisible et maintenable ?

  • Operators (Bash, Python, KubernetesPod…) et la TaskFlow API moderne.
  • Dépendances explicites (>>) et task groups pour la lisibilité.
  • Sensors avec parcimonie (préférer deferrable pour ne pas bloquer un slot).
  • Découper : une tâche = une unité de travail claire et rejouable.

3Idempotence et reprise

Question discriminante

Une tâche échoue à 3h du matin puis est relancée. Que doit-il se passer ?

  • Idempotence : relancer une tâche produit le même résultat, sans doublon.
  • retries + délai, et alertes en cas d'échec.
  • Backfill pour rejouer une plage de dates proprement.
  • Écritures atomiques (remplacer une partition plutôt qu'insérer en aveugle).

Signal d'alerte : une tâche non idempotente qui insère sans dédoublonner crée des données en double à chaque retry — un piège classique en production.

4XComs, connexions et secrets

Question discriminante

Comment passez-vous des données entre tâches, et comment gérez-vous les identifiants ?

  • XCom pour de petites métadonnées, jamais de gros volumes.
  • Hooks et Connections pour parler aux systèmes externes.
  • Variables et secrets backend — jamais de secret en dur dans le DAG.
  • Passer les gros volumes par un stockage (S3/GCS), pas par XCom.

5Production et bonnes pratiques

Question discriminante

Un DAG est lent, instable ou surcharge le scheduler. Par quoi commencez-vous ?

  • Pas de logique lourde au niveau du DAG (parsé en continu par le scheduler).
  • Choisir l'executor adapté (Celery, Kubernetes) selon l'échelle.
  • Monitoring, SLA et alerting sur les tâches critiques.
  • DAGs dynamiques avec parcimonie (lisibilité et coût de parsing).

6Grille par niveau

NiveauMaîtrise attendueSignal GONO-GO
JuniorÉcrire un DAG simple, operators de baseEnchaîne des tâches, comprend le schedulingMet de la logique lourde au niveau du DAG
ConfirméIdempotence, retries, backfill, connexionsÉcrit des tâches idempotentes et rejouablesÉcrit une tâche non idempotente (doublons au retry)
SeniorExecutors, monitoring, secrets, deferrableDiagnostique un scheduler surchargé, sécurise les secretsFait transiter de gros volumes par XCom
LeadArchitecture d'orchestration, standards d'équipeDéfinit les conventions de DAGs et la stratégie de repriseN'a pas de stratégie de reprise sur incident

Vous recrutez un profil data ?

Data Builder mène l'entretien technique et vous livre un rapport clair et détaillé sous 24h. Premier entretien offert.

Tester gratuitementRéserver un appel