Spark est un mot impressionnant sur un CV, souvent mal compris. Ce guide explique, sans jargon, à quoi sert Spark, quand il est justifié, et comment repérer un candidat qui l'a surjoué.
L'essentiel : Spark ne sert que pour les très gros volumes. Un candidat qui l'a utilisé sur peu de données n'a pas compris son intérêt.
Un outil pour traiter d'énormes volumes sur plusieurs machines.
Spark permet de traiter des données trop volumineuses pour une seule machine, en répartissant le calcul sur plusieurs ordinateurs (un « cluster »). C'est puissant, mais complexe et coûteux.
Uniquement quand la donnée dépasse une machine.
Spark n'a d'intérêt qu'à grande échelle : quand la donnée ne tient plus sur un seul ordinateur. En dessous, un simple script (pandas, SQL) est plus rapide et moins cher.
Surtout les Data Engineers travaillant à grande échelle.
Spark est l'outil des équipes qui manipulent de très gros volumes. Beaucoup de candidats l'affichent, mais peu ont réellement travaillé à l'échelle qui le justifie.
Une seule question : sur quel volume, et pourquoi Spark ?
Pour démasquer un profil gonflé, demandez sur quel volume il a utilisé Spark et pourquoi pas un outil plus simple. Un candidat vague sur le volume a presque toujours surjoué.
Signal d'alerte : le red flag numéro un sur Spark : avoir « fait du Spark » sur un petit jeu de données, là où un simple script aurait suffi. La question du volume démasque le buzzword.
| Votre situation | Ce qu'il faut faire | L'erreur à éviter |
|---|---|---|
| Vos volumes sont raisonnables | Spark inutile : n'en faites pas un critère | Exiger Spark par principe |
| Vos volumes dépassent une machine | Spark justifié : évaluez le vécu réel | Prendre 'Spark' au mot |
| Le candidat affiche Spark | Demandez volume + justification | Candidat vague sur le volume |
| Vous n'êtes pas technique | La question du volume suffit à démasquer | Se laisser impressionner par le mot |
Data Builder mène l'entretien technique et vous livre un rapport clair et détaillé sous 24h. Premier entretien offert.