AccueilBlogÉvaluer un profil Spark
Recruter en data

Évaluer un profil Spark : les signaux qui trompent les recruteurs

Spark est une techno impressionnante sur un CV — et c'est exactement pour ça qu'elle est souvent surjouée. Beaucoup de candidats l'ont « utilisée » sur un jeu de données minuscule où un simple script aurait suffi. Le vrai profil, lui, comprend pourquoi on passe au calcul distribué. Voici comment faire la différence sans être technique.

Data Builder·Juillet 2025·9 min de lecture·Cible : RH & recruteurs · profils Spark / Data Engineer

La compétence Spark ne se juge pas à la présence du mot sur un CV, mais à la compréhension du distribué : gros volumes, partitionnement, coût du traitement. Un candidat qui a « fait du Spark » sur 10 000 lignes n'a pas vécu les vrais problèmes que Spark résout.

1À quoi sert Spark, et quand il est justifié

À demander au candidat

Demandez : « Sur quel volume de données avez-vous utilisé Spark, et pourquoi Spark plutôt qu'un simple script ? »

Spark sert à traiter des volumes de données trop gros pour une seule machine, en répartissant le calcul sur un cluster. C'est puissant, mais coûteux et complexe — donc justifié seulement au-delà d'un certain volume. Un bon profil sait précisément pourquoi il a choisi Spark plutôt qu'un outil plus simple.

  • Spark traite de gros volumes en répartissant le calcul sur plusieurs machines.
  • Il est justifié quand la donnée ne tient plus sur une seule machine.
  • Sur de petits volumes, un simple script (pandas, SQL) est plus rapide et moins cher.
  • Le vrai enjeu est le coût du calcul distribué (temps machine, cluster).
  • Un bon profil justifie le choix de Spark par le volume, pas par la mode.

2Les signaux d'un vrai profil Spark

À demander au candidat

Écoutez s'il parle de volume, de distribué et de coût — ou seulement du mot « Spark ».

Ceux qui ont vraiment travaillé avec Spark à l'échelle en gardent des cicatrices : des jobs qui explosent, des traitements lents à optimiser. Ils en parlent concrètement. Ceux qui l'ont juste effleuré restent dans les généralités.

  • Il précise le volume réel traité et pourquoi il fallait du distribué.
  • Il parle de partitionnement, de performance ou de coût du cluster.
  • Il distingue un test local d'un vrai traitement en cluster.
  • Il raconte un job qui a échoué ou ralenti, et comment il l'a optimisé.
  • Il sait dire quand Spark n'était pas le bon choix.

3Les red flags à repérer

À demander au candidat

Le buzzword Spark attire les CV gonflés — voici comment les repérer.

Spark est le type de techno qu'on ajoute pour « faire sérieux ». Le décalage entre la mention et l'expérience réelle est fréquent. Une seule question sur le volume suffit souvent à le révéler.

  • Il a « fait du Spark » sur un jeu de données minuscule (pandas aurait suffi).
  • Il ne sait pas expliquer pourquoi Spark plutôt qu'un script simple.
  • Il enchaîne les mots-clés (RDD, DataFrame, cluster) sans cas d'usage réel.
  • Il ne parle jamais de volume, de performance ni de coût.
  • Il présente un exercice de formation comme une expérience de production.

Signal d'alerte : un candidat qui a utilisé Spark sur un petit volume, là où un simple script aurait suffi, ne comprend probablement pas ce que Spark résout vraiment — c'est le piège numéro un sur ce profil.

4La question à poser (sans être technique)

À demander au candidat

« Racontez-moi un traitement Spark que vous avez fait : quel volume, quel problème, et pourquoi pas un outil plus simple ? »

Cette question fait immédiatement le tri. Un vrai profil donne un ordre de grandeur (des dizaines de millions de lignes, plusieurs To…) et une justification claire. Un profil gonflé reste vague sur le volume ou ne sait pas justifier le choix de Spark.

  • Un bon profil donne un ordre de grandeur de volume crédible.
  • Il justifie le choix de Spark par une contrainte réelle, pas par la mode.
  • Il parle d'un vrai problème rencontré (lenteur, échec) et de sa résolution.
  • Un profil vague sur le volume est presque toujours un profil gonflé.

5Quand faire appel à un expert

À demander au candidat

Il y a une limite claire à ce qu'un recruteur non technique peut trancher seul.

Les signaux et la question ci-dessus vous permettent d'écarter les profils qui surjouent et de repérer les bons candidats. Mais confirmer finement un niveau Spark — surtout sur un poste senior ou un profil rare — demande un regard technique. C'est là qu'un entretien mené par un expert fait la différence.

  • Vous hésitez entre deux candidats et l'enjeu (séniorité, salaire) est élevé.
  • Personne en interne ne peut évaluer techniquement la compétence en question.
  • Vous voulez un rapport objectif, comparable d'un candidat à l'autre.
  • Vous recrutez en volume et voulez fiabiliser votre présélection.

6Grille par niveau

NiveauMaîtrise attendueSignal GONO-GO
JuniorA utilisé l'API DataFrame sur des cas guidésComprend l'idée du calcul distribuéA « fait du Spark » sur un mini-dataset
ConfirméTraitements réels, partitionnement, volumétrieJustifie Spark par le volume, cite un cas réelNe sait pas pourquoi Spark plutôt qu'un script
SeniorOptimisation (shuffle, skew), coûts clusterRaconte un job optimisé et son impactNe parle jamais de coût ni de performance
LeadArchitecture distribuée, standards, arbitrages coûtSait quand ne PAS utiliser SparkAjoute Spark pour « faire sérieux »

Vous recrutez un profil data ?

Data Builder mène l'entretien technique et vous livre un rapport clair et détaillé sous 24h. Premier entretien offert.

Tester gratuitementRéserver un appel