Questions d'entretien
Spark : 6 questions d'entretien pour cadrer le niveau du candidat
Spark attire les buzzwords. Ces questions vérifient si le candidat comprend vraiment le calcul distribué — ou s'il a juste « fait du Spark » sur un mini-dataset. La question du volume est décisive.
Data Builder·Juillet 2025·8 min de lecture·Cible : recruteurs & hiring managers · Spark
Une seule question sur le volume traité suffit souvent à révéler un profil gonflé.
1Sur quel volume avez-vous utilisé Spark, et pourquoi pas un script simple
La question
Sur quel volume avez-vous utilisé Spark, et pourquoi pas un script simple ?
LA question décisive : elle sépare l'expérience réelle du buzzword.
- Bonne réponse : un volume crédible (dizaines de millions de lignes, To) et une justification.
- Il sait dire quand Spark n'était PAS le bon choix.
Signal d'alerte : un candidat vague sur le volume, ou qui a « fait du Spark » sur un petit jeu de données, est presque toujours gonflé.
2Qu'est-ce qu'un shuffle et pourquoi c'est important
La question
Qu'est-ce qu'un shuffle et pourquoi c'est important ?
La question technique la plus discriminante : sans elle, pas d'optimisation possible.
- Bonne réponse : un déplacement de données entre machines, coûteux, déclenché par groupBy/join.
- Il relie ça à la performance et au partitionnement.
Signal d'alerte : ne pas savoir ce qu'est un shuffle est éliminatoire pour un poste d'ingénierie Spark.
3Comment joindre une grosse table avec une petite efficacement
La question
Comment joindre une grosse table avec une petite efficacement ?
Une question pratique qui révèle la maîtrise de l'optimisation distribuée.
- Bonne réponse : un broadcast join pour éviter le shuffle de la grosse table.
- Il connaît le sort-merge join par défaut et le skew.
4Grille par niveau
| Niveau | Maîtrise attendue | Signal GO | NO-GO |
|---|
| Junior | API DataFrame sur cas guidés | Comprend l'idée du distribué | A « fait du Spark » sur un mini-dataset |
| Confirmé | Shuffle, partitionnement, broadcast | Explique un shuffle, cite un vrai cas | Ne sait pas ce qu'est un shuffle |
| Senior | Skew, tuning, Spark UI | Diagnostique un job lent | Ne parle jamais de coût/performance |
| Lead | Architecture distribuée, arbitrages | Sait quand ne PAS utiliser Spark | Ajoute Spark pour « faire sérieux » |
Interview questions
Spark: 6 interview questions to gauge the candidate's level
Spark attracts buzzwords. These questions check whether the candidate really understands distributed computing — or just ‘did Spark’ on a tiny dataset. The volume question is decisive.
Data Builder·July 2025·8 min read·For: recruiters & hiring managers · Spark
A single question about the volume handled is often enough to reveal an inflated profile.
1What volume did you use Spark on, and why not a simple script
The question
What volume did you use Spark on, and why not a simple script
THE decisive question: it separates real experience from the buzzword.
- Good answer: a credible volume (tens of millions of rows, TB) and a justification.
- They can say when Spark was NOT the right choice.
Warning signal : a candidate vague on volume, or who ‘did Spark’ on a small dataset, is almost always inflated.
2What is a shuffle and why does it matter
The question
What is a shuffle and why does it matter
The most discriminating technical question: without it, no optimization is possible.
- Good answer: data movement between machines, costly, triggered by groupBy/join.
- They tie it to performance and partitioning.
Warning signal : not knowing what a shuffle is is disqualifying for a Spark engineering role.
3How do you efficiently join a large table with a small one
The question
How do you efficiently join a large table with a small one
A practical question that reveals distributed-optimization mastery.
- Good answer: a broadcast join to avoid shuffling the large table.
- They know the default sort-merge join and skew.
4Level grid
| Level | Expected proficiency | Signal GO | NO-GO |
|---|
| Junior | DataFrame API on guided cases | Understands the distributed idea | ‘Did Spark’ on a tiny dataset |
| Mid-level | Shuffle, partitioning, broadcast | Explains a shuffle, cites a real case | Doesn't know what a shuffle is |
| Senior | Skew, tuning, Spark UI | Diagnoses a slow job | Never mentions cost/performance |
| Lead | Distributed architecture, trade-offs | Knows when NOT to use Spark | Adds Spark to ‘look serious’ |