Accueil›Blog›8 questions Python data pour un entretien de recrutement
Questions d'entretien
8 questions Python data pour un entretien de recrutement
En data, on ne juge pas Python comme du développement classique : ce qui compte, c'est le rapport à la donnée et à la fiabilité. Ces questions, orientées data, font parler le candidat sur ce qui compte vraiment en poste.
Data Builder·Juillet 2025·9 min de lecture·Cible : recruteurs & hiring managers · Python
Le fil rouge : chercher le rapport à la donnée réelle, pas la syntaxe. Un candidat qui ne parle jamais de données, de nettoyage ou de fiabilité n'a probablement pas d'expérience data en entreprise.
1Comment agrégez-vous et joignez-vous deux jeux de données en pandas
La question
Comment agrégez-vous et joignez-vous deux jeux de données en pandas ?
Le geste le plus courant du data en Python : sa fluidité en dit long.
- Bonne réponse : merge/join en maîtrisant le type de jointure et les clés.
- Il utilise groupby().agg() naturellement pour agréger.
- Il évite les boucles ligne à ligne au profit de la vectorisation.
Signal d'alerte : boucler avec iterrows pour une opération vectorisable révèle une méconnaissance des coûts.
2On vous donne un CSV sale. Comment le fiabilisez-vous
La question
On vous donne un CSV sale. Comment le fiabilisez-vous ?
La question qui sépare le producteur de résultats fiables du bricoleur.
- Bonne réponse : diagnostiquer valeurs manquantes, doublons, types, dates.
- Il ne fait pas de dropna/fillna à l'aveugle : il comprend d'abord.
- Il documente ce qu'il a nettoyé et pourquoi.
Signal d'alerte : conclure sans avoir vérifié NA et doublons trahit un profil fragile sur la donnée réelle.
3Racontez un script que vous avez mis en production
La question
Racontez un script que vous avez mis en production ?
La question la plus discriminante : elle révèle l'expérience réelle vs la formation.
- Bonne réponse : parle de tests, de gestion d'erreurs, de ce qui a cassé.
- Il évoque des données réelles, pas un notebook d'exercice.
- Il assume un incident passé et ce qu'il en a tiré.
Signal d'alerte : présenter un notebook de formation comme un projet de production révèle un manque d'expérience.
4Le jeu de données ne tient plus en mémoire. Que faites-vous
La question
Le jeu de données ne tient plus en mémoire. Que faites-vous ?
Une question de séniorité : savoir quand quitter pandas est un vrai marqueur.
- Bonne réponse : réduire l'empreinte (dtypes), traiter par lots (chunking).
- Il envisage un autre moteur : DuckDB, Polars, ou Spark à l'échelle.
- Il justifie son choix par le volume, pas par la mode.
5Grille par niveau
| Niveau | Maîtrise attendue | Signal GO | NO-GO |
|---|
| Junior | pandas de base, scripts simples | Agrège et joint proprement | Ne parle que de syntaxe, jamais de données |
| Confirmé | Nettoyage, vectorisation, quelques tests | Fiabilise un CSV sale méthodiquement | Fait du dropna à l'aveugle |
| Senior | Production, robustesse, volumétrie | Raconte un incident de prod et sa résolution | Ne distingue pas script et production |
| Lead | Architecture, standards, mentorat | Sait quand quitter pandas et pourquoi | Sur-complexifie sans raison |
Home›Blog›8 Python data questions for a hiring interview
Interview questions
8 Python data questions for a hiring interview
In data, you don't judge Python like classic development: what matters is the relationship to data and reliability. These data-oriented questions get the candidate talking about what really matters on the job.
Data Builder·July 2025·9 min read·For: recruiters & hiring managers · Python
The through-line: look for the relationship to real data, not syntax. A candidate who never mentions data, cleaning or reliability likely lacks enterprise data experience.
1How do you aggregate and join two datasets in pandas
The question
How do you aggregate and join two datasets in pandas
The most common Python-in-data move: their fluency says a lot.
- Good answer: merge/join, mastering the join type and keys.
- They use groupby().agg() naturally to aggregate.
- They avoid row-wise loops in favour of vectorization.
Warning signal : looping with iterrows for a vectorizable operation reveals a lack of cost awareness.
2You're given a messy CSV. How do you make it reliable
The question
You're given a messy CSV. How do you make it reliable
The question that separates the reliable-results producer from the tinkerer.
- Good answer: diagnose missing values, duplicates, types, dates.
- They don't dropna/fillna blindly: they understand first.
- They document what they cleaned and why.
Warning signal : concluding without checking NAs and duplicates betrays a profile fragile on real data.
3Tell me about a script you shipped to production
The question
Tell me about a script you shipped to production
The most discriminating question: it reveals real experience vs training.
- Good answer: talks tests, error handling, what broke.
- They mention real data, not an exercise notebook.
- They own a past incident and what they learned.
Warning signal : presenting a training notebook as a production project reveals a lack of experience.
4The dataset no longer fits in memory. What do you do
The question
The dataset no longer fits in memory. What do you do
A seniority question: knowing when to leave pandas is a real marker.
- Good answer: reduce footprint (dtypes), process in batches (chunking).
- They consider another engine: DuckDB, Polars, or Spark at scale.
- They justify their choice by volume, not by trend.
5Level grid
| Level | Expected proficiency | Signal GO | NO-GO |
|---|
| Junior | Basic pandas, simple scripts | Aggregates and joins cleanly | Only talks syntax, never data |
| Mid-level | Cleaning, vectorization, some tests | Cleans a messy CSV methodically | dropna blindly |
| Senior | Production, robustness, volume | Recounts a prod incident and its fix | Doesn't distinguish script from production |
| Lead | Architecture, standards, mentoring | Knows when and why to leave pandas | Over-complicates for no reason |