Senior Software Engineer, Data & AI (H/F) | Ingestion de données et IA en production | Remote France
Des millions de lignes de données transport par jour, dans tous les formats possibles, venant des plus grands groupes français. Votre mission : en faire une donnée propre et fiable, et y mettre de l'IA là où elle apporte vraiment quelque chose, en production.
L'entreprise
Une startup SaaS parisienne créée il y a moins d'un an, qui aide les grands chargeurs à réduire à la fois leurs coûts de transport et leurs émissions de CO₂. Elle réunit cinq associés : des entrepreneurs tech et des experts qui conseillent depuis plus de vingt ans les directions transport des grands groupes. Deux groupes du CAC 40 sont déjà clients, la seed est bouclée, et l'équipe tech reste volontairement petite et très senior.
Votre mission
Vous prenez la responsabilité de la couche d'ingestion : les pipelines qui transforment les données hétérogènes des clients en un modèle canonique, sur lequel reposent l'optimisation des coûts et le calcul carbone. Vous devenez aussi la référence IA de l'équipe. C'est d'abord un poste d'ingénierie logicielle : l'ingestion est votre responsabilité première, l'IA est le levier que vous y apportez.
Ce que vous allez construire
- Des workflows d'ingestion (DBOS, TypeScript/Bun, PostgreSQL) fiables, idempotents, observables et capables de tenir un volume multiplié par dix.
- La normalisation des données clients : mapping de schémas, validation, qualité de données, messages d'erreur exploitables par les clients.
- L'IA dans le pipeline : par exemple le fine-tuning d'un modèle open source pour le mapping et la lecture de documents, ou des Large Tabular Models sur les données structurées.
- Le déploiement et l'exploitation de ces modèles sur Google Cloud / Vertex AI : évaluation, monitoring, arbitrages coût et latence. Python pour l'entraînement et le serving, TypeScript pour l'orchestration.
L'échelle : environ 10 millions de lignes par jour aujourd'hui, 100 millions d'ici 12 mois ; 1 à 10 Go de fichiers par jour (EDI, CSV, XLS, API de TMS) et des documents non structurés.
Votre profil
Ce qui est indispensable
- Une solide expérience d'ingénierie logicielle : vous avez construit et opéré des systèmes data-intensive en production, pas seulement des prototypes.
- Un très bon niveau en TypeScript et de l'aisance en Python.
- Une connaissance approfondie de PostgreSQL.
- Une expérience d'un moteur de workflows ou d'orchestration (DBOS, Temporal, Airflow, Dagster ou équivalent).
- De l'IA en production : post-training d'un modèle open source (fine-tuning, LoRA, évaluation) et/ou Large Tabular Models. Vous savez faire la différence entre une démo et un système sur lequel des clients comptent.
- La capacité à rédiger une analyse technique claire et à défendre une recommandation.
- Un français courant.
Ce qui serait un plus
- Parquet, DuckDB ou d'autres formats et moteurs analytiques.
- Une expérience de R&D en machine learning.
- Des intégrations EDI ou TMS.
- Une connaissance de la logistique, de la supply chain ou du transport.
Ce que vous trouverez ici
- La responsabilité complète de la donnée d'entrée, dont dépend tout le produit.
- De l'IA en production sur des données réelles et des volumes réels, pas des démonstrations.
- Le rôle de premier spécialiste data et IA d'une équipe de quatre ingénieurs seniors, avec un poids croissant sur les choix de la stack.
- Un impact mesurable sur les coûts et les émissions de CO₂ de très grands groupes.
Conditions
- Rémunération : 80 000 à 110 000 € brut annuel fixe selon l'expérience, plus des BSPCE.
- Contrat : CDI (freelance possible).
- Remote depuis la France ; candidats parisiens bienvenus.
- Mutuelle, tickets restaurant, remboursement du Pass Navigo.
Le processus
- Échange téléphonique avec le cabinet.
- Entretien technique avec l'équipe, avec un exercice de machine learning sur des données de transport anonymisées.
- Entretien produit avec le CPO.
- Entretien avec les fondateurs.