Summary
DRW est une société de négoce diversifiée qui combine une technologie sophistiquée et des personnes exceptionnelles pour opérer sur les marchés mondiaux. L’entreprise recherche un développeur de données pour concevoir des pipelines, des systèmes RAG et des solutions évolutives destinées aux données analytiques, relationnelles, structurées et non structurées. Le rôle consiste également à optimiser les flux d’embeddings, la recherche sémantique et les systèmes d’IA et de machine learning.
Responsibilities
- Concevoir et développer des pipelines de données pour des systèmes RAG, incluant l’ingestion de documents, le découpage (chunking), la génération d’embeddings et le stockage vectoriel
- Construire des pipelines d’ingestion pour des sources de données structurées et non structurées vers un "data lake" centralisé, en garantissant des données propres, normalisées et accessibles pour l’analytique, la recherche et les charges de travail en IA
- Développer des "workflows" de traitement de données pour préparer et optimiser les ensembles de données destinés au fine-tuning et à l’inférence
- Mettre en place des frameworks de monitoring et d’évaluation pour mesurer la qualité de la récupération, la latence et la performance des systèmes
- Collaborer avec les ingénieurs ML afin d’optimiser les formats de données et les schémas de stockage pour l’inférence accélérée par GPU
- Implémenter des stratégies de cache et des systèmes de versionnement des données pour améliorer l’efficacité du serving des modèles
- Déployer et gérer des bases de données vectorielles, des services d’embeddings et des pipelines de traitement de données
- Mener des initiatives visant à améliorer la qualité des données, réduire la latence et accroître la précision des systèmes de recherche
- Se tenir à jour en continu sur les technologies émergentes et les meilleures pratiques en ingénierie des données et en IA
- Contribuer de manière proactive avec des idées de nouveaux outils, d’améliorations de processus et d’adoption technologique pour faire progresser l’équipe
Skills
- Licence ou maîtrise en informatique, ingénierie des données ou domaine connexe
- 2 à 5 ans d'expérience dans la conception de systèmes et de pipelines de données en environnement de production
- Solide expérience avec les architectures RAG, incluant les bases de données vectorielles (Milvus, ChromaDB, Pinecone, Weaviate ou Qdrant)
- Maîtrise de Python avec expérience des plateformes d'orchestration basées sur des DAG (Airflow, Dagster, Prefect ou équivalent)
- Expérience pratique avec les modèles d'embeddings et les systèmes de recherche sémantique
- Expérience avec des frameworks de traitement de données distribués (Apache Spark, Ray ou Dask)
- Bonne compréhension des techniques d'optimisation de l'inférence LLM et du prompt engineering
- Familiarité avec Docker, la conteneurisation et les plateformes d'orchestration
- Solide compréhension des bonnes pratiques en ingénierie des données, incluant la modélisation des données, les patterns ETL/ELT et la qualité des données
Qualifications
Must Haves
- Licence ou maîtrise en informatique, ingénierie des données ou domaine connexe
- 2 à 5 ans d'expérience dans la conception de systèmes et de pipelines de données en environnement de production
- Solide expérience avec les architectures RAG, incluant les bases de données vectorielles (Milvus, ChromaDB, Pinecone, Weaviate ou Qdrant)
- Maîtrise de Python avec expérience des plateformes d'orchestration basées sur des DAG (Airflow, Dagster, Prefect ou équivalent)
- Expérience pratique avec les modèles d'embeddings et les systèmes de recherche sémantique
- Expérience avec des frameworks de traitement de données distribués (Apache Spark, Ray ou Dask)
- Bonne compréhension des techniques d'optimisation de l'inférence LLM et du prompt engineering
- Familiarité avec Docker, la conteneurisation et les plateformes d'orchestration
- Solide compréhension des bonnes pratiques en ingénierie des données, incluant la modélisation des données, les patterns ETL/ELT et la qualité des données
Benefits
- Engagement en faveur de la formation et du développement continus
- Un ensemble d'avantages et de bénéfices à la pointe de l'industrie
- Centré sur le bien-être des employés et l'équilibre entre vie professionnelle et vie privée
- Initiatives communautaires, programme de volontariat et possibilités de redonner