Ingénieur IA - Machine Learning et Deep Learning pour la cyber (H/F) FANTOM DETECTIVE
Poissy (78)CDI
Salaire non précisé
Il y a 1 heures sur le WebSoyez parmi les premiers à postuler
Critères de l'offre
Métiers :
- Ingénieur Machine Learning (H/F)
Expérience min :
- 3 à 5 ans
Secteur :
- ESN, Editeurs de logiciel, Services informatiques
Diplômes :
- Bac+5
Lieux :
- Poissy (78)
Conditions :
- CDI
- Salaire non précisé
- Temps Plein
Description du poste
Cimvex est un système de cybersécurité en cours de développement. Il vise à exploiter les logs, les configurations et les données des outils de sécurité pour détecter les attaques informatiques, identifier les vulnérabilités et proposer des remédiations adaptées au contexte de chaque entreprise.
Votre responsabilité sera de construire les modèles et les traitements qui permettent de tirer des informations fiables de ces données. Vous collaborerez avec le fondateur, expert Splunk et SOC, et avec un ingénieur chargé des LLM et des agents intelligents.
CE QUE VOUS PRENDREZ EN CHARGE
Vous commencerez par explorer les données disponibles : événements de sécurité, inventaires, configurations et résultats de scanners de vulnérabilités. Vous développerez les traitements nécessaires à leur nettoyage, leur normalisation et leur exploitation.
Cela comprend la reconnaissance des formats, le rapprochement des champs, le contrôle des horodatages et l'identification des informations manquantes. Vous constituerez également les jeux de données d'entraînement et de test, avec une attention particulière à la qualité des annotations et à leur représentativité.
Développer les modèles de détection
Vous sélectionnerez, entraînerez et évaluerez des modèles de classification, de regroupement et de détection d'anomalies. Selon les besoins, vous utiliserez des méthodes statistiques, des algorithmes de machine learning ou des réseaux de neurones adaptés aux données textuelles et séquentielles.
Vous étudierez notamment les enchaînements d'événements afin d'identifier des comportements suspects et des scénarios d'attaque. Chaque approche sera comparée à une méthode de référence pour vérifier son apport réel.
Contextualiser les vulnérabilités et les risques
Vous développerez les rapprochements entre les actifs, leurs versions logicielles, leurs configurations et les vulnérabilités connues. L'objectif sera de faire ressortir les expositions pertinentes, tout en signalant les cas nécessitant une vérification complémentaire.
Vous contribuerez au classement des risques en tenant compte de la criticité des systèmes, de leur exposition et des indices d'exploitation disponibles. Ces résultats alimenteront les recommandations de remédiation proposées par Cimvex.
Mesurer la fiabilité des résultats
Vous définirez les protocoles d'évaluation et analyserez les erreurs : faux positifs, attaques non détectées, biais des jeux de données et difficultés de généralisation.
Vous devrez savoir traiter les classes déséquilibrées, éviter les fuites de données entre entraînement et test, calibrer les scores et définir les situations où un modèle doit signaler son incertitude. Les performances attendues devront être évaluées dans des conditions proches de l'utilisation réelle.
Intégrer les modèles au produit
Vous développerez des traitements reproductibles et des services d'inférence utilisables par les autres composants de Cimvex. Vous assurerez le versionnement des données et des modèles, la documentation et le suivi des performances après déploiement.
Vous participerez également à l'optimisation des temps de traitement et des ressources nécessaires à l'analyse de volumes importants.
LE BAGAGE TECHNIQUE ATTENDU
Nous recherchons une personne capable de développer et d'évaluer des modèles de manière autonome, avec :
- Une très bonne maîtrise de Python, SQL et des bibliothèques de traitement de données.
- Une pratique solide du machine learning supervisé et non supervisé.
- Une expérience concrète de l'entraînement et de l'adaptation de réseaux de neurones avec PyTorch ou TensorFlow.
- Une compréhension des mécanismes d'apprentissage : fonctions de perte, rétropropagation, optimisation, régularisation et généralisation.
- Une connaissance des Transformers, des embeddings et de l'analyse de séquences.
Votre responsabilité sera de construire les modèles et les traitements qui permettent de tirer des informations fiables de ces données. Vous collaborerez avec le fondateur, expert Splunk et SOC, et avec un ingénieur chargé des LLM et des agents intelligents.
CE QUE VOUS PRENDREZ EN CHARGE
Vous commencerez par explorer les données disponibles : événements de sécurité, inventaires, configurations et résultats de scanners de vulnérabilités. Vous développerez les traitements nécessaires à leur nettoyage, leur normalisation et leur exploitation.
Cela comprend la reconnaissance des formats, le rapprochement des champs, le contrôle des horodatages et l'identification des informations manquantes. Vous constituerez également les jeux de données d'entraînement et de test, avec une attention particulière à la qualité des annotations et à leur représentativité.
Développer les modèles de détection
Vous sélectionnerez, entraînerez et évaluerez des modèles de classification, de regroupement et de détection d'anomalies. Selon les besoins, vous utiliserez des méthodes statistiques, des algorithmes de machine learning ou des réseaux de neurones adaptés aux données textuelles et séquentielles.
Vous étudierez notamment les enchaînements d'événements afin d'identifier des comportements suspects et des scénarios d'attaque. Chaque approche sera comparée à une méthode de référence pour vérifier son apport réel.
Contextualiser les vulnérabilités et les risques
Vous développerez les rapprochements entre les actifs, leurs versions logicielles, leurs configurations et les vulnérabilités connues. L'objectif sera de faire ressortir les expositions pertinentes, tout en signalant les cas nécessitant une vérification complémentaire.
Vous contribuerez au classement des risques en tenant compte de la criticité des systèmes, de leur exposition et des indices d'exploitation disponibles. Ces résultats alimenteront les recommandations de remédiation proposées par Cimvex.
Mesurer la fiabilité des résultats
Vous définirez les protocoles d'évaluation et analyserez les erreurs : faux positifs, attaques non détectées, biais des jeux de données et difficultés de généralisation.
Vous devrez savoir traiter les classes déséquilibrées, éviter les fuites de données entre entraînement et test, calibrer les scores et définir les situations où un modèle doit signaler son incertitude. Les performances attendues devront être évaluées dans des conditions proches de l'utilisation réelle.
Intégrer les modèles au produit
Vous développerez des traitements reproductibles et des services d'inférence utilisables par les autres composants de Cimvex. Vous assurerez le versionnement des données et des modèles, la documentation et le suivi des performances après déploiement.
Vous participerez également à l'optimisation des temps de traitement et des ressources nécessaires à l'analyse de volumes importants.
LE BAGAGE TECHNIQUE ATTENDU
Nous recherchons une personne capable de développer et d'évaluer des modèles de manière autonome, avec :
- Une très bonne maîtrise de Python, SQL et des bibliothèques de traitement de données.
- Une pratique solide du machine learning supervisé et non supervisé.
- Une expérience concrète de l'entraînement et de l'adaptation de réseaux de neurones avec PyTorch ou TensorFlow.
- Une compréhension des mécanismes d'apprentissage : fonctions de perte, rétropropagation, optimisation, régularisation et généralisation.
- Une connaissance des Transformers, des embeddings et de l'analyse de séquences.
Salaire et avantages
Annuel de 35000.0 Euros à 40000.0 Euros
Primes
Primes
Référence : 213SKKX
Recommandé pour vous

La Défense (92)CDI Salaire non précisé Il y a 22 jours

Bois-Colombes (92)CDI 65 000 € - 85 000 € par an Il y a 18 jours

Bois-Colombes (92)CDI 65 000 € - 85 000 € par an Il y a 19 jours