Dans le cadre de l'exploitation, de l'évolution et de l'industrialisation d'une plateforme IA basée sur OpenShift AI, nous recherchons un expert technique capable d'intervenir sur les activités de RUN, d'automatisation et de transformation de la plateforme.
Le consultant rejoindra une équipe en place et jouera également un rôle clé dans l'accompagnement des équipes d'exploitation et du Service.
Exploitation & Administration OpenShift AI
• Administration et maintien en conditions opérationnelles des plateformes OpenShift AI.
• Traitement des incidents et demandes de support.
• Supervision de l'environnement Kubernetes/OpenShift.
• Réalisation des opérations de patching et montées de version.
• Gestion des workloads, namespaces, quotas et déploiements.
• Gestion des certificats, accès et configurations de la plateforme.
Infrastructure & Plateforme
• Administration des clusters OpenShift sur infrastructures VMware et BareMetal.
• Gestion des ressources GPU.
• Administration du stockage et de la persistance des données.
• Gestion des composants réseau OpenShift (Ingress, Network Policies, exposition des services).
OpenShift AI & MLOps
• Administration des Data Science Projects et Workbenches.
• Gestion des services de Model Serving (ModelMesh).
• Déploiement et exploitation de pipelines ML.
• Gestion et optimisation des ressources GPU pour les usages IA.
• Accompagnement des équipes Data Science et IA.
Automatisation & Industrialisation
• Mise en œuvre des pratiques GitOps et CI/CD.
• Déploiement d'applications via Helm.
• Administration d'ArgoCD et des pipelines Tekton.
• Automatisation des opérations récurrentes.
• Participation aux projets de transformation et d'industrialisation de la plateforme.
Formation & Accompagnement
• Formation des équipes en charge du RUN.
• Accompagnement et montée en compétence du Service Owner.
• Documentation des procédures et bonnes pratiques.
• Réalisation des transferts de connaissances vers les équipes d'exploitation
Environnement technique
Plateforme
• OpenShift
• OpenShift AI
• Kubernetes
MLOps / IA
• ModelMesh
• Kubeflow / RHODS Pipelines
• vLLM (apprécié)
• GPU NVIDIA / GPU Operator
• MIG Profiles
Automatisation & CI/CD
• GitOps
• ArgoCD
• Helm
• Tekton
Observabilité
• Prometheus
• Grafana
• Alertmanager
• Loki / Elastic
Sécurité & Gouvernance
• RBAC
• OpenShift ACS
• ACM (Advanced Cluster Management)
• Quay Enterprise
Infrastructure
• VMware
• BareMetal
• OpenShift Data Foundation (ODF)
Profil recherché
• Expert OpenShift / Kubernetes confirmé.
• Expérience significative sur OpenShift AI et les environnements MLOps.
• Bonne compréhension des architectures IA et des environnements GPU.
• Expérience en automatisation, industrialisation et CI/CD.
• Capacité à accompagner et former des équipes.
• Aisance dans les environnements de transformation et d'amélioration continue.
Conditions
• Démarrage : ASAP
• Mission longue durée
• Localisation : Gémenos (13)
• Présence sur site : 3 jours/semaine minimum