Pôle Data & IA
Data et intelligence artificielle : de la donnée brute au modèle en production
Data engineering et data science forment une seule chaîne. Un modèle ne vaut que ce que valent les flux qui l'alimentent, et un entrepôt sans usage métier est un coût sans contrepartie.
La plupart des projets data échouent au même endroit : entre le moment où le prototype fonctionne sur un ordinateur portable et le moment où il doit tourner tous les matins sans surveillance. Ce passage coûte généralement plus cher que le prototype lui-même, et il est presque toujours sous-estimé.
Nous traitons le sujet dans l'ordre inverse de l'habitude. Nous commençons par déterminer si la donnée existe et si elle est exploitable, nous établissons la solution la plus simple qui répond au besoin, et nous ne construisons de complexité que si elle bat cette référence sur une métrique décidée à l'avance.
Les symptômes que nous voyons le plus souvent
- Deux tableaux de bord censés dire la même chose affichent des chiffres différents
- Un patrimoine de flux dont personne ne sait quelle partie est encore consommée
- Un ou plusieurs POC d'intelligence artificielle abandonnés avant la production
- Une fenêtre de chargement nocturne qui déborde sur les heures d'ouverture
- Un modèle en production dont plus personne ne sait s'il fonctionne encore
- Une seule personne capable de modifier les flux, et elle est indispensable partout
Notre façon de traiter le sujet
Supprimer avant de migrer
Sur un patrimoine ancien, une part significative des flux n'a plus aucun consommateur. Les identifier et les éteindre est le gain le moins cher disponible, et il réduit mécaniquement le coût de tout ce qui suit.
Une définition par indicateur
La cause la plus fréquente de chiffres divergents n'est pas un bug, c'est deux définitions métier différentes du même indicateur. Nous les faisons trancher par le contrôle de gestion et nous les écrivons dans la couche sémantique.
La baseline avant le modèle
Une moyenne mobile, une règle métier simple, la valeur du mois précédent. Tout modèle doit battre cette référence sur la métrique retenue, sinon il ne part pas en production — et il arrive régulièrement que la référence gagne.
Le double run avant la bascule
Ancien et nouveau pipeline tournent en parallèle sur la même fenêtre, avec réconciliation automatique. Tout écart bloque la bascule. Nous ne basculons jamais sur la foi d'un test unitaire.
Les services de ce pôle
Questions fréquentes
Par où commencer quand tout semble prioritaire ?
Par l'inventaire et le lignage. Tant que vous ne savez pas quel rapport dépend de quel flux, toute décision de priorisation se prend à l'aveugle et toute suppression fait peur. Deux à trois semaines suffisent généralement à sortir de cette situation.
Faut-il un entrepôt cloud pour faire de l'IA ?
Non. Beaucoup de cas d'usage utiles se traitent sur des volumes qui tiennent dans une base relationnelle correctement indexée. La question n'est pas la technologie mais la fraîcheur, la traçabilité et la qualité de la donnée. Un entrepôt cloud sur des données non fiables ne produit que des erreurs plus rapides.
Combien de temps avant un premier résultat exploitable ?
Le cadrage produit un résultat exploitable en deux semaines : vous savez si le cas d'usage est faisable, avec quelles données et à quel prix. La mise en production complète prend ensuite six à douze semaines selon la complexité et la qualité des flux amont.
Vingt minutes suffisent pour savoir si nous sommes utiles
Aucune présentation commerciale. Vous décrivez votre besoin ; nous vous disons s'il entre dans notre périmètre, dans quel délai et à quel budget. Si ce n'est pas pour nous, vous le saurez pendant l'appel.