Les règles d'extraction, taxonomies, conventions de labellisation, contrats de qualité, permissions et traitements d'exception sont structurés dans une même fondation opérationnelle.
Apshan
Pour Apshan, nous avons conçu un lakehouse qui transforme des sources hétérogènes en données structurées, contrôlées et accessibles aux agents. Des CLI sur mesure exécutent les flux courants de façon autonome ; les anomalies et les changements de règles restent soumis à validation humaine.
Le système livré
Opérations prises en charge
Architecture livrée
- 01Custom CLIExtraction et normalisation
Commandes spécialisées pour chaque source et chaque étape du pipeline.
- 02AWS S3Stockage objet canonique
- 03Apache IcebergTables versionnées et interopérables
- 04LakekeeperCatalogue Apache Iceberg
- 05QdrantMémoire vectorielle pour les agents
- 06DagsterOrchestration et observabilité
- 07AWS IAMIdentités et accès à privilèges minimaux
- 08A2A ProtocolInteropérabilité entre agents
Outils connectés
- AWS S3
- AWS IAM
Pilotage et contrôle
Mémoire opérationnelle
Savoir-faire structuré
Corrections réutilisables
Une correction humaine validée devient une règle de normalisation, un exemple de labellisation ou un contrôle réutilisable dans les exécutions suivantes. Le système ne modifie pas seul ses règles.
Garde-fous opérationnels
- Data qualityPublication bloquée si les contrôles échouent
- Chaque lot doit respecter les contrats de schéma et de qualité avant d'entrer dans les tables disponibles aux agents.
- Access controlDroits minimaux par service
- AWS IAM sépare les identités et limite chaque composant aux ressources nécessaires.
- ObservabilityExécutions observables
- L'orchestration expose l'état des pipelines, les échecs et les étapes qui nécessitent une intervention.
- RecoveryDonnées et tables versionnées
- Le stockage canonique et les snapshots Apache Iceberg permettent de retrouver un état antérieur des données.
- AuditabilityDécisions de pipeline traçables
- Les validations, rejets et traitements d'exception restent associés à leur exécution.
Étude de cas
Le problème
Apshan devait collecter et rapprocher des données mode provenant de sources multiples, avec des formats, des taxonomies et des niveaux de qualité différents. Les traitements manuels ne pouvaient ni suivre le volume ni produire une mémoire cohérente pour les produits et les agents.
Le système devait automatiser l'extraction et la labellisation sans laisser passer des données non conformes, tout en conservant des droits d'accès explicites et des points de validation humaine pour les exceptions.
La solution
Nous avons livré une fondation de données unifiée : stockage canonique sur AWS S3, tables Apache Iceberg, catalogue Lakekeeper et mémoire vectorielle Qdrant. Dagster orchestre les flux et rend chaque exécution observable.
- Des CLI sur mesure extraient, normalisent, labellisent et enrichissent les données.
- Des portes de qualité bloquent la publication des lots non conformes et remontent les exceptions.
- AWS IAM limite les accès par service ; le protocole A2A rend la mémoire et les capacités disponibles aux agents autorisés.
- Le site bilingue d'Apshan complète le système comme vitrine publique de la plateforme.
Interface publique, livrée également
Quelle partie de vos livrables confieriez-vous en premier ?
Réservez un appel pour cartographier comment ces livrables sont produits aujourd'hui, choisir le premier workflow à construire, et fixer ce qui reste sous votre contrôle.







