IA d'entreprise sécurisée

Choisir une IA d'entreprise sécurisée on premise

Vos dossiers réglementaires, vos contrats et vos données patients ou clients n'ont pas vocation à transiter par un service tiers. Cette page donne la grille de sélection, l'architecture de référence, le coût réel et les clauses d'appel d'offres pour une IA qui reste à l'intérieur de votre système d'information.

En bref

Une IA d'entreprise sécurisée on premise désigne un système dont les modèles de langage s'exécutent sur des serveurs contrôlés par l'organisation, à l'intérieur de son réseau. Aucune requête, aucun document et aucune réponse ne sortent vers un fournisseur externe.

Pour des données personnelles ou de la documentation sensible, la CNIL juge ce mode de déploiement généralement plus opportun et plus sécurisé que le recours à un service tiers, parce qu'il limite les risques d'extraction de données auprès de ce tiers.

BADIS AI édite une suite logicielle conçue pour ce cadre. Elle s'installe sur vos serveurs, s'appuie sur des modèles de langage open-weight servis localement, respecte vos droits d'accès existants et journalise les requêtes pour l'audit. Les secteurs adressés sont l'industrie pharmaceutique, l'administration, l'éducation et l'industrie.

0
Requête sortante vers un fournisseur tiers
CNIL
Le déploiement sur site privilégié pour les données sensibles
ANSSI
Cadre de sécurisation d'un système d'IA générative
7 critères
Pour arbitrer une shortlist sans se tromper

Ce que dit le cadre applicable

Deux références françaises suffisent à cadrer la décision, avant même d'entrer dans la comparaison des offres.

CNIL, le déploiement sur site pour les données sensibles

Dans ses questions-réponses du 18 juillet 2024 sur l'utilisation d'un système d'IA générative, la CNIL distingue les usages non confidentiels des usages qui exposent des données personnelles ou de la documentation sensible ou stratégique, notamment pour du RAG. Pour ces derniers, elle estime généralement plus opportun et plus sécurisé de privilégier le déploiement de solutions sur site, qui limitent les risques d'extraction de données auprès d'un tiers.

ANSSI, sécuriser l'architecture du système d'IA

Le guide ANSSI-PA-102 publié le 29 avril 2024 porte sur la sécurisation de l'architecture d'un système d'IA générative, phase par phase, de l'entraînement à la mise en production. La CNIL y renvoie explicitement. Un cahier des charges sérieux s'appuie sur ces deux documents plutôt que sur la brochure commerciale d'un éditeur, y compris la nôtre.

Le règlement européen sur l'IA ajoute des obligations de transparence et de littératie pour les usages courants, et des obligations renforcées pour les systèmes à haut risque. Un assistant documentaire interne relève le plus souvent du premier cas. La qualification reste toutefois à mener dossier par dossier, avec votre délégué à la protection des données. Le détail des obligations et du calendrier figure sur notre page conformité AI Act.

Sept critères pour arbitrer une shortlist

Pour comparer des offres d'IA d'entreprise on premise, sept questions suffisent à écarter les solutions qui ne tiennent pas la promesse de confinement des données.

Critère La question à poser La réponse attendue
Lieu d'exécution Où tourne l'inférence, sur quelle machine et sous quelle responsabilité ? Sur le matériel de l'organisation ou sur un environnement privé dédié, sans appel sortant pendant le traitement d'une requête.
Coupure réseau Le service répond-il encore si la liaison internet tombe ? Fonctionnement nominal démontré en environnement fermé, la connexion externe ne servant qu'aux mises à jour.
Modèles Quels modèles, quelles versions, quelles licences ? Modèles open-weight identifiés, poids présents sur site, absence de dépendance à une API de modèle propriétaire.
Droits d'accès L'outil respecte-t-il les habilitations déjà en place ? Intégration à l'annuaire d'entreprise et filtrage appliqué à la récupération des documents, pas seulement à l'affichage du résultat.
Traçabilité Quelles requêtes sont journalisées, et qui peut les relire ? Journal exploitable en audit, exportable, avec une politique de conservation explicite.
Réversibilité Que reste-t-il chez vous si le contrat s'arrête ? Documents, index vectoriels et configuration conservés côté client, dans des formats documentés.
Dimensionnement Quel matériel pour quel volume et combien d'utilisateurs ? Dimensionnement chiffré, rattaché à un volume documentaire et à un nombre d'utilisateurs simultanés annoncés, pas une gamme de serveurs générique.

Un éditeur qui répond clairement aux sept questions vous permet de comparer des offres sur le fond. Un éditeur qui reste évasif sur le lieu d'exécution ou sur la réversibilité vous vend, en pratique, un service hébergé sous un autre nom. Si l'arbitrage entre serveurs propres, hébergeur qualifié et service en ligne reste ouvert, notre page sur le choix d'une solution d'IA souveraine pour une ETI le traite en détail.

L'architecture de référence

Quatre briques structurent un déploiement d'IA souveraine sur site. Chacune répond à une exigence précise du cahier des charges.

01

Modèles open-weight servis localement

Des modèles de langage à poids ouverts, quantifiés pour tenir sur une empreinte matérielle raisonnable et servis par un moteur d'inférence local. Les poids résident sur vos serveurs, ce qui rend le pipeline d'exécution auditable de bout en bout.

02

Orchestration conteneurisée

Le déploiement en conteneurs facilite la mise à jour et la maintenance des modèles sur site, et permet la haute disponibilité au sein du centre de données. Les équipes techniques gardent la main sur le calendrier des montées de version.

03

RAG sur base vectorielle interne

La génération augmentée par récupération ancre les réponses dans vos documents officiels. L'assistant cite ses sources, signale l'absence de réponse plutôt que d'inventer, et n'indexe jamais vos fichiers sur un serveur externe.

04

Gouvernance et journalisation

Les habilitations du système d'information sont reprises à la source, de sorte qu'un collaborateur non autorisé ne voit pas passer un document confidentiel dans une réponse. Les requêtes sont journalisées pour l'audit.

Les modèles open-weight constituent un composant de cette architecture, pas la solution à eux seuls. Télécharger des poids ouverts ne fournit ni l'ingestion documentaire, ni le filtrage par droits, ni la supervision, ni la maintenance des versions. Le travail d'éditeur commence là. Pour le détail du mécanisme de récupération, consultez notre guide du RAG en entreprise, et pour l'architecture couche par couche, notre article sur le RAG souverain on-premise.

Ce que coûte réellement l'inférence locale

La comparaison entre inférence par API cloud et inférence locale sur serveurs GPU dédiés ne se tranche pas dans l'absolu. Elle dépend de trois variables mesurables.

Le volume soutenu

Le coût par million de jetons d'un modèle auto-hébergé descend très bas, mais l'investissement matériel ne s'amortit qu'au-delà d'un certain volume quotidien. Un seuil de rentabilité existe, et il se calcule.

Le taux d'utilisation

Un serveur GPU se paie qu'il travaille ou non. Les charges irrégulières, avec de longues périodes creuses, dégradent fortement l'équation. Les traitements réguliers, à l'inverse, la servent.

Le coût d'exploitation

Énergie, refroidissement, supervision et temps d'ingénierie s'ajoutent au prix d'achat. Les comparaisons qui les omettent surestiment l'avantage du local.

L'analyse coût-bénéfice publiée sur arXiv en 2025 par Guanzhong Pan, Vishal Chodnekar, Abinas Roy et Haibo Wang propose un cadre de calcul de ce seuil, à partir des besoins matériels, des dépenses d'exploitation et des performances des modèles ouverts. Sa conclusion mérite d'être reprise telle quelle : l'économie du déploiement local dépend fortement du contexte et contredit plusieurs idées reçues, dans les deux sens.

Une remarque de méthode. Pour des données dont la sortie du système d'information est exclue par la réglementation ou par une politique interne, le calcul de retour sur investissement arrive après la décision, pas avant. La question devient alors le coût du dispositif conforme le plus économique, et non le choix entre conforme et non conforme. Les postes de coût d'un projet et leur ordre de grandeur sont détaillés dans notre article sur le coût d'un projet RAG.

Préparer un appel d'offres sur données sensibles

Sept exigences à porter au cahier des charges. Elles se vérifient en démonstration, pas sur déclaration.

  1. Chemin de la donnée. Exiger la description du trajet complet d'une requête, du poste utilisateur au modèle et retour, avec la liste des composants traversés et leur localisation.
  2. Fonctionnement en réseau fermé. Exiger une démonstration du service avec la liaison externe coupée, sur le périmètre fonctionnel réellement attendu.
  3. Inventaire des modèles. Exiger la liste des modèles utilisés, leurs versions, leurs licences et leur origine, ainsi que la procédure de mise à jour et de retour arrière.
  4. Habilitations. Exiger l'intégration à l'annuaire d'entreprise et le filtrage des documents au moment de la récupération, avec un jeu de tests couvrant des profils aux droits différents.
  5. Journalisation. Exiger le format du journal des requêtes, ses modalités d'export, sa durée de conservation et les rôles habilités à le consulter.
  6. Réversibilité. Exiger la restitution des documents, des index et de la configuration en fin de contrat, dans des formats documentés et sans dépendance au fournisseur.
  7. Dimensionnement engagé. Exiger un dimensionnement matériel rattaché à un volume documentaire et à un nombre d'utilisateurs simultanés, avec les hypothèses de calcul associées.

Ces sept exigences sont neutres vis-à-vis des fournisseurs. Elles peuvent être reprises telles quelles dans un cahier des clauses techniques, y compris pour consulter des concurrents de BADIS AI.

Où se situe BADIS AI

Éditeur de logiciels d'IA souverains déployés sur site, pour les secteurs régulés. Voici les cas où cette réponse convient, et ceux où elle ne convient pas.

Adapté si

  • Vos données relèvent d'un cadre réglementaire qui interdit ou déconseille leur transmission à un tiers.
  • Vous traitez un volume documentaire régulier, où l'automatisation de la lecture et de la recherche produit un gain mesurable.
  • Vous disposez de serveurs GPU, ou vous acceptez d'en louer chez un opérateur d'infrastructure.
  • Vous devez pouvoir justifier en audit qui a demandé quoi, et sur quels documents la réponse s'appuyait.
  • Vous voulez un produit packagé et maintenu, plutôt qu'un développement spécifique à reprendre en interne.

À écarter si

  • Vous ne disposez d'aucune capacité GPU et n'envisagez ni d'en acquérir ni d'en louer.
  • Votre besoin se limite à de la bureautique assistée, sans donnée sensible en jeu.
  • Vous cherchez un développement entièrement spécifique, conçu pour un processus unique et non reproductible.
  • Votre charge est très irrégulière et faible en volume, ce qui rend l'amortissement matériel difficile à justifier.

La suite logicielle couvre l'assistant documentaire fondé sur le RAG, la numérisation et l'extraction documentaire par OCR, les agents conversationnels, l'analyse de données et la prévision. Une couche transverse de gouvernance, BADIS Control Center, centralise la supervision, les habilitations et la traçabilité. L'ensemble se déploie sur votre infrastructure.

Secteur pharmaceutique et sciences de la vie

Dossiers de lots, référentiels BPF et BPL, prévision des ruptures. Les cas d'usage où la contrainte réglementaire commande l'architecture avant toute considération de coût, détaillés dans notre article sur le RAG en secteur réglementé.

Voir l'approche pharma

La décision est déjà prise ?

Cette page traite de la sélection et du cahier des charges. Pour la méthode de déploiement proprement dite, notre page consacrée au copilote IA interne souverain décrit l'hébergement, le modèle à poids ouverts, le RAG local et la journalisation auditable.

Voir la méthode de déploiement

Cadrer avant de chiffrer

Un échange court permet de qualifier la maturité de vos données, de hiérarchiser les cas d'usage et d'estimer le périmètre matériel réellement nécessaire.

Diagnostic IA

Sources

Les affirmations réglementaires et économiques de cette page renvoient aux documents suivants.

  • CNIL, Les questions-réponses de la CNIL sur l'utilisation d'un système d'IA générative, publiées le 18 juillet 2024.
    cnil.fr/fr/les-questions-reponses-de-la-cnil-sur-lutilisation-dun-systeme-dia-generative
  • ANSSI, Recommandations de sécurité pour un système d'IA générative, guide ANSSI-PA-102, version 1.0 du 29 avril 2024.
    cyber.gouv.fr/publications
  • Guanzhong Pan, Vishal Chodnekar, Abinas Roy, Haibo Wang, A Cost-Benefit Analysis of On-Premise Large Language Model Deployment, Breaking Even with Commercial LLM Services, arXiv:2509.18101, août 2025, révisé en novembre 2025.
    arxiv.org/abs/2509.18101
  • Lenovo Press, On-Premise vs Cloud, Generative AI Total Cost of Ownership, édition 2026, document LP2368. Publication d'un constructeur, à lire comme telle, utile pour sa décomposition du coût par million de jetons.
    lenovopress.lenovo.com/lp2368.pdf

Questions fréquentes

Un système d'IA dont les modèles s'exécutent sur des serveurs contrôlés par l'organisation, à l'intérieur de son réseau. Les documents interrogés, les requêtes et les réponses ne transitent par aucun service tiers. Le mode on premise s'oppose au recours à une API externe, où chaque requête quitte le système d'information du client.

Le déploiement nécessite des serveurs équipés de cartes graphiques adaptées à la taille du modèle retenu, ainsi qu'une infrastructure réseau locale configurée pour supporter des flux d'inférence sécurisés. Le dimensionnement se déduit du besoin logiciel, à savoir le volume documentaire à indexer, le nombre d'utilisateurs simultanés et le temps de réponse attendu. La quantification des modèles réduit sensiblement l'empreinte matérielle nécessaire.

Dans ses questions-réponses du 18 juillet 2024 sur l'utilisation d'un système d'IA générative, la CNIL indique que lorsque l'usage envisagé consiste à fournir des données personnelles ou de la documentation sensible ou stratégique, par exemple pour du RAG, il semble généralement plus opportun et plus sécurisé de privilégier le déploiement de solutions sur site, qui limitent les risques d'extraction de données auprès d'un tiers. Elle renvoie sur ce point aux recommandations de sécurité de l'ANSSI.

Oui, dès lors que les modèles, l'orchestration et la base vectorielle sont installés sur site. Le service continue de répondre en cas de coupure de la liaison externe, et un déploiement en réseau fermé reste possible pour les environnements les plus sensibles. La connexion externe ne sert alors qu'aux mises à jour, sous contrôle de l'équipe d'exploitation.

Les mises à jour s'effectuent par le biais de pipelines d'intégration continue sécurisés permettant de charger de nouvelles versions quantifiées des modèles sans interrompre les services en production. Les poids sont importés, vérifiés, puis basculés progressivement, ce qui autorise un retour à la version précédente en cas de régression constatée.

Oui. Les techniques d'apprentissage telles que le fine-tuning léger ou l'adaptation de bas rang peuvent être réalisées entièrement au sein de l'infrastructure privée de l'entreprise. Dans la majorité des cas d'usage documentaires, l'ancrage des réponses sur les documents du client via le RAG produit un résultat suffisant sans réentraîner quoi que ce soit.

La réponse dépend du volume de requêtes, du taux d'utilisation des serveurs et du coût d'exploitation interne. Les travaux publiés sur le sujet, dont l'analyse coût-bénéfice de Pan et al. publiée sur arXiv en 2025, concluent que l'économie du déploiement local est fortement dépendante du contexte et qu'un seuil de rentabilité existe à partir d'un certain volume soutenu. Pour des données que la réglementation interdit d'exposer à un tiers, l'arbitrage se joue cependant sur la conformité avant de se jouer sur le coût.

Sept exigences couvrent l'essentiel du risque, à savoir la description du chemin complet d'une requête, la démonstration du fonctionnement sans accès internet, la liste des modèles avec leurs versions et licences, l'intégration à l'annuaire d'entreprise avec filtrage par droits à la requête, le journal des requêtes et son format d'export, les conditions de réversibilité des données et des index, et le dimensionnement matériel rapporté à un volume documentaire et à un nombre d'utilisateurs annoncés.

Déploiement sur votre infrastructure

Vos données restent chez vous

Décrivez-nous votre contrainte réglementaire, votre volume documentaire et votre capacité matérielle. Nous vous dirons ce qui est réalisable sur site, ce qui ne l'est pas, et à quelles conditions.