Qualiopi
Toutes nos intégrations IA
Découvrir l'univers Industrie 🏭 Aéronautique, métallurgie, agroalimentaire : pages secteurs en préparation
Tous les articles
Guide IA locale · Souveraineté · Septembre 2026

IA on-premise : le guide pour savoir où faire vraiment tourner votre IA en 2026

Le 25 août 2026, Apple a présenté son nouveau Mac Studio comme une machine taillée pour l'IA en local, et NVIDIA vend son DGX Spark comme un supercalculateur de bureau. La promesse ne répond qu'à une question sur deux. Voici ce qui marche vraiment, ce que coûte chaque option au 18 septembre 2026, et comment choisir.

IA on-premise : poste individuel, serveur dans vos murs ou cloud GPU français, avec le prix d'un Mac Studio M5 Ultra 256 Go au 18 septembre 2026
Illustration : NOCODE IA

01Le résumé en 30 secondes

Non, l'IA on-premise ne consiste pas à acheter la machine la plus puissante. Deux questions décident de tout : où tournent vos données (API d'un fournisseur américain, cloud français ou serveur dans vos murs), et combien de personnes s'en servent en même temps. Un poste individuel sert à tester, pas à équiper vingt personnes.

Au 18/09/2026, un Mac Studio M5 Ultra à 256 Go coûte 10 999 € TTC sur apple.com, et une carte NVIDIA H100 se loue 2,80 à 2,87 € HT de l'heure en France. La CNIL juge le déploiement sur site plus sûr pour les données personnelles, mais plus coûteux à installer et à exploiter.

02Deux questions à ne pas confondre

Où tournent vos données ? C'est la vraie question de souveraineté. Via l'API d'un fournisseur de modèles, le plus souvent américain, vos requêtes partent chez lui. Dans un cloud français comme OVHcloud ou Scaleway, elles restent en France, chez un hébergeur tiers. En on-premise, la machine est physiquement chez vous, sur votre réseau.

Combien d'utilisateurs ? Un poste individuel pour tester n'a rien à voir avec un serveur qui répond à 20 à 50 personnes en continu. Mémoire, débit et disponibilité changent tout, et le budget avec.

OptionOù sont vos donnéesCe que vous payezPour qui
API cloudChez l'éditeur du modèle, souvent hors de l'Union européenneÀ l'usage, sans matérielTester, usages non sensibles
Cloud GPU françaisEn France, chez un hébergeur tiersÀ l'heure ou au moisPOC, besoin encore incertain
On-premiseDans vos locaux, sur votre réseauLe matériel une fois, puis l'exploitationDonnées sensibles, usage stable

Vous restez sur une API ? Notre guide MCP et connecteurs Claude détaille ce que l'assistant lit dans vos outils.

03Les quatre familles de solutions

1

Le poste IA individuel

Le DGX Spark de NVIDIA et ses déclinaisons partenaires reposent sur la puce GB10 : 128 Go de mémoire, des modèles jusqu'à 200 milliards de paramètres selon NVIDIA. Les mini-PC équipés du Ryzen AI Max+ 395 d'AMD, dit Strix Halo (jusqu'à 128 Go), coûtent moins cher, mais sans CUDA, la pile logicielle de NVIDIA : vérifiez la compatibilité de vos outils. Idéal pour prototyper, pas pour servir une équipe.

Usage : une personne Coût : 3 889 à 4 800 € affichés Pas pour une équipe
2

Le serveur on-premise multi-utilisateurs

Pour une vingtaine de personnes, nos chiffrages retiennent un Mac Studio à 256 Go de mémoire unifiée, qui héberge un modèle de la famille Qwen. Apple annonce pour la puce M5 Ultra 1,2 To/s de bande passante mémoire, un critère décisif pour la vitesse de génération. C'est l'architecture que nous avons chiffrée et livrée pour un client du secteur de la cybersécurité.

Usage : une vingtaine de personnes Coût : 10 999 € TTC la machine Données dans vos murs
3

Le cloud GPU souverain français

Aucun achat, un hébergement en France, une facturation à l'usage chez OVHcloud, Scaleway, Outscale, NumSpot ou Cloud Temple. Idéal pour une PME sans équipe technique ou un POC. Deux limites : en usage continu, la location finit par coûter plus que l'achat, et les données restent chez un tiers, souverain en France mais pas dans vos murs.

Usage : POC, besoin incertain Coût : dès 1,40 € HT de l'heure Chez un tiers
4

Le choix du modèle

À nos yeux, deux familles à poids ouverts tiennent la route : Qwen, d'Alibaba, et DeepSeek. Qwen3.6-35B-A3B reste notre meilleur compromis entre taille et qualité pour une PME ; les plus gros DeepSeek supposent un vrai cluster de GPU. Un modèle « à experts » n'active qu'une partie de ses paramètres à chaque mot : rapide sur une machine, s'il tient entier en mémoire.

Licences Apache 2.0 ou MIT Licence à vérifier modèle par modèle

Les modèles ouverts, au 18/09/2026

ModèleTailleLicenceNotre lecture
Qwen3.6-35B-A3B (avril 2026)35 milliards de paramètres, 3 milliards actifsApache 2.0Notre compromis pour un serveur de PME
Qwen3-Coder-Next (début 2026)80 milliards, 3 milliards actifsApache 2.0Assistant de code, en complément
Qwen3.8-27B (août 2026)27 milliards, tous actifsApache 2.0Dernière version compacte, à évaluer
DeepSeek-V4-Flash (juillet 2026)284 milliards, 13 milliards actifsMITServeur doté de beaucoup de mémoire
DeepSeek-V4-Pro (août 2026)1 600 milliards, 49 milliards actifsMITCluster de GPU uniquement
Mistral Small 4119 milliards, 6,5 milliards actifsApache 2.0L'option d'un éditeur français

Fiches Hugging Face des éditeurs, lues le 18/09/2026. La préversion Qwen3.8-Flash-Next (24/08/2026) relève d'une licence propre à Qwen.

04Les prix vérifiés au 18 septembre 2026

FamilleConfigurationPrix affiché
Poste NVIDIADGX Spark Founders Edition, 128 Go4 800 €, en rupture de stock (boutique NVIDIA)
Poste AMDFramework Desktop, Ryzen AI Max+ 395, 128 Go3 889 €, version à assembler (frame.work)
Serveur dans vos mursMac Studio M5 Ultra, 256 Go, 1 To10 999 € TTC, livraisons annoncées dès le 22/09/2026 (apple.com)
Cloud GPU français1 carte H100 80 Go, OVHcloud, Gravelines2,80 € HT de l'heure, 1 940 € HT par mois (OVHcloud)
Cloud GPU français1 carte H100 80 Go, Scaleway, Paris2,87 € HT de l'heure (Scaleway)
Cloud GPU français1 carte L40S 48 Go1,40 € HT de l'heure chez OVHcloud, 1,47 € HT chez Scaleway

Relevés du 18/09/2026 sur les sites des fabricants et hébergeurs ; revendeurs et fabricants partenaires fixent leurs propres prix.

Louer ou acheter ? Une H100 louée en continu chez OVHcloud revient à 23 280 € HT sur un an, plus de deux fois le prix public d'un Mac Studio 256 Go (environ 9 166 € HT). Les deux ne rendent pas le même service (la H100 calcule plus vite, le Mac Studio a plus de mémoire), mais nos chiffrages de septembre 2026 le confirment : en usage continu, la location dépasse l'achat en un à deux ans.

05Notre chiffrage : un serveur pour vingt personnes

Ces chiffres viennent de nos chiffrages de septembre 2026, pas d'une étude de marché. Pour une vingtaine d'utilisateurs, nous dimensionnons un Mac Studio à 256 Go hébergeant Qwen3.6-35B-A3B et Qwen3-Coder-Next pour le code : environ 39 € par Go de mémoire, contre environ 130 € par Go pour une configuration équivalente en rack à base de cartes NVIDIA L40S. Au prix public du 18/09/2026, le Go du Mac Studio M5 Ultra revient à 43 € TTC, environ 36 € HT : même ordre de grandeur.

Côté consommation, l'écart joue aussi en faveur du Mac Studio. Apple publie 270 W au maximum pour le Mac Studio M3 Ultra (le M5 Ultra n'y figure pas encore), et NVIDIA 350 W au maximum par carte L40S, hors reste du serveur, et il faut plusieurs cartes de 48 Go pour réunir autant de mémoire.

Ce que ce chiffrage ne dit pas

Le prix de la machine n'est pas le coût du projet : installation, cloisonnement réseau, sauvegardes, supervision, mises à jour et formation s'ajoutent, sur devis. Et une machine unique est un point de panne unique.

10 999 €
Mac Studio M5 Ultra 256 Go, TTC, au 18/09/2026
~20
Utilisateurs servis dans notre dimensionnement
39 / 130 €
Par Go, Mac Studio contre L40S (notre chiffrage)
270 W
Maximum d'un Mac Studio M3 Ultra, contre 350 W par carte L40S (fiches fabricants)

06Quelle solution pour quelle taille d'entreprise

Indépendant ou TPE

L'API cloud reste la plus simple, sauf si vous traitez dès aujourd'hui des données sensibles.

PME de 10 à 50 personnes

Un serveur on-premise (Mac Studio) si le besoin est stable sur 2 à 3 ans ; du cloud GPU à la demande si le besoin est encore incertain.

PME ou ETI réglementée

Cybersécurité, santé, finance : l'on-premise est quasi obligatoire pour garder la propriété totale des données.

Grand groupe

Le cloud souverain à grande échelle, sauf exigence de souveraineté totale, qui impose un cluster dédié.

Recommandations de NOCODE IA. « Quasi obligatoire » exprime notre conseil, pas une obligation légale générale : vos contraintes dépendent de votre secteur et de vos contrats.

07Données, RGPD et souveraineté : ce que l'on-premise règle, et ce qu'il ne règle pas

Information générale au 18 septembre 2026, pas un conseil juridique : faites valider votre situation par votre conseil ou votre délégué à la protection des données.

Ce que dit la CNIL. Dans ses questions-réponses du 18/07/2024, la CNIL estime que pour des données de clients ou de collaborateurs, ou une documentation sensible, il est « plus opportun et plus sécurisé de privilégier le déploiement de solutions sur site ». Elle admet que le coût rend souvent l'hébergement distant plus simple, sous contrat de sous-traitance.

Ce que veut dire « souverain ». Hébergé en France : vos données restent sur le territoire, chez un tiers. Qualifié SecNumCloud : l'ANSSI présente cette qualification comme une protection contre la cybercriminalité et contre l'application de lois étrangères à portée extraterritoriale. Vérifiez l'offre précise : le 15/09/2026, NumSpot indiquait son infrastructure qualifiée, mais son service d'IA managée avec Mistral AI encore en cours de qualification. Dans vos murs, enfin : rien ne sort de votre réseau si l'installation est cloisonnée.

Ce que l'on-premise ne règle pas. Le traitement reste à inscrire au registre, une analyse d'impact s'impose si le risque est élevé (article 35 du RGPD), et la sécurité de la machine vous revient (article 32) : droits d'accès, journalisation, sauvegardes, mises à jour.

L'origine du modèle. Exécuté chez vous, un modèle à poids ouverts n'envoie rien à son éditeur, mais certaines organisations écartent des modèles selon leur origine : interrogez votre responsable sécurité. Notre page conformité IA détaille les obligations de l'entreprise qui déploie.

08Le vrai sujet : cadrer, sécuriser, former

La question n'est pas « quelle machine acheter ». Ce qui fait réussir un projet d'IA locale, c'est de cadrer l'architecture (où tournent les données, pour combien d'utilisateurs, avec quel modèle), de sécuriser les données et de former les équipes à s'en servir. C'est notre métier : diagnostic, chiffrage, installation, formation. Pour l'industrie, nos systèmes IA souverains vont du cloud français au serveur dans vos murs.

Côté formation, notre guide n8n et agents IA en local montre comment automatiser sans cloud imposé, et la formation Mistral niveau débutant dure 1 jour (7 h), à partir de 600 € HT par participant en inter-entreprises, TVA en sus, tarif au 18/09/2026.

NOCODE IA est un organisme de formation basé à Toulouse, certifié Qualiopi. La certification qualité a été délivrée au titre de la ou des catégories d'actions suivantes : actions de formation. Nos formations ne sont pas éligibles au CPF : une prise en charge OPCO est possible selon votre branche. NOCODE IA n'est ni certifié, ni partenaire, ni revendeur d'aucun fabricant, hébergeur ou éditeur cité dans ce guide.

Vos questions sur l'IA on-premise

C'est un modèle d'IA qui tourne sur des machines installées dans vos locaux. Ce n'est ni un cloud français, où vos données restent en France mais chez un tiers, ni une API, où vos requêtes partent chez l'éditeur du modèle. Depuis le 18/07/2024, la CNIL juge le déploiement sur site plus sûr pour les données personnelles ou sensibles, tout en reconnaissant son coût.

Un Mac Studio M5 Ultra à 256 Go est affiché 10 999 € TTC sur apple.com au 18/09/2026. Dans nos chiffrages de septembre 2026, elle sert une vingtaine d'utilisateurs, pour environ 39 € par Go de mémoire contre environ 130 € en rack NVIDIA L40S. Installation, sécurisation, maintenance et formation s'ajoutent, sur devis.

Le DGX Spark est un poste individuel : 128 Go de mémoire, 4 800 € affichés sur la boutique française de NVIDIA au 18/09/2026, pour prototyper. Le Mac Studio M5 Ultra monte à 256 Go livrables en septembre, avec 1,2 To/s de bande passante mémoire selon Apple : notre choix pour servir une équipe d'une vingtaine de personnes.

Il garde vos données en France, mais chez un tiers. Au 18/09/2026, une H100 se loue 2,80 € HT de l'heure chez OVHcloud et 2,87 € HT chez Scaleway. Au-dessus, une offre qualifiée SecNumCloud par l'ANSSI vise aussi les lois étrangères à portée extraterritoriale. Seul l'on-premise met la machine dans vos murs.

Pour un serveur de PME, notre compromis est Qwen3.6-35B-A3B : 35 milliards de paramètres dont 3 milliards actifs, licence Apache 2.0, publié en avril 2026. Qwen3.8-27B, sorti en août 2026, est à évaluer. DeepSeek-V4-Pro, avec 1 600 milliards de paramètres, suppose un cluster de GPU. Mistral Small 4, sous Apache 2.0, est l'option française. Vérifiez chaque licence.

Oui. NOCODE IA cadre l'architecture, installe et forme les équipes, sur devis. La formation Mistral niveau débutant dure 1 jour (7 h), à partir de 600 € HT par participant en inter-entreprises au 18/09/2026. Nos formations ne sont pas éligibles au CPF : une prise en charge OPCO est possible selon votre branche. NOCODE IA n'est partenaire d'aucun fabricant ni hébergeur cité.

Notre conclusion

L'opportunité est réelle : d'après nos chiffrages, un serveur à 10 999 € TTC sert une vingtaine de personnes sans qu'une requête sorte de vos murs.

Ce que les promesses surestiment, c'est la simplicité : un poste ne sert pas une équipe, un cloud français n'est pas vos murs, un serveur chez vous ne rend conforme à rien tout seul.

Le bon ordre : où tournent les données, combien d'utilisateurs, puis le modèle et la machine.

Mentions de marques. Les noms de produits et de sociétés cités (Apple, Mac Studio, NVIDIA, DGX Spark, AMD, Ryzen et les autres) appartiennent à leurs titulaires. NOCODE IA n'est affilié à aucun d'eux.

Cadrer votre projet d'IA locale

Dites-nous qui doit s'en servir et sur quelles données. Nous vous disons si l'API, le cloud français ou un serveur dans vos murs répond au besoin, et ce que chaque option demande. Vingt minutes au téléphone, gratuites et sans engagement.

Vous voulez appliquer ça dans votre entreprise ?

NOCODE IA forme vos équipes à Claude, ChatGPT, Copilot et n8n, audite vos usages et construit vos automatisations. Organisme certifié Qualiopi au titre des actions de formation. Prise en charge OPCO possible selon votre branche. Dites-nous en un clic ce qui vous intéresse.

Ce qui vous intéresse

Ou directement : 06 31 15 38 54Réserver un point OPCO de 20 minDonnées traitées par NOCODE IA pour répondre à votre demande et en assurer le suivi, jamais cédées. Vos droits.

Article signé Charles Meurin, fondateur de NOCODE IA.