

Le 25 août 2026, Apple a présenté son nouveau Mac Studio comme une machine taillée pour l'IA en local, et NVIDIA vend son DGX Spark comme un supercalculateur de bureau. La promesse ne répond qu'à une question sur deux. Voici ce qui marche vraiment, ce que coûte chaque option au 18 septembre 2026, et comment choisir.

Non, l'IA on-premise ne consiste pas à acheter la machine la plus puissante. Deux questions décident de tout : où tournent vos données (API d'un fournisseur américain, cloud français ou serveur dans vos murs), et combien de personnes s'en servent en même temps. Un poste individuel sert à tester, pas à équiper vingt personnes.
Au 18/09/2026, un Mac Studio M5 Ultra à 256 Go coûte 10 999 € TTC sur apple.com, et une carte NVIDIA H100 se loue 2,80 à 2,87 € HT de l'heure en France. La CNIL juge le déploiement sur site plus sûr pour les données personnelles, mais plus coûteux à installer et à exploiter.
Où tournent vos données ? C'est la vraie question de souveraineté. Via l'API d'un fournisseur de modèles, le plus souvent américain, vos requêtes partent chez lui. Dans un cloud français comme OVHcloud ou Scaleway, elles restent en France, chez un hébergeur tiers. En on-premise, la machine est physiquement chez vous, sur votre réseau.
Combien d'utilisateurs ? Un poste individuel pour tester n'a rien à voir avec un serveur qui répond à 20 à 50 personnes en continu. Mémoire, débit et disponibilité changent tout, et le budget avec.
| Option | Où sont vos données | Ce que vous payez | Pour qui |
|---|---|---|---|
| API cloud | Chez l'éditeur du modèle, souvent hors de l'Union européenne | À l'usage, sans matériel | Tester, usages non sensibles |
| Cloud GPU français | En France, chez un hébergeur tiers | À l'heure ou au mois | POC, besoin encore incertain |
| On-premise | Dans vos locaux, sur votre réseau | Le matériel une fois, puis l'exploitation | Données sensibles, usage stable |
Vous restez sur une API ? Notre guide MCP et connecteurs Claude détaille ce que l'assistant lit dans vos outils.
Le DGX Spark de NVIDIA et ses déclinaisons partenaires reposent sur la puce GB10 : 128 Go de mémoire, des modèles jusqu'à 200 milliards de paramètres selon NVIDIA. Les mini-PC équipés du Ryzen AI Max+ 395 d'AMD, dit Strix Halo (jusqu'à 128 Go), coûtent moins cher, mais sans CUDA, la pile logicielle de NVIDIA : vérifiez la compatibilité de vos outils. Idéal pour prototyper, pas pour servir une équipe.
Pour une vingtaine de personnes, nos chiffrages retiennent un Mac Studio à 256 Go de mémoire unifiée, qui héberge un modèle de la famille Qwen. Apple annonce pour la puce M5 Ultra 1,2 To/s de bande passante mémoire, un critère décisif pour la vitesse de génération. C'est l'architecture que nous avons chiffrée et livrée pour un client du secteur de la cybersécurité.
Aucun achat, un hébergement en France, une facturation à l'usage chez OVHcloud, Scaleway, Outscale, NumSpot ou Cloud Temple. Idéal pour une PME sans équipe technique ou un POC. Deux limites : en usage continu, la location finit par coûter plus que l'achat, et les données restent chez un tiers, souverain en France mais pas dans vos murs.
À nos yeux, deux familles à poids ouverts tiennent la route : Qwen, d'Alibaba, et DeepSeek. Qwen3.6-35B-A3B reste notre meilleur compromis entre taille et qualité pour une PME ; les plus gros DeepSeek supposent un vrai cluster de GPU. Un modèle « à experts » n'active qu'une partie de ses paramètres à chaque mot : rapide sur une machine, s'il tient entier en mémoire.
| Modèle | Taille | Licence | Notre lecture |
|---|---|---|---|
| Qwen3.6-35B-A3B (avril 2026) | 35 milliards de paramètres, 3 milliards actifs | Apache 2.0 | Notre compromis pour un serveur de PME |
| Qwen3-Coder-Next (début 2026) | 80 milliards, 3 milliards actifs | Apache 2.0 | Assistant de code, en complément |
| Qwen3.8-27B (août 2026) | 27 milliards, tous actifs | Apache 2.0 | Dernière version compacte, à évaluer |
| DeepSeek-V4-Flash (juillet 2026) | 284 milliards, 13 milliards actifs | MIT | Serveur doté de beaucoup de mémoire |
| DeepSeek-V4-Pro (août 2026) | 1 600 milliards, 49 milliards actifs | MIT | Cluster de GPU uniquement |
| Mistral Small 4 | 119 milliards, 6,5 milliards actifs | Apache 2.0 | L'option d'un éditeur français |
Fiches Hugging Face des éditeurs, lues le 18/09/2026. La préversion Qwen3.8-Flash-Next (24/08/2026) relève d'une licence propre à Qwen.
| Famille | Configuration | Prix affiché |
|---|---|---|
| Poste NVIDIA | DGX Spark Founders Edition, 128 Go | 4 800 €, en rupture de stock (boutique NVIDIA) |
| Poste AMD | Framework Desktop, Ryzen AI Max+ 395, 128 Go | 3 889 €, version à assembler (frame.work) |
| Serveur dans vos murs | Mac Studio M5 Ultra, 256 Go, 1 To | 10 999 € TTC, livraisons annoncées dès le 22/09/2026 (apple.com) |
| Cloud GPU français | 1 carte H100 80 Go, OVHcloud, Gravelines | 2,80 € HT de l'heure, 1 940 € HT par mois (OVHcloud) |
| Cloud GPU français | 1 carte H100 80 Go, Scaleway, Paris | 2,87 € HT de l'heure (Scaleway) |
| Cloud GPU français | 1 carte L40S 48 Go | 1,40 € HT de l'heure chez OVHcloud, 1,47 € HT chez Scaleway |
Relevés du 18/09/2026 sur les sites des fabricants et hébergeurs ; revendeurs et fabricants partenaires fixent leurs propres prix.
Louer ou acheter ? Une H100 louée en continu chez OVHcloud revient à 23 280 € HT sur un an, plus de deux fois le prix public d'un Mac Studio 256 Go (environ 9 166 € HT). Les deux ne rendent pas le même service (la H100 calcule plus vite, le Mac Studio a plus de mémoire), mais nos chiffrages de septembre 2026 le confirment : en usage continu, la location dépasse l'achat en un à deux ans.
Ces chiffres viennent de nos chiffrages de septembre 2026, pas d'une étude de marché. Pour une vingtaine d'utilisateurs, nous dimensionnons un Mac Studio à 256 Go hébergeant Qwen3.6-35B-A3B et Qwen3-Coder-Next pour le code : environ 39 € par Go de mémoire, contre environ 130 € par Go pour une configuration équivalente en rack à base de cartes NVIDIA L40S. Au prix public du 18/09/2026, le Go du Mac Studio M5 Ultra revient à 43 € TTC, environ 36 € HT : même ordre de grandeur.
Côté consommation, l'écart joue aussi en faveur du Mac Studio. Apple publie 270 W au maximum pour le Mac Studio M3 Ultra (le M5 Ultra n'y figure pas encore), et NVIDIA 350 W au maximum par carte L40S, hors reste du serveur, et il faut plusieurs cartes de 48 Go pour réunir autant de mémoire.
Le prix de la machine n'est pas le coût du projet : installation, cloisonnement réseau, sauvegardes, supervision, mises à jour et formation s'ajoutent, sur devis. Et une machine unique est un point de panne unique.
L'API cloud reste la plus simple, sauf si vous traitez dès aujourd'hui des données sensibles.
Un serveur on-premise (Mac Studio) si le besoin est stable sur 2 à 3 ans ; du cloud GPU à la demande si le besoin est encore incertain.
Cybersécurité, santé, finance : l'on-premise est quasi obligatoire pour garder la propriété totale des données.
Le cloud souverain à grande échelle, sauf exigence de souveraineté totale, qui impose un cluster dédié.
Recommandations de NOCODE IA. « Quasi obligatoire » exprime notre conseil, pas une obligation légale générale : vos contraintes dépendent de votre secteur et de vos contrats.
Information générale au 18 septembre 2026, pas un conseil juridique : faites valider votre situation par votre conseil ou votre délégué à la protection des données.
Ce que dit la CNIL. Dans ses questions-réponses du 18/07/2024, la CNIL estime que pour des données de clients ou de collaborateurs, ou une documentation sensible, il est « plus opportun et plus sécurisé de privilégier le déploiement de solutions sur site ». Elle admet que le coût rend souvent l'hébergement distant plus simple, sous contrat de sous-traitance.
Ce que veut dire « souverain ». Hébergé en France : vos données restent sur le territoire, chez un tiers. Qualifié SecNumCloud : l'ANSSI présente cette qualification comme une protection contre la cybercriminalité et contre l'application de lois étrangères à portée extraterritoriale. Vérifiez l'offre précise : le 15/09/2026, NumSpot indiquait son infrastructure qualifiée, mais son service d'IA managée avec Mistral AI encore en cours de qualification. Dans vos murs, enfin : rien ne sort de votre réseau si l'installation est cloisonnée.
Ce que l'on-premise ne règle pas. Le traitement reste à inscrire au registre, une analyse d'impact s'impose si le risque est élevé (article 35 du RGPD), et la sécurité de la machine vous revient (article 32) : droits d'accès, journalisation, sauvegardes, mises à jour.
L'origine du modèle. Exécuté chez vous, un modèle à poids ouverts n'envoie rien à son éditeur, mais certaines organisations écartent des modèles selon leur origine : interrogez votre responsable sécurité. Notre page conformité IA détaille les obligations de l'entreprise qui déploie.
La question n'est pas « quelle machine acheter ». Ce qui fait réussir un projet d'IA locale, c'est de cadrer l'architecture (où tournent les données, pour combien d'utilisateurs, avec quel modèle), de sécuriser les données et de former les équipes à s'en servir. C'est notre métier : diagnostic, chiffrage, installation, formation. Pour l'industrie, nos systèmes IA souverains vont du cloud français au serveur dans vos murs.
Côté formation, notre guide n8n et agents IA en local montre comment automatiser sans cloud imposé, et la formation Mistral niveau débutant dure 1 jour (7 h), à partir de 600 € HT par participant en inter-entreprises, TVA en sus, tarif au 18/09/2026.
NOCODE IA est un organisme de formation basé à Toulouse, certifié Qualiopi. La certification qualité a été délivrée au titre de la ou des catégories d'actions suivantes : actions de formation. Nos formations ne sont pas éligibles au CPF : une prise en charge OPCO est possible selon votre branche. NOCODE IA n'est ni certifié, ni partenaire, ni revendeur d'aucun fabricant, hébergeur ou éditeur cité dans ce guide.
C'est un modèle d'IA qui tourne sur des machines installées dans vos locaux. Ce n'est ni un cloud français, où vos données restent en France mais chez un tiers, ni une API, où vos requêtes partent chez l'éditeur du modèle. Depuis le 18/07/2024, la CNIL juge le déploiement sur site plus sûr pour les données personnelles ou sensibles, tout en reconnaissant son coût.
Un Mac Studio M5 Ultra à 256 Go est affiché 10 999 € TTC sur apple.com au 18/09/2026. Dans nos chiffrages de septembre 2026, elle sert une vingtaine d'utilisateurs, pour environ 39 € par Go de mémoire contre environ 130 € en rack NVIDIA L40S. Installation, sécurisation, maintenance et formation s'ajoutent, sur devis.
Le DGX Spark est un poste individuel : 128 Go de mémoire, 4 800 € affichés sur la boutique française de NVIDIA au 18/09/2026, pour prototyper. Le Mac Studio M5 Ultra monte à 256 Go livrables en septembre, avec 1,2 To/s de bande passante mémoire selon Apple : notre choix pour servir une équipe d'une vingtaine de personnes.
Il garde vos données en France, mais chez un tiers. Au 18/09/2026, une H100 se loue 2,80 € HT de l'heure chez OVHcloud et 2,87 € HT chez Scaleway. Au-dessus, une offre qualifiée SecNumCloud par l'ANSSI vise aussi les lois étrangères à portée extraterritoriale. Seul l'on-premise met la machine dans vos murs.
Pour un serveur de PME, notre compromis est Qwen3.6-35B-A3B : 35 milliards de paramètres dont 3 milliards actifs, licence Apache 2.0, publié en avril 2026. Qwen3.8-27B, sorti en août 2026, est à évaluer. DeepSeek-V4-Pro, avec 1 600 milliards de paramètres, suppose un cluster de GPU. Mistral Small 4, sous Apache 2.0, est l'option française. Vérifiez chaque licence.
Oui. NOCODE IA cadre l'architecture, installe et forme les équipes, sur devis. La formation Mistral niveau débutant dure 1 jour (7 h), à partir de 600 € HT par participant en inter-entreprises au 18/09/2026. Nos formations ne sont pas éligibles au CPF : une prise en charge OPCO est possible selon votre branche. NOCODE IA n'est partenaire d'aucun fabricant ni hébergeur cité.
L'opportunité est réelle : d'après nos chiffrages, un serveur à 10 999 € TTC sert une vingtaine de personnes sans qu'une requête sorte de vos murs.
Ce que les promesses surestiment, c'est la simplicité : un poste ne sert pas une équipe, un cloud français n'est pas vos murs, un serveur chez vous ne rend conforme à rien tout seul.
Le bon ordre : où tournent les données, combien d'utilisateurs, puis le modèle et la machine.
Mentions de marques. Les noms de produits et de sociétés cités (Apple, Mac Studio, NVIDIA, DGX Spark, AMD, Ryzen et les autres) appartiennent à leurs titulaires. NOCODE IA n'est affilié à aucun d'eux.
Dites-nous qui doit s'en servir et sur quelles données. Nous vous disons si l'API, le cloud français ou un serveur dans vos murs répond au besoin, et ce que chaque option demande. Vingt minutes au téléphone, gratuites et sans engagement.
Article signé Charles Meurin, fondateur de NOCODE IA.