IA open source en local
Générer ses images, ses vidéos, ses voix et sa musique avec l'IA sans dépendre d'un abonnement cloud, c'est aujourd'hui possible avec des modèles open source qui tournent sur une simple carte graphique grand public. Voici un tour d'horizon des outils, des interfaces et des créateurs qui font référence en 2026, ainsi qu'un point de vigilance nécessaire sur les zones grises de cet écosystème.
Pourquoi passer au local
Faire tourner ses propres modèles d'IA générative, plutôt que de dépendre d'un abonnement cloud, répond à trois besoins : la confidentialité, puisque rien ne quitte la machine, la liberté, avec aucune limite de génération ni filigrane imposé, et le contrôle, avec un accès complet aux paramètres et la possibilité d'entraîner ses propres LoRA. En contrepartie, cela demande un minimum de matériel, typiquement une carte graphique NVIDIA avec 8 à 24 Go de VRAM selon les modèles, et un peu de patience pour l'installation.
Deux plateformes structurent aujourd'hui cet écosystème. ComfyUI est une interface nodale open source, la référence pour les power users : chaque étape de la génération (chargement du modèle, encodage du prompt, échantillonnage, décodage) est un bloc que l'on relie visuellement, et c'est aussi la première interface à intégrer les nouveautés comme la vidéo ou l'audio synchronisé. Pinokio, de son côté, est un lanceur universel qui automatise l'installation de dizaines de projets IA open source (ComfyUI, Fooocus, Automatic1111, outils de clonage vocal, de génération musicale) en un clic, sans ligne de commande.
La technologie est neutre, mais certaines plateformes qui la mettent en musique ne le sont pas forcément.
Génération d'images
Cinq modèles dominent le paysage open source en 2026 :
| Modèle | Éditeur | Licence | VRAM | Points forts |
|---|---|---|---|---|
| FLUX.2 (Klein / Dev) | Black Forest Labs | Klein : Apache 2.0, gratuit / Dev : licence commerciale | Klein : GPU grand public / Dev : 18 à 24 Go | Photoréalisme de référence, jusqu'à 10 images de référence, typographie propre, prompting JSON |
| Qwen-Image / Qwen-Image Max | Alibaba | Apache 2.0 | Variable | 20 milliards de paramètres, excellent rendu de texte multilingue |
| Stable Diffusion 3.5 | Stability AI | Communautaire, usage commercial gratuit sous un certain seuil de revenus | 6 à 12 Go | Architecture MMDiT, immense écosystème de LoRA communautaires |
| HunyuanImage 3.0 | Tencent | Ouverte | Élevé (80B, MoE) | Le plus grand modèle ouvert de ce type, bon raisonnement contextuel |
| Z-Image Turbo | Communauté open source | Gratuit en local | Faible | Excellent rapport vitesse/qualité pour la production en volume |
Côté interfaces locales, en plus de ComfyUI, on retrouve Forge, SwarmUI, Fooocus et InvokeAI.

Génération de vidéos
| Modèle | Éditeur | Licence | VRAM min. | Points forts |
|---|---|---|---|---|
| Wan 2.2 | Alibaba (Tongyi) | Apache 2.0 | 8 à 24 Go | Architecture MoE, texte vers vidéo, image vers vidéo et édition dans un seul pipeline |
| HunyuanVideo 1.5 | Tencent | Communautaire, gratuite jusqu'à 100 millions d'utilisateurs actifs par mois | 14 à 24 Go (quantifié) | Excelle en mouvement naturel et en physique (fluides, tissus) |
| LTX-Video / LTX-2.3 | Lightricks | Ouverte | 12 à 32 Go | 3 à 4 fois plus rapide que Wan ou Hunyuan, LTX-2 génère audio et vidéo synchronisés en une seule passe |
| CogVideoX-5B | Zhipu AI | Ouverte | 24 Go | Meilleure fidélité pour les prompts complexes à plusieurs clauses |
| Mochi 1 | Genmo AI | Apache 2.0 | Élevée | 10 milliards de paramètres, architecture ouverte et modifiable |
Un repère matériel simple : 16 Go de VRAM permettent d'accéder à une sélection significative de modèles, 24 Go permettent de tout faire tourner sans compromis.
Voix et clonage vocal
| Modèle | Licence | Usage commercial | Points forts |
|---|---|---|---|
| Kokoro-82M | Apache 2.0 | Oui | Tourne même sur CPU avec seulement 82 millions de paramètres, pas de clonage, voix prédéfinies uniquement |
| Chatterbox / Chatterbox Multilingual v3 | MIT | Oui | 23 langues et 4 dialectes, watermark intégré, préféré à ElevenLabs lors d'un test à l'aveugle mené par Resemble AI |
| Qwen3-TTS | Apache 2.0 | Oui | Clonage possible à partir de seulement 3 secondes de référence audio |
| XTTS-v2 (Coqui) | CPML | Non | Standard multilingue pour les projets personnels, clonage dès 6 secondes d'audio, 17 langues |
| F5-TTS | CC-BY-NC | Non | Référence qualité pour l'anglais et le chinois |
| Bark | MIT | Oui | Génère aussi des rires, des soupirs et de la musique, utile pour du contenu créatif |
Ces outils permettent de cloner n'importe quelle voix à partir de quelques secondes d'audio. Sans consentement de la personne concernée, cet usage peut constituer une usurpation d'identité et est illégal dans de nombreuses juridictions.
Génération de musique
| Modèle | Licence | VRAM | Points forts |
|---|---|---|---|
| ACE-Step 1.5 | MIT | Moins de 4 Go | Moins de 10 secondes par morceau sur une RTX 3090, rendu proche de la qualité commerciale, LoRA entraînable localement |
| YuE 7B | Apache 2.0 | 24 Go et plus | Autorégressif, bon alignement entre paroles et musique, orienté utilisateurs avancés |
| DiffRhythm 2 | Apache 2.0 | Variable | Architecture Block Flow Matching, la plus transparente sur ses propres limites dans sa documentation |
| Stable Audio Open (1.5 / Small) | Ouverte | Faible | Plus pertinent pour le sound design que pour des chansons abouties |
| MusicGen Stereo | CC BY-NC | 12 Go | Bon pour l'expérimentation et les ébauches instrumentales |
Compatibilité avec Pinokio
Pinokio propose une manière simple de tester des applications d'intelligence artificielle sur votre ordinateur, sans connaissances techniques : tout est pensé pour que vous puissiez installer et utiliser les modèles en toute simplicité.
Les quatre familles de modèles sont accessibles via Pinokio : génération d'images et de vidéos (Stable Diffusion, Fooocus, ComfyUI), synthèse vocale multilingue avec clonage, génération musicale, séparation de pistes audio, le tout en local. Un projet notable disponible sur la plateforme est un studio tout-en-un construit sur le pipeline WanGP (Wan 2.1/2.2, LTX-2.3, Qwen, HunyuanVideo, Flux), avec un mode Director qui transforme un simple prompt en court-métrage complet, image, son et musique compris.
Utilisation responsable, le cas Civitai
Ces outils sont puissants et, pour la plupart, sans aucun garde-fou intégré une fois installés en local, ce qui en fait justement l'intérêt technique. Cela implique une responsabilité, en particulier autour de deux points : les voix et visages de personnes réelles, et les plateformes qui hébergent les modèles communautaires.
Civitai est une plateforme d'hébergement de LoRA et de checkpoints, des mini-modèles qui apprennent à un modèle de base à reproduire un style, un personnage ou un visage, très utilisée dans l'écosystème Stable Diffusion et ComfyUI. Une étude menée par des chercheurs de Stanford et de l'Indiana University, relayée en janvier 2026 par le MIT Technology Review, a analysé le système de « bounties » du site, un mécanisme où un utilisateur pouvait commander à d'autres la création d'un LoRA sur mesure. Les chercheurs ont constaté qu'une part significative de ces commandes visait à reproduire le visage de personnes réelles, et que 90 % de ces demandes ciblaient des femmes (influenceuses, actrices, chanteuses), le plus souvent en vue de générer des images à caractère sexuel sans leur consentement. Le rapport pointait aussi que la plateforme proposait des ressources expliquant comment pousser les modèles à produire ce type de contenu.
Face à cette situation, et sous la pression conjointe de Visa, de Mastercard (qui refusaient de continuer à traiter les paiements liés à ce type d'usage) et de nouvelles réglementations en Europe et aux États-Unis, Civitai a annoncé en 2025 et 2026 une série de restrictions : interdiction des modèles calqués sur des personnes réelles identifiables, masquage du contenu associant un nom réel, dénivelé minimal obligatoire de 50 % sur les images importées puis retravaillées pour éviter les quasi-reproductions, métadonnées obligatoires sur tout contenu classé adulte, et suppression du contenu non conforme sous 30 jours. 404 Media, qui suit le dossier depuis plusieurs années, a qualifié ce durcissement de coup dur porté à l'écosystème des deepfakes pornographiques non consentis, tout en notant qu'une partie de la communauté a réagi en archivant les modèles retirés ou en se tournant vers des alternatives moins régulées.
Le rapport soulignait que la plateforme proposait des ressources expliquant comment inciter les modèles à générer certains types de contenus.
Ce précédent illustre un principe simple : la technologie elle-même (ComfyUI, Stable Diffusion, l'entraînement de LoRA) est neutre, mais certaines plateformes qui la mettent en musique ne le sont pas forcément. C'est pourquoi ce guide privilégie Hugging Face comme dépôt de référence pour les poids de modèles, et ne renvoie vers aucun hub de LoRA communautaire.
Créateurs francophones à suivre
- Lionel Vicidomini (formations Tuto.com et YouTube). La référence la plus complète : ComfyUI local, image, vidéo (Wan, LTX), clonage vocal, workflows 3D. Vingt ans d'expérience en audiovisuel, formateur à l'INA.
- ComfyUI France (comfyui.fr). Communauté francophone couvrant Flux, SD3.5, Wan, HunyuanVideo, LivePortrait, Fish Speech, XTTS, Bark.
- IA Locale Facile (ia-locale-facile.fr). Guides et tests réels sur ComfyUI, Ollama, SDXL, WAN, CogVideoX, LTX Video, entraînement de LoRA, avec chaîne vidéo associée.
- Stable Diffusion France. Tutoriels vidéo sur Automatic1111, Stable Diffusion, ControlNet, OpenPose.
Un angle mort mérite d'être signalé : il n'existe quasiment pas de créateur francophone spécialisé dans la musique ou la voix IA open source locale (ACE-Step, YuE, DiffRhythm). Le contenu français sur la musique IA reste massivement centré sur Suno, un service cloud propriétaire, donc hors du périmètre local et open source de cet article.
Créateurs anglophones à suivre
YouTube a généralisé son doublage automatique par IA à tous les créateurs du Programme Partenaire depuis février 2026, dans 27 langues, mais c'est une option activable ou désactivable par le créateur : à vérifier vidéo par vidéo via l'icône des paramètres, puis « Piste audio ».
- SECourses (Dr. Furkan Gözükara). La ressource la plus exhaustive tous médias confondus : Stable Diffusion, SDXL, FLUX, Qwen pour l'image, Wan et animation pour la vidéo, TTS et clonage vocal. Docteur en génie informatique, tutoriels très longs et détaillés, dépôt GitHub de plus de 250 guides, Discord actif.
- Olivio Sarikas. Tutoriels sur Stable Diffusion et workflows ComfyUI/Flux, très pédagogique pour les débutants.
- Aitrepreneur. ComfyUI, Flux, Forge, AUTOMATIC1111, ControlNet ; l'une des chaînes les plus respectées du secteur.
- Nerdy Rodent. Chaîne « AI Open Sourcery » depuis 2020, spécialisée ComfyUI, Flux, Qwen, WAN Video, clonage vocal, orientée logiciels libres.
- Pixaroma. Enseigne ComfyUI et teste les derniers modèles (Flux, Qwen, Wan).
- Scott Detweiler. Lead QA chez Stability AI, tutoriels ComfyUI et art IA.
- Kijai (GitHub). Pas YouTubeur, mais le développeur derrière la majorité des wrappers ComfyUI pour Wan, HunyuanVideo et LTX, à suivre sur GitHub et Discord.
À retenir
- Quatre familles de modèles ouverts (image, vidéo, voix, musique) couvrent aujourd'hui l'essentiel des besoins, avec des besoins matériels allant de 4 à 24 Go de VRAM selon les cas.
- ComfyUI et Pinokio couvrent l'installation locale des quatre catégories ; la musique et la voix restent les parents pauvres en matière de créateurs de contenu pédagogique, en français comme en anglais.
- La neutralité technique de ces outils n'efface pas la responsabilité de l'usage : le cas Civitai montre concrètement comment un hub de modèles peut dériver, et pourquoi le choix de la plateforme compte autant que le choix du modèle.
Sources & Ressources
- ComfyUI. Dépôt officiel du projet. https://github.com/comfyanonymous/ComfyUI
- Pinokio. Site officiel. https://pinokio.computer/
- ACE-Step 1.5. Dépôt officiel du modèle de génération musicale. https://github.com/ace-step/ACE-Step-1.5
- Hugging Face. Dépôt de référence pour les poids de modèles open source. https://huggingface.co/
- MIT Technology Review (30 janvier 2026). Inside the marketplace powering bespoke AI deepfakes of real women. https://www.technologyreview.com/2026/01/30/1131945/inside-the-marketplace-powering-bespoke-ai-deepfakes-of-real-women/
- 404 Media (13 juin 2025). Civitai Ban of Real People Content Deals Major Blow to the Nonconsensual AI Porn Ecosystem. https://www.404media.co/civitai-ban-of-real-people-content-deals-major-blow-to-the-nonconsensual-ai-porn-ecosystem/
- Civitai. Policy & Content Adjustments (communiqué officiel de la plateforme). https://civitai.com/articles/13632/policy-and-content-adjustments
- Lionel Vicidomini. Chaîne YouTube. https://www.youtube.com/channel/UCxvX9SHv7oPwKlQWijju-fw
- ComfyUI France. Communauté francophone. https://comfyui.fr/
- IA Locale Facile. Guides et tests en français. https://www.ia-locale-facile.fr/
- SECourses. Chaîne YouTube de Dr. Furkan Gözükara. https://www.youtube.com/SECourses
- Nerdy Rodent. Chaîne YouTube. https://www.youtube.com/channel/UC4-5v-f-xKnbi1yaAuRSi_w
- Olivio Sarikas. Chaîne YouTube. https://www.youtube.com/@OlivioSarikas