Skip to content
image generationChatGPTGPT Image 2promptingcreative work

D'une idée à une image que vous pouvez vraiment utiliser

Une méthode pratique pour créer des images avec GPT Image 2: transformer une idée vague en brief visuel, choisir une direction artistique, générer l'image dans ChatGPT et améliorer le résultat sans jouer à la roulette des prompts.

Fabian Mösli Fabian Mösli
· 15 min de lecture · 2026-07-18

L'essentiel en bref

  • Commencez par la tâche que l'image doit accomplir. Un brief visuel vaut mieux qu'une accumulation d'adjectifs stylistiques, car il donne des priorités au modèle.
  • Utilisez un LLM pour vous interviewer et structurer le brief, puis lancez la génération. Gardez les textes et les faits hors du modèle de génération d'images jusqu'à ce qu'ils soient finalisés.
  • Traitez la première image comme un brouillon. Diagnostiquez le principal problème, changez une seule variable et poursuivez la conversation au lieu de recommencer.
Dans ce guide

Je génère la plupart de mes images IA via Poe. Un seul abonnement me donne accès à des dizaines de modèles d’image et de vidéo, ce qui me permet de passer de l’un à l’autre sans entretenir toute une ménagerie de comptes. Pour ce guide, j’utilise toutefois ChatGPT comme interface par défaut. Davantage de gens y ont déjà accès, et son outil d’édition d’images rend le parcours d’apprentissage plus facile à suivre.

Dans les deux cas, le modèle sous-jacent est GPT Image 2. L’expérience qui l’entoure diffère. Et cette distinction compte plus qu’il n’y paraît.

Ce guide part d’une page blanche et aboutit à une image que vous pourriez vraiment intégrer dans une campagne, une présentation ou un article. La deuxième partie reprend la même image pour la modifier. La troisième partie transforme le workflow en un système professionnel reproductible et ajoute la couche API.

GPT Image 2 est-il le même dans Poe et ChatGPT?

La réponse courte: même moteur, véhicule différent.

La page officielle de GPT-Image-2 sur Poe indique que le bot est alimenté par un serveur géré par OpenAI. Vous bénéficiez des capacités de génération et d’édition du modèle de base, avec des réglages pour trois formats, une qualité faible, moyenne ou élevée, des images en pièces jointes et un masque facultatif.

ChatGPT intègre ce modèle dans un produit plus large. Le guide actuel d’OpenAI consacré aux images dans ChatGPT présente un outil de sélection, une bibliothèque d’images, l’édition conversationnelle et un sélecteur de format. Le mode avec réflexion peut aussi effectuer des recherches, raisonner sur le brief et créer plusieurs ressources à partir d’une seule demande; OpenAI le propose actuellement sur les offres Plus, Pro et Business. La fonctionnalité d’image de base est disponible dans toutes les offres ChatGPT.

Oui, le modèle d’image peut comprendre le même type de prompt dans Poe. Mais n’attendez ni des résultats identiques au pixel près ni le même workflow. ChatGPT peut effectuer davantage de travail avant que la demande d’image n’atteigne le modèle. Poe fournit une interface plus directe, avec moins de fonctionnalités autour du modèle. Les limites d’utilisation et les conditions de confidentialité dépendent aussi du produit que vous utilisez, pas seulement du nom du modèle affiché sur le bouton.

Pour une première tentative structurée, utilisez ChatGPT. Une fois la méthode comprise, il est facile de la transposer dans Poe.

Étape 1: décidez ce que l’image doit accomplir

La plupart des prompts faibles commencent par le sujet:

Créez une photo haut de gamme d’une tasse à espresso pour une marque de café.

Cela suffit pour obtenir une image de café plausible. Mais ça ne dit presque rien sur sa fonction. S’agit-il d’une bannière de site web avec du texte à gauche? D’un visuel carré pour présenter un produit? D’une publicité imprimée et sombre? Du fond d’une slide, avec un espace dégagé derrière un graphique?

Le modèle prendra ces décisions à votre place. Il ne peut pas savoir lesquelles comptent.

Avant d’ouvrir Images, notez quatre éléments:

  1. Support: Où cette image apparaîtra-t-elle?
  2. Public: Qui doit la remarquer ou la comprendre?
  3. Action: Que doit ressentir, comprendre ou faire la personne qui la regarde?
  4. Format: Slide large, publication carrée, story verticale, affiche ou autre chose?

Pour l’exemple qui nous accompagnera dans cette série, la fonction est simple: une image de campagne au format 3:2 pour une marque de café indépendante fictive. La tasse se trouve à droite afin que la personne chargée du design puisse ajouter du texte à gauche plus tard. L’ambiance doit être calme, tactile et haut de gamme, sans tomber dans la photo de stock trop léchée.

Ce seul paragraphe facilite des dizaines de décisions visuelles.

Étape 2: laissez le LLM vous interviewer

Vous n’avez pas besoin d’arriver avec une direction artistique aboutie. Utilisez le modèle de langage dans ChatGPT pour vous aider à en construire une avant de lui demander de générer l’image.

Collez ceci dans un chat normal:

Je dois créer une image, mais mon brief reste vague.

Interrogez-moi, une question à la fois. Aidez-moi à décider:
- où l'image sera utilisée
- à qui elle s'adresse
- du sujet principal et du décor
- de la composition et de la position de la caméra
- du style visuel ou du médium
- de l'éclairage et de l'ambiance
- de la palette de couleurs et des matières
- de tout texte exact qui doit apparaître
- de ce qui doit rester hors de l'image
- du format

Contredisez-moi lorsque mes choix sont incompatibles. Lorsque vous aurez assez
d'informations, rédigez un brief visuel concis que je pourrai utiliser pour
générer l'image. Ne générez pas encore l'image.

C’est un meilleur usage d’un LLM que de lui demander d’« améliorer mon prompt ». L’améliorer dans quel but? L’interview fait ressortir les décisions qui manquent.

Si vous connaissez déjà l’essentiel du brief, passez l’interview et donnez vos notes brutes au LLM. Demandez-lui de repérer les ambiguïtés, pas de tout rendre plus élaboré. Les prompts d’image empirent souvent quand chaque nom se retrouve accompagné de trois adjectifs.

Étape 3: transformez les réponses en brief visuel

J’utilise la structure suivante. C’est une checklist, pas un formulaire que vous devez remplir à chaque fois.

Support et public:
Demande principale:
Sujet:
Scène ou arrière-plan:
Style ou médium:
Composition et cadrage:
Éclairage et ambiance:
Palette de couleurs:
Matières et textures:
Texte exact:
À conserver:
À éviter:
Format:

L’ordre suit la manière de réfléchir d’un directeur artistique: fonction, sujet, scène, composition, puis finition. Vous pouvez rédiger le tout en prose si vous préférez. Les libellés permettent simplement de repérer plus facilement les oublis.

Pour l’exemple du café, le brief final est devenu:

Support et public: image de campagne au format 3:2 pour une marque de café
indépendante fictive.

Demande principale: une petite tasse à espresso en céramique façonnée à la main,
d'un orange brûlé et remplie d'espresso, photographiée sur une table de café en
pierre sombre à finition adoucie dans le calme de l'aube. Une gousse de cardamome verte
et une serviette pliée en lin naturel se trouvent en retrait derrière la tasse,
comme détails secondaires discrets.

Sujet: la tasse orange brûlé est clairement l'élément central. Montrez les légères
irrégularités de l'émail, un anneau de crema réaliste et une subtile empreinte
digitale dans l'argile.

Style ou médium: photographie éditoriale naturelle de produit, sobre plutôt que
publicitaire et brillante.

Composition et cadrage: format paysage 3:2, caméra à hauteur de table avec un
rendu d'objectif 50 mm, tasse dans le tiers droit, espace négatif propre à gauche
pour le texte, faible profondeur de champ.

Éclairage et ambiance: douce lumière bleue de l'aube venant de la fenêtre à gauche,
avec un seul reflet chaud sur la tasse provenant d'un éclairage d'appoint. Ambiance
calme et tactile.

Palette de couleurs: orange brûlé, anthracite, bleu-gris sourd, lin naturel.

À éviter: soucoupe, grains de café éparpillés, logos, texte lisible.

Vous pouvez coller ce brief dans ChatGPT et lui dire: « Créez cette image. » Vous pouvez aussi ouvrir Plus → Images et le coller à cet endroit. À l’heure où j’écris ces lignes, ChatGPT vous permet de choisir un format dans l’interface ou de l’indiquer dans le prompt.

Étape 4: comparez une demande et un brief

J’ai généré le prompt vague d’une ligne et le brief dirigé avec le même modèle. Les deux images sont réussies. Une seule sait à quoi elle doit servir.

Le prompt d'une ligne a produit une image de café soignée, dans le style d'une photo de stock. Elle est utilisable, mais le modèle a choisi à ma place la tasse en verre, la composition centrée, les grains éparpillés et l'ambiance générale.
Le brief visuel a produit une image dotée d'une fonction: la tasse possède une identité matérielle distincte, le côté gauche peut accueillir du texte et l'éclairage soutient la direction calme de l'aube.

La différence vient des priorités, pas du simple volume de détails. L’identité de la tasse compte. Sa position compte. L’espace négatif compte. Une soucoupe et des grains éparpillés iraient à l’encontre de la direction, ils sont donc exclus.

L’image issue du brief détaillé reste imparfaite. La gousse de cardamome et le lin sont moins maîtrisés que je ne l’avais demandé, et une seule génération ne suffit pas à produire une campagne terminée. C’est normal. Un bon brief vous donne un point de départ utile et un langage pour formuler la correction suivante.

Étape 5: choisissez une direction artistique claire

« Rendez-la plus créative » est une consigne presque impossible à appliquer. Plus créative, dans quelle direction?

Demandez au LLM de proposer des pistes visuelles distinctes avant de toutes les générer. Voici une demande utile:

Proposez-moi six directions visuelles vraiment différentes pour ce brief.
Chaque direction doit avoir un médium précis, un principe de composition, une
approche de l'éclairage et une raison pour laquelle elle convient à la fonction
de l'image. Ne me donnez pas six variations d'une même photo de produit haut de gamme.

Les grandes familles à connaître sont simples:

  • Photographie naturelle: éditoriale, documentaire, produit en studio, architecture, macro.
  • Illustration: encre, gouache, linogravure, dessin technique, album jeunesse, manga.
  • Design graphique: collage, affiche, grille suisse, double page éditoriale, visualisation de données.
  • Travail en volume: argile, sculpture en papier, décor miniature, 3D soignée, scène isométrique.
  • Techniques historiques: cyanotype, risographie, sérigraphie, gravure sur bois, ancienne pellicule couleur.

Le médium change bien plus que la finition. Il change les détails qui paraissent naturels, le fonctionnement de la composition et le type d’erreur qui semble acceptable.

Un sujet, quatre médiums: photographie éditoriale naturelle, papier découpé tactile, argile 3D sculpturale et illustration à l'encre et à la gouache. Le brief reste stable tandis que la grammaire visuelle change.

Utilisez des références lorsque les mots ne sont plus assez précis. Téléversez deux ou trois images et indiquez le rôle de chacune: « L’image 1 sert de référence pour l’éclairage, l’image 2 pour la composition et l’image 3 pour la texture. Ne copiez ni leur sujet ni leur identité de marque. » Cette séparation réduit le risque que le modèle traite toutes les références comme une seule grande consigne de collage.

Étape 6: améliorez un seul élément à la fois

Réécrire tout le brief après chaque image est le chemin le plus rapide vers la roulette des prompts. Vous perdez la trace du changement qui a aidé.

Après le premier résultat, diagnostiquez le principal problème:

  • La composition est mauvaise: déplacez le sujet, changez la hauteur de la caméra, ajoutez de l’espace négatif.
  • Le style ne convient pas: changez de médium ou de direction artistique.
  • L’ambiance ne convient pas: modifiez la source lumineuse, le contraste, la météo ou l’heure de la journée.
  • Le sujet ne convient pas: décrivez sa matière, sa forme, son âge et ses particularités.
  • L’image est trop chargée: retirez les objets secondaires et donnez plus d’espace au sujet.
  • Le résultat semble générique: ajoutez un détail physique précis qui ne pourrait appartenir qu’à cette scène.

Donnez ensuite une seule instruction de suivi:

Conservez la tasse, les matières, la palette de couleurs, l'éclairage, l'angle de
la caméra et le cadrage. Déplacez la tasse légèrement plus bas et plus à droite,
afin que la moitié gauche offre un espace ininterrompu pour un titre court. Ne
changez rien d'autre.

La formule « ne changez rien d’autre » aide. Elle ne fige pas les pixels. Les modèles d’image peuvent toujours dériver, c’est pourquoi le guide d’édition traite les éléments immuables et les points de contrôle propres comme une discipline à part entière.

Étape 7: créez un visuel professionnel sans inventer de faits

GPT Image 2 maîtrise bien mieux le texte et les mises en page structurées que les anciens modèles d’image. Les exemples de lancement d’OpenAI comprennent des affiches, des infographies, de la typographie multilingue, des diagrammes et du contenu proche d’une présentation. Les visuels générés deviennent donc vraiment utilisables dans un contexte professionnel.

Cela crée aussi un nouveau mode d’échec: le mensonge impeccablement mis en page.

Séparez le travail d’information du travail de design. Commencez par produire et vérifier le texte, les libellés, les chiffres et les mentions de sources en dehors de l’image. Verrouillez-les ensuite, puis demandez le visuel.

Pour cet exemple, j’ai volontairement utilisé des chiffres inventés:

Créez une seule slide de présentation exécutive au format 16:9.

Utilisez exactement ces données, explicitement fictives:
- Mise en route lente 42 %
- Valeur peu claire 31 %
- Intégrations manquantes 27 %

Titre: « POURQUOI LES CLIENTS PARTENT »
Pied de page: « Données d'exemple fictives »

Utilisez un design d'information éditorial épuré, avec une toile blanc cassé
chaud, du texte anthracite, des barres indigo et un motif café orange brûlé
discret. N'ajoutez aucune statistique ni aucun texte explicatif.
GPT Image 2 a correctement rendu le titre, les trois libellés, tous les pourcentages et la mention de données fictives. Je vérifierais quand même chaque caractère avant de présenter la slide, car un rendu visuellement convaincant ne garantit pas l’exactitude des faits.

Pour un vrai travail, je demanderais probablement au modèle de proposer la structure visuelle, puis je recréerais le graphique final dans PowerPoint, Keynote, Figma ou un autre outil déterministe. Les chiffres restent ainsi modifiables et accessibles. L’image générée convient très bien pour un concept, un arrière-plan ou un brouillon rapide. Mais c’est un endroit risqué pour conserver l’unique copie de vos données.

Là où la génération d’images fait encore perdre du temps

GPT Image 2 peut produire des créations remarquablement abouties, mais quelques tâches méritent toujours votre scepticisme.

Une identité parfaitement cohérente sur de nombreuses images. Un personnage ou un produit peut dériver. Les références et la répétition des éléments immuables aident; un pipeline de design contrôlé aide davantage.

Une mise en page au pixel près. Si chaque ligne doit s’aligner sur une grille et rester modifiable, utilisez un outil de design. Générez les éléments visuels, puis assemblez-les de manière déterministe.

Des faits denses. Le modèle peut produire un diagramme convaincant dont la logique est fausse. Vérifiez le contenu en dehors de l’image.

Les logos et les marques. Un modèle peut créer quelque chose de trop proche d’une marque existante. Faites une véritable recherche d’antériorité en matière de marques avant d’utiliser commercialement une identité générée.

Les sources confidentielles. Les comptes ChatGPT grand public peuvent utiliser les conversations pour améliorer les modèles lorsque le contrôle de données correspondant est activé. La FAQ d’OpenAI sur les contrôles des données explique comment désactiver « Améliorer le modèle pour tous » ou utiliser un chat temporaire. OpenAI indique que les entrées et sorties de Business, Enterprise et de l’API ne servent pas à améliorer les modèles par défaut. La politique de votre employeur reste prioritaire.

Un exercice de 20 minutes

Choisissez un support réel mais peu risqué: une slide d’ouverture, une illustration de newsletter, une image de produit fictif ou une affiche pour un événement privé.

Passez cinq minutes à définir la fonction de l’image. Laissez le LLM vous interviewer pendant cinq minutes. Générez une image. Consacrez les dix dernières minutes à deux itérations qui ne modifient qu’un élément chacune.

Enregistrez quatre éléments ensemble:

  • l’image finale
  • le brief
  • la meilleure instruction de suivi
  • une phrase sur ce qui n’a pas encore fonctionné

Ce petit dossier vaut mieux qu’un répertoire de vingt variations non libellées. Il vous apprend ce que votre jugement a apporté.

Passez ensuite l’image de café dirigée dans Modifiez l’image, gardez ce qui fonctionne. C’est là que la génération d’images cesse de ressembler à une machine à sous et commence à se rapprocher d’un atelier visuel.

Publié le: 2026-07-18

Dernière mise à jour: 2026-07-18

Stay in the loop

Don't miss what's next

I'm curating the best AI tools for professionals. Join the list and I'll reach out when I have something worth sharing.