Texte dans les images : le faux raccourci pour être recommandé par les IA

Un smartphone posé en diagonale sur un clavier affiche une conversation avec ChatGPT.

ChatGPT affiché sur un smartphone. Photo d'archive du 18 mai 2023. Jernej Furman / Wikimedia Commons, CC BY 2.0. Version redimensionnée.

ChatGPT, Claude et Gemini savent analyser des images. En déduire qu'ils examinent automatiquement tous les visuels d'un site pendant leurs recherches est une promesse sans fondement. Pour une entreprise, enfermer une information commerciale dans les pixels ajoute un obstacle à sa lecture, pas un avantage démontré à sa présence IA.

Prenons un réparateur qui présente son offre sur une belle affiche JPEG. Le tarif du dépannage, les communes desservies et les conditions de garantie y figurent. Sur la page, un titre et un bouton de contact accompagnent l'image. Un visiteur voit l'offre complète. L'outil qui rapporte le texte de cette page à un assistant peut ne lui transmettre ni le prix, ni la zone, ni la garantie.

Le mot « multimodal » ne résout pas ce problème. Il désigne la capacité d'un modèle à traiter plusieurs types de contenus, dont les images. Il ne décrit pas la manière dont un service choisit les ressources à récupérer sur le Web. Confondre les deux revient à promettre la lecture d'un document sans s'assurer qu'il arrive sur le bureau du lecteur.

Entre trouver une page et voir ses images, plusieurs opérations

Une recherche commence par la récupération de résultats et de contenus. Le modèle travaille ensuite avec ce qui lui est transmis. Les documentations publiques des API, les interfaces proposées aux développeurs, permettent d'examiner ces mécanismes, distincts du fonctionnement intégral des applications grand public.

Chez Anthropic, l'outil de récupération de pages web renvoie le contenu textuel d'une URL. Il prend en charge le texte, le HTML et les PDF, pas directement les fichiers image. Récupérer le texte d'une page par ce chemin ne revient donc pas à ouvrir chaque photographie, bannière ou infographie qu'elle affiche.

La recherche peut aussi faire remonter des images. OpenAI le prévoit dans sa documentation de recherche web, avec des résultats comprenant l'adresse de l'image, sa page source, une vignette et, parfois, une légende. Mais obtenir l'adresse d'un fichier ou sa légende ne suffit pas à en interpréter les pixels. Pour cette opération, le guide de vision d'OpenAI décrit des images effectivement fournies au modèle, par URL, fichier ou données encodées.

La même distinction apparaît chez Google : l'outil URL context de Gemini sait récupérer des images depuis les URL fournies, mais ne parcourt pas les liens imbriqués pour en aspirer tous les contenus.

La question décisive est donc ce que le modèle reçoit pendant la recherche. Un extrait de texte, une légende et une image à analyser ne lui donnent pas accès aux mêmes informations. Montrer qu'un assistant déchiffre une affiche qu'on lui transmet ne démontre rien sur la récupération de cette affiche lorsqu'un futur client cherche un prestataire.

La lecture visuelle a un coût et une résolution

Traiter une image mobilise des ressources. Dans sa documentation de vision, Anthropic donne l'exemple d'une image de 1 000 × 1 000 pixels représentant 1 296 tokens visuels. Ces tokens sont des unités de contenu traitées et comptabilisées par le service. Ils s'ajoutent aux autres contenus de la requête.

Le budget dépend notamment du modèle et de la résolution retenue. Pour reconnaître un produit, une image réduite peut suffire. Pour déchiffrer les petites conditions de garantie au bas d'une affiche, conserver les détails devient important. Anthropic recommande d'adapter la résolution au besoin et de redimensionner les images avant leur envoi pour limiter la latence. Une réduction excessive ou une compression forte peut compromettre la lecture du texte.

Il existe donc un arbitrage entre quantité d'informations, précision et temps de réponse. Les outils de récupération ont eux aussi leurs budgets. Anthropic documente un filtrage des contenus utiles avant leur transmission au modèle, tandis qu'OpenAI précise qu'augmenter le budget de contenu retourné par la recherche peut accroître le coût et la latence.

La fenêtre de contexte est l'ensemble des informations dont le modèle dispose pour préparer sa réponse. Pour y faire entrer une condition de garantie inscrite dans une image, il faut récupérer le visuel et en déchiffrer le contenu, ou disposer d'une extraction préalable. La même condition publiée en texte peut être récupérée directement. La transformer en pixels impose donc un traitement supplémentaire, sans avantage démontré pour transmettre cette information.

Une URL citée ne prouve pas que votre tarif a servi

Chez Maple Labs, nous distinguons l'accès à une page de l'utilisation effective de ses informations dans une réponse. Une URL citée ne prouve pas qu'un tarif inscrit dans une image a contribué à la comparaison. Pour une entreprise, cette distinction évite de prendre une présence dans les sources pour une bonne compréhension de son offre.

Revenons au réparateur. Un assistant peut identifier son activité et citer son site, tout en ne disposant pas des communes couvertes ou des conditions de garantie. Or ces éléments peuvent décider de la pertinence de l'entreprise pour le client. Une réponse qui connaît son nom mais ne peut pas établir qu'elle intervient à l'adresse demandée manque une information commerciale essentielle.

La vérification utile porte sur cette information : le tarif est-il correctement repris, avec ce qu'il comprend ? La zone desservie est-elle identifiée ? Les conditions de garantie sont-elles mobilisées quand la demande les rend importantes ? Regarder uniquement si le domaine apparaît dans les citations laisse ces questions sans réponse.

Garder l'image, publier aussi ce qu'elle dit

La priorité est de faire exister les informations essentielles en texte réellement accessible sur la page. Pour notre réparateur, cela signifie afficher son tarif et les prestations incluses, nommer les communes desservies et expliquer sa garantie dans le contenu de la page. L'affiche peut rester. Elle ne doit plus être l'unique endroit où l'offre est décrite.

Cette recommandation rejoint un principe ancien de l'accessibilité. Le W3C recommande d'utiliser du texte plutôt que des images de texte lorsque la présentation peut être reproduite ainsi. Son document donne notamment l'exemple d'une affiche accompagnée de son texte. Le lecteur peut alors adapter la taille des caractères et leur présentation, au lieu de dépendre d'un bloc de pixels figé.

Pour des tarifs complexes, un véritable tableau dans la page conserve le lien entre chaque formule, son prix et ses conditions. Un texte alternatif utile accompagne le visuel, mais ne remplace pas cette présentation détaillée par un inventaire de mots-clés. Lors d'une mise à jour, le texte et l'image doivent continuer à annoncer la même offre.

Publier ces éléments en texte retire un obstacle concret à leur exploitation. Miser uniquement sur le texte incrusté dans les images laisse cet obstacle en place et parie sur une lecture supposée. Un visuel peut montrer un produit, expliquer un geste ou rendre une offre mémorable. Le prix et les conditions qui engagent votre entreprise méritent mieux qu'une chance d'être déchiffrés.