Col·laboram?
← Blog10 · Imatge sintètica

La IA dibuixa amb la feina d'artistes que no han cobrat ni un euro

Un criteri de disseny social davant els models que generen imatges

Servidors animats
GIF via Are.na ↗

Tota eina de producció d'imatges arrossega una economia política: algú la fabrica, alguna cosa l'alimenta, algú en paga el cost i algú n'obté el benefici. El que és nou en aquests models és l'escala: mai una eina no havia donat forma a tantes imatges, tan de pressa i amb tan poca gent al darrere.

La imatge sintètica és la que produeix un model estadístic entrenat amb un corpus d'imatges preexistents, a partir d'una instrucció escrita.

No és una il·lustració feta amb ordinador, perquè no hi ha decisió formal sobre cada element. Ni és un collage, perquè no reutilitza fragments identificables. És la mitjana d'un corpus, reordenada segons una petició.

Davant d'aquesta eina circulen dues respostes peresoses: la tecnofòbia que ho rebutja tot en bloc i l'evangelisme que ho celebra tot sense mirar-s'ho. Cap de les dues és disseny: dissenyar és decidir, i decidir demana criteri. El disseny social hi aporta el seu.

La matèria primera d'aquests models és feina d'altri

La primera qüestió és d'origen, i el sector prefereix no formular-la.

El 2023, les il·lustradores Sarah Andersen, Kelly McKernan i Karla Ortiz varen presentar una demanda col·lectiva contra Stability AI, Midjourney, DeviantArt i, més tard, Runway: havien entrenat els seus models amb milions d'obres protegides sense permís, sense crèdit i sense compensació.

L'any següent, el jutge William Orrick va deixar seguir endavant les reclamacions per drets d'autor amb un argument central: aquests models no són com una fotocopiadora, perquè estan construïts sobre les obres protegides.

No és, doncs, una eina neutra que algú pot fer servir bé o malament, sinó un sistema la matèria primera del qual és feina d'altri.

La paraula és probablement extractivisme: agafar el recurs d'un lloc, processar-lo lluny i vendre'l transformat sense que qui el va generar en vegi res. S'ha fet amb minerals i amb territoris. Ara es fa amb cultura.

Si l'eina s'ha construït buidant l'obra de milers d'il·lustradores que no hi varen consentir, cada imatge que en surt arrossega aquest deute, i el disseny social hauria de comptabilitzar-lo encara que no aparegui a cap pressupost.

Imatge sintètica.
Imatge sintètica. Via Are.na ↗

El núvol té un cost material que acabam pagant entre tots

La segona qüestió és física, i comença per una metàfora mal triada. El núvol no és cap núvol: són naus plenes de màquines que consumeixen electricitat i aigua.

El 2023, la investigadora Sasha Luccioni i el seu equip varen mesurar el cost energètic de les tasques d'intel·ligència artificial. Generar mil imatges amb un model com Stable Diffusion consumeix aproximadament l'energia de carregar un telèfon mòbil, i la generació d'imatge va resultar la tasca més intensiva de totes.

Un equip de la Universitat de Califòrnia a Riverside va estimar que entrenar un dels grans models va evaporar centenars de milers de litres d'aigua dolça, i que la demanda global podria retirar en pocs anys milers de milions de metres cúbics.

Aquestes xifres s'han convertit en camp de batalla: hi ha qui infla el cost per consulta i qui el minimitza.

La conclusió serena no és que cada imatge cremi un bosc: el cost individual és petit, l'agregat és enorme, i creix.

A una illa que ha vist restriccions d'aigua un estiu rere l'altre, aquest agregat no és una abstracció, sinó una condició de viabilitat territorial. Tot disseny té una dimensió ambiental, i el disseny social hauria de saber comptar la d'una eina que sembla immaterial.

La màquina pot eixamplar l'autonomia, però no pot donar arrelament

La tercera qüestió és de destinatari, i obliga a reconèixer usos que apunten on el disseny social ha volgut arribar sempre.

Be My Eyes va integrar el 2023 un model de visió que descriu imatges a l'instant per a persones cegues. Una persona amb baixa visió pot saber què hi ha dins la gelera o orientar-se per una estació sense dependre de ningú. Això no és espectacle tecnològic. És autonomia.

El mateix val per a la traducció automàtica que permet a una entitat petita parlar amb famílies nouvingudes, o per al prototipatge que posa a l'abast d'una associació de barri allò que abans només pagaven les grans marques.

Per a les majories que mai no han pogut pagar disseny, aquestes eines poden ser una porta. La qüestió, doncs, no és la màquina: és qui la controla, amb què s'ha alimentat i al servei de què es posa.

Hi ha, però, una limitació més fonda, i només en aparença estètica. Aquests models generen la mitjana estadística del que han vist, i el que han vist és l'imaginari global dominant. El resultat ja el coneixem: llum daurada, cares llises, un acabat de pòster igual a Palma que a Seül. Els investigadors de la cultura computacional en parlen com d'un encallament formal: la màquina tendeix cap al centre, i el centre no és de ningú.

El que aquesta tecnologia pot llevar no és la feina. És la immanència d'un lloc. Un cartell fet a Mallorca amb la mitjana estadística del món no és un cartell fet a Mallorca. El disseny de proximitat —el que treballa amb les formes, els materials i la memòria d'un territori— és l'anticòs contra aquesta planitud. L'acord amb una comunitat no el genera cap model: es guanya escoltant, a peu d'obra.

D'aquí se'n deriven quatre criteris previs a obrir un d'aquests programes. El primer és el de procedència: amb la feina de qui s'ha construït l'eina. El segon és el de cost material: quina despesa energètica i hídrica amaga. El tercer és el d'arrelament: si el resultat s'assembla al lloc on es publica o a la mitjana del món. El quart és el d'autonomia: a qui eixampla la capacitat de decidir i a qui la redueix.

Pens que aquests criteris no es responen sols: si no els respon la professió, els respondrà el mercat, i ja sabem què sol respondre. Decidir com es fa servir la màquina és, avui, una de les feines més concretes del disseny social.

Continua llegint