Salta el contingut

Limitacions del PLN

Al·lucinació

L'al·lucinació és el fenomen pel qual un LLM genera text que és plausible, fluid i confident però factual ment incorrecte. El model no "sap" quan no sap: genera la resposta que estadísticament és la continuació més probable del prompt, independentment de la seva veracitat.

Exemples coneguts: - Inventar referències bibliogràfiques que semblen reals però no existeixen (títol plausible, autors plausibles, revista plausible, any plausible, DOI inventat) - Atribuir cites a persones que mai les van fer - Donar dades numèriques específiques i incorrectes amb gran seguretat

Tècniques per mitigar l'al·lucinació: - RAG (fonamentar les respostes en documents verificats) - Temperature baixa (respostes menys creatives però més conservadores) - Prompts que demanen explícitament "si no saps la resposta, digues-ho" - Chain-of-Thought prompting: demanar al model que "pensi en veu alta" - Verificació cruzada entre models

Biaixos algorítmics

Els LLMs aprenen de corpus de text generats per humans, i per tant hereten tots els biaixos humans presents en aquell text: biaixos de gènere, racials, culturals, polítics.

Exemples documentats: - Associació "home" amb professions STEM i "dona" amb professions de cura - Representació desproporcionada de la perspectiva anglosaxona en temes culturals - Millor rendiment en anglès que en altres idiomes - Biaixos polítics derivats del desequilibri ideològic del corpus d'entrenament

Biaixos implícits vs. explícits: un biaix és explícit quan la variable que el genera apareix directament entre les variables predictores del model (p. ex. usar la raça com a entrada). És implícit quan una altra variable, aparentment neutra, el camufla: el cas més citat és l'ús del codi postal als EUA per a sancionar préstecs i crèdits, que reproduïa discriminació racial sense usar mai la raça com a variable. A la Unió Europea, el RGPD i l'AI Act obliguen a justificar de manera clara qualsevol denegació automatitzada de crèdit, cosa que dificulta aquest tipus de biaix camuflat.

Un estudi de referència de Federico Bianchi et al. (2023), "Easily Accessible Text-to-Image Generation Amplifies Demographic Stereotypes at Large Scale", va documentar com els models de generació d'imatges a partir de text amplificaven estereotips demogràfics: en generar imatges per a professions com "a software developer" o "a flight attendant", els models sobrerepresentaven un gènere molt per sobre de la proporció real d'aquella professió, i en generar "an American man and his house" enfront de "an African man and his house" produïen imatges amb una bretxa socioeconòmica marcada que no reflectia necessàriament la realitat.

Context window i limitacions de memòria

Tots els LLMs tenen un límit de tokens que poden processar simultàniament (context window). Quan la conversa supera aquest límit, el model "oblida" la part més antiga.

  • GPT-4o: 128K tokens (~96.000 paraules)
  • Gemini 1.5 Pro: 1M tokens (~750.000 paraules, equivalent a 5 novel·les llargues)
  • LLaMA 3.1: 128K tokens

Però atenció: una context window gran no implica que el model usi tota la informació de forma igual de bé. Estudis mostren que els LLMs tendeixen a pesar més la informació al principi i al final del context ("lost in the middle").

Cost computacional i sostenibilitat

Entrenar un LLM gran té un cost mediambiental significatiu: - GPT-3 (entrenament): s'estima en 552 tones de CO₂ equivalent (Strubell et al., 2019), equivalent a ~300 vols transatlàntics - GPT-4 (entrenament): estimat en l'ordre de magnitud de 10-100x GPT-3 - Inferència: cada consulta a GPT-4o consumeix ~10x l'energia d'una cerca web a Google

Iniciatives per reduir l'impacte: - Models més petits i destil·lats (DistilBERT, Phi-3, Gemma 2) - Quantització (reduir de 32 bits a 4-8 bits sense perdre gaire qualitat) - Hardware especialitzat (TPUs, chips d'IA de baixa potència) - Servidors alimentats amb energies renovables

El rol del lingüista en IA

Un dels errors comuns en projectes d'IA de PLN és subestimar la importància del lingüista en l'equip. El lingüista aporta:

Anotació de dades: Les dades d'entrenament supervisat (p. ex. per a NER o classificació) han de ser anotades per humans. El lingüista dissenya les guies d'anotació, forma als anotadors i controla la qualitat (inter-annotator agreement).

Avaluació de qualitat: Mètriques automàtiques com BLEU (traducció) o F1 (classificació) no capturen tots els matisos de qualitat lingüística. El lingüista avalua la fluïdesa, la coherència i la naturalitat de les sortides del model.

Prompt engineering: Saber formular les instruccions als LLMs és una habilitat lingüística. La manera de frasejar un prompt pot canviar dràsticament la qualitat de la resposta.

Detecció de biaixos lingüístics: El lingüista identifica biaixos de gènere en el lèxic, problemes de representació de dialectes o varietats lingüístiques, etc.

Tractament de varietats lingüístiques: Gestionar dialectes, registres (formal/informal), argot especialitzat, multilingüisme.

Miniactivitat — AC5071/03/02 (CA3.5) — Treball cooperatiu lingüista-informàtic

En parelles (un membre fa de lingüista, l'altre d'informàtic), feu el següent:

El lingüista: escriu 20 frases en català d'anàlisi de sentiment (10 positives, 10 negatives), que incloguin expressions col·loquials, sarcasme i idomes.

L'informàtic: passa les 20 frases per un model de sentiment de Hugging Face i recull els resultats.

Junts: analitzeu quines frases ha classificat malament el model i per quin motiu. Proposa com milloraria el lingüista les dades per corregir els errors del model.

Autoria dels textos generats per IA

Un dels grans dilemes ètics que ha obert l'ús massiu d'eines com ChatGPT és com registrar l'autoria d'un text generat total o parcialment per IA. La regulació encara varia molt segons el país i el context (acadèmic, periodístic, editorial) i està en ple desenvolupament.

Davant el dubte, la posició més ètica —i la que s'espera de qualsevol professional o estudiant IABD— és:

  • Assenyalar l'autoria real del text quan és pròpia.
  • Indicar explícitament quan s'ha usat un LLM com a suport per redactar, traduir o revisar un text (per exemple, amb una nota "Redactat amb l'ajuda de Claude/ChatGPT" o citant el prompt utilitzat).
  • Recordar que la responsabilitat final del contingut (exactitud, absència de biaixos, absència d'al·lucinacions) recau sempre en la persona que el publica, no en el model.

Miniactivitat — AC5071/03/05 — Biaix implícit i atribució d'autoria

a) Cerca (o imagina, si no en trobes cap de recent) un exemple real de biaix implícit en un sistema d'IA, és a dir, un cas en què una variable aparentment neutra (com el codi postal) actua com a proxy d'una característica protegida. Explica quina variable proxy s'utilitza i quin col·lectiu en resulta perjudicat.

b) Redacta un paràgraf curt (100 paraules) sobre qualsevol tema del mòdul demanant ajuda a un LLM per completar-lo o millorar-lo. Lliura el resultat acompanyat d'una nota d'atribució que indiqui exactament quina part és teva i quina ha estat generada o millorada amb IA.

Quan és factible aplicar PLN, i com es forma un investigador del camp

Quan té sentit aplicar PLN a un problema real? No tot problema de text necessita un LLM. Abans de triar una tècnica cal considerar:

  • Volum i disponibilitat de dades textuals: si només hi ha unes desenes de documents, potser no compensa entrenar ni ajustar cap model; una anàlisi manual pot ser més ràpida i fiable.
  • Tolerància a l'error: en dominis d'alt risc (mèdic, legal, financer) cal poder auditar i explicar cada decisió — els sistemes basats en regles (vegeu els chatbots basats en regles) o els sistemes experts (RA5) poden ser més adequats que un LLM opac.
  • Cost vs. benefici: un problema puntual i de baix volum (per exemple, classificar 50 correus al mes) pot no justificar el cost d'infraestructura d'un pipeline de PLN; unes regles de coincidència de paraules clau poden bastar.
  • Disponibilitat de dades en la llengua de treball: el rendiment dels models varia molt segons la llengua (vegeu la comparativa de models actuals); per a llengües minoritàries o dialectes concrets, cal validar-ho abans de comprometre's a una solució.

La formació teòrica de l'investigador en PLN combina, típicament, quatre àrees: lingüística formal (fonètica, morfologia, sintaxi, semàntica), fonaments matemàtics i estadístics (àlgebra lineal, probabilitat, optimització), aprenentatge automàtic i deep learning (les arquitectures de xarxes neuronals i Transformers), i ètica i avaluació (com mesurar la qualitat d'un sistema més enllà de les mètriques automàtiques, vegeu més amunt «El rol del lingüista en IA»). La majoria dels investigadors del camp provenen d'un grau en lingüística computacional, enginyeria informàtica o matemàtiques, seguit d'un màster o doctorat especialitzat en processament del llenguatge natural.

Miniactivitat — AC5071/03/06 — Factibilitat del PLN i itinerari formatiu

a) Descriu un cas d'ús real o inventat (per exemple, classificar les reclamacions d'un petit comerç, o analitzar el sentiment dels comentaris d'un blog local) i argumenta si té sentit aplicar-hi PLN o si n'hi hauria prou amb una solució més senzilla (regles, cerca de paraules clau). Justifica la resposta amb els criteris de volum de dades, tolerància a l'error i cost.

b) Cerca la fitxa d'un grau, màster o doctorat relacionat amb el PLN o la lingüística computacional (a Catalunya, Espanya o l'estranger) i identifica quines assignatures o competències hi apareixen de les quatre àrees esmentades (lingüística, matemàtiques, ML/DL, ètica). Comparteix l'enllaç i un resum de 5 línies.

Exercici pràctic del tema

AC5071/03/03 — Anàlisi de text amb Hugging Face

Desenvolupa un script Python complet que:

  1. Descarregui i usi un model de Hugging Face per a dues tasques NLP de la teva elecció (entre: sentiment, NER, traducció, resum, Q&A)
  2. Provi cada model amb 5 textos en català rellevants per a un context professional
  3. Analitzi les limitacions observades (mínima 3 exemples on el model falla)
  4. Calculi el temps d'inferència de cada model
  5. Elabori un breu informe (300 paraules) comparant les dues tasques en termes de qualitat, velocitat i casos d'ús adequats

Format d'entrega: notebook Jupyter .ipynb + informe .pdf a l'aula virtual.

Nom del fitxer: ac507103_03_nlp_nom_cognom.ipynb

Models recomanats per al català

  • Sentiment: nlptown/bert-base-multilingual-uncased-sentiment (suporta català)
  • NER: PlanTL-GOB-ES/roberta-base-ca-cased-ner (específic per al català)
  • Traducció: Helsinki-NLP/opus-mt-ca-en (català a anglès)
  • Embeddings: paraphrase-multilingual-mpnet-base-v2 (multilingüe, inclou català)