Un laboratori per entendre les capes

Capa a Capa

Del cervell a un model de llenguatge

Es diu Capa a Capa perquè una xarxa no és un sol truc. És la mateixa idea, repetida. Cada capa existeix perquè l’anterior es queda curta, i per entendre-ho no cal començar per ChatGPT: cal començar per una cèl·lula.

Si és la primera vegada que obres això, no cal saber programar ni haver sentit parlar de xarxes neuronals. Començarem pel principi de veritat: una cèl·lula del cervell. Cajal la va veure al microscopi. Sherrington va posar nom al salt entre cèl·lules. McCulloch i Pitts la van escriure amb uns i zeros. I fa unes dècades vam copiar aquest gest en una màquina. La busca que les màquines aprenguin i decideixin. El matís important: no raonen com nosaltres. Calculen probabilitats a partir d’exemples.

Què entenem aquí per intel·ligència artificial

És una part de la informàtica que construeix sistemes capaços de percebre l’entorn i d’actuar d’una manera que ens sembla intel·ligent: aprendre, decidir, respondre. La idea de fons és una màquina que millori amb l’experiència. El matís que ens interessa: quan diem que «raona», a la pràctica està ajustant a molts exemples, no seguint una lògica humana pas a pas.

Barreja programari, maquinari i percepció de l’entorn. Per això de vegades sembla que pensa, i per això també s’equivoca d’una manera estranya.

Què no és, per no perdre’ns

  • No és una ment i no té intencions. No «vol» ajudar-te. Prediu quina peça de text és més probable a continuació, a partir de molts exemples.
  • Que el text soni bé no vol dir que sigui cert. L’eloqüència no és correcció. Un model pot escriure una data falsa amb la mateixa fluïdesa que una de verdadera.
  • No és màgia. És programari, electricitat i silici. Amplifica el teu criteri si tu el tens; no el substitueix si no el tens.

Què sí que és, dit a poc a poc

  • Un model matemàtic enorme: milions o milers de milions de nombres (els paràmetres) ajustats per reconèixer patrons en text, imatges o so.
  • Una màquina que, donat un tros de frase, aposta quina peça ve a continuació. Un paràgraf es construeix repetint aquesta aposta, una vegada i una altra.
  • Un amplificador de capacitats. Si saps el que busques, et fa més ràpid. Si no, pot donar-te una falsa sensació que «ja ho fa tot sol».

Tres distincions per no perdre’s

Abans d’entrar a les capes, tres idees que tornen a tot arreu. Les hem pres del taller de fonaments d’IA per a gent curiosa, i les expliquem aquí perquè es puguin tocar.

Primera

Una calculadora sempre diu el mateix

Un programa clàssic és determinista: mateixa entrada, mateixa sortida. 2 + 3 són 5, les vegades que vulguis. Pots escriure un test i passar-lo.

2 + 3 = 5

L’has premut 0 vegades. El resultat no ha canviat mai.

Segona

Un model de llenguatge sorteja

La mateixa frase pot continuar de dues maneres. El model no té una sola resposta: té percentatges, i després . Puja la i el sorteig es fa més agosarat. Això és un sistema .

Els arbres són…

  • verds77%
  • alts15%
  • vells6%
  • salats2%

Prem el botó unes quantes vegades. Amb temperatura baixa, gairebé sempre surt la mateixa. Amb temperatura alta, es colen paraules rares.

Tercera, part A

Programar és escriure la regla

«Si hi ha diners I ganes, anem de viatge.» Tu penses la lògica. L’ordinador només l’executa. Si et deixes un cas, falla.

Tercera, part B

Aprendre és donar exemples

No escrius l’«si». Dónes casos de «això sí / això no» i la xarxa mou els pesos. Per això un perceptró pot decidir un viatge sense que tu li hagis escrit totes les combinacions.

Provar-ho al perceptró

Quatre persones, abans de la màquina

Abans del perceptró hi ha una història que val la pena explicar amb calma. Sense ella, la «neurona artificial» sembla un invent caigut del cel.

  1. 1888–1906

    Cajal

    El cervell està fet de cèl·lules separades, no d’una malla contínua.

  2. 1897

    Sherrington

    El salt entre dues neurones es diu sinapsi. Allà viu l’aprenentatge.

  3. 1943

    McCulloch i Pitts

    La neurona, escrita amb uns i zeros. Encara no aprèn: la regla és fixa.

  4. 1949

    Hebb

    Si dues cèl·lules disparen juntes, la connexió es fa més forta.

Veure-ho al capítol de la neurona

La recepta, en sis passos

El model no veu paraules. Veu nombres. Després sorteja. Després enganxa i torna a començar.

  1. 01

    Text

  2. 02

    Fitxes

  3. 03

    Nombres

  4. 04

    Percentatges

  5. 05

    Sorteig

  6. 06

    Enganxar i repetir

Resums per emportar-te

Un full per capítol, per guardar o imprimir. Què és, quan sorgeix, per què cal, i la frase per recordar.

  • 01 La neurona
  • 02 El perceptró
  • 03 Xarxa neuronal
  • 04 Model de llenguatge
  • 05 El suport
  • 06 El taller
  • 07 On solíem ensopegar

Publicat sota CC BY 4.0. Contingut editorial → CC BY 4.0 (Atribució). Pots copiar, adaptar i reutilitzar aquest material, fins i tot amb finalitats comercials, sempre que citis l’origen: Capa a Capa, de David Bernal López.

Preguntes que tornen

La intel·ligència artificial pensa com una persona?
No. No té una ment ni un pla amagat. A cada pas prediu la peça de text següent, l’enganxa, i torna a començar. Un paràgraf sembla pensat perquè aquesta loteria, repetida, sona fluent.
Per què de vegades inventa dades amb tanta seguretat?
Perquè ha après a escriure de manera fluent, no a distingir el que és cert. El percentatge que assigna a una paraula és una aposta, no una garantia. Per això pot al·lucinar: text plausible que no és veritat.
On viu, de debò, un model?
En nombres, desats a la memòria d’un xip. Sense silici i sense corrent el model no «continua pensant» en cap núvol abstracte: s’apaga, com un llum.
Per què parlem de tantes capes?
Perquè cadascuna existeix quan l’anterior es queda curta. Una sola neurona no basta. Una sola ratlla no separa el que cal. Un píxel no veu una cara. I una sola paraula no fa un paràgraf.

Què és cada peça, quan apareix i per què cal

Primer la cèl·lula del cervell i qui la va veure. Després tres còpies cada vegada més capaces, perquè l’anterior es queda curta. Al final, el lloc físic on es calculen els nombres.

01

Neurona

Una cèl·lula que rep estímuls, els suma i s’activa —o es queda en silenci. Cajal la va veure; la màquina la copia.

Què és
La unitat del cervell. Rep estímuls elèctrics per les dendrites, els suma al cos i, si passen un llindar, dispara per l’axó. No pensa: o s’activa, o no. Cajal va demostrar que són cèl·lules separades; Sherrington va anomenar el salt entre elles.
Quan sorgeix
El cervell, de sempre. Cajal dibuixa la neurona com a peça (1888). Sherrington anomena la sinapsi (1897). McCulloch i Pitts n’escriuen la primera fórmula (1943). Hebb explica el reforç (1949). El 1958 Rosenblatt copia el gest en una màquina.
Per què sorgeix
Veure, parlar o fer malabars: les neurones que cooperen tornen a disparar-se juntes, i la connexió es fa més forta. Sense aquest reforç no hi ha aprenentatge, ni biològic ni artificial. Per això comencem aquí, i no per ChatGPT.
Entrar en aquest capítol
  1. 02

    Perceptró

    Una màquina que diu sí o no.

    Què és
    La còpia numèrica d’una neurona. Cada factor (diners, ganes, clima) entra com 0 o 1, es multiplica per un pes —quant compta— i si la suma passa el llindar, el viatge es fa.
    Quan sorgeix
    El 1958, Frank Rosenblatt. Agafa la fórmula de McCulloch i Pitts —que encara no aprenia— i hi afegeix l’aprenentatge amb exemples: la màquina ajusta sola quant compta cada entrada.
    Per què sorgeix
    Ajustar a mà els pesos d’una xarxa gran és una consola infinita de pomells. El perceptró aprèn. El límit: només si els sí i els no es tallen amb una ratlla.
    Entrar en aquest capítol
  2. 03

    Xarxa neuronal

    Diverses neurones en equip.

    Què és
    Una funció: entrades, una capa oculta que processa, una sortida. No programes l’interior. Dónes exemples i l’aprenentatge ajusta els pesos. XOR és la joguina; el color del text, el cas de veritat.
    Quan sorgeix
    Anys 80. Descobreixen com ensenyar a moltes capes alhora: l’error es reparteix cap enrere, neurona a neurona (retropropagació). S’acaba l’ajust a mà.
    Per què sorgeix
    Hi ha problemes fàcils per a tu i difícils d’escriure com if. Blanc o negre sobre un fons. Gos o plàtan. XOR. Una ratlla no basta: cal un equip, i exemples.
    Entrar en aquest capítol
  3. 04

    LLM

    Una xarxa enorme que endevina la paraula següent.

    Què és
    No pensa un paràgraf. Parteix el text en fitxes, les passa a nombres, mira quines paraules importen ara i aposta la següent. L’enganxa i torna a començar. Estadística, no lògica.
    Quan sorgeix
    2017, el transformer. 2018, GPT. Des d’aleshores no hi ha màgia nova: més dades, més capes, més context.
    Per què sorgeix
    Les xarxes anteriors llegien en fila i oblidaven el principi. L’atenció deixa que cada paraula miri les altres alhora. Per això pot completar «Els arbres són…» sense perdre el subjecte.
    Entrar en aquest capítol

05

Els nombres necessiten un lloc

Les idees dels capítols anteriors no pesen: són receptes. Perquè un perceptró existeixi de veritat cal silici, corrent i un edifici que no s’escalfi.

Què és
El suport físic d’una xarxa: nombres desats a la memòria, moguts per transistors en un xip. Un GPU és un estadi de sumadors. Un datacenter és la fàbrica que els alimenta, els refreda i els connecta.
Quan sorgeix
1947, el transistor. Després el xip, el GPU (2000s) i, amb els LLM, naus senceres de GPUs. L’idea de 1958 no va canviar: va canviar quantes vegades es pot repetir per segon.
Per què sorgeix
Un perceptró són 12 bytes. Un model gran no cap en un portàtil, triga anys a entrenar-s’hi, i s’escalfa. El datacenter existeix per temps, memòria i calor — no per màgia.
Entrar en aquest capítol

Els capítols, per entrar-hi quan vulguis

  1. 01

    Neurona

    Una cèl·lula que rep estímuls, els suma i s’activa —o es queda en silenci. Cajal la va veure; la màquina la copia.

    Entrar en aquest capítol
  2. 02

    Perceptró

    Una màquina que diu sí o no.

    Entrar en aquest capítol
  3. 03

    Xarxa neuronal

    Diverses neurones en equip.

    Entrar en aquest capítol
  4. 04

    LLM

    Una xarxa enorme que endevina la paraula següent.

    Entrar en aquest capítol
  5. 05

    Suport

    La recepta, en silici.

    Entrar en aquest capítol

És la mateixa idea, a una altra escala

El cervell no inventa un òrgan nou per a cada ofici: reforça les , és a dir, les connexions. La màquina fa una cosa semblant. Una s’activa o no. El perceptró copia aquest gest amb nombres. Diverses neurones juntes poden resoldre coses que una sola no pot. Un model de llenguatge fa servir aquesta mateixa idea, milions de vegades, per proposar la paraula següent. La no és màgia: és una recepta enorme de , difícil de explicar d’una sentada.

Així es dibuixa una xarxa: cercles (neurones) i línies (connexions). Les del mig descobreixen formes que una sola ratlla no veu.

  1. 01. Una neurona biològica rep estímuls, els suma i s’activa si superen un llindar. Practicar enforteix la connexió.
  2. 02. El perceptró copia aquest gest amb nombres: cada factor compta més o menys, hi ha un llindar, i la resposta és sí o no.
  3. 03. Diverses neurones en capes s’ajuden. Si l’entrada és una foto, els píxels són la primera capa; les del mig busquen peces (un ull, una boca); l’última aposta un percentatge.
  4. 04. Un model de llenguatge aplica aquesta idea al text i proposa la paraula següent. Que el text soni bé no vol dir que sigui cert.
  5. 05. Aquesta recepta només existeix si un xip la calcula, una vegada i una altra, amb electricitat i amb fred.
Perceptró
3

paràmetres

MLP XOR
13

paràmetres

LLM
10⁹+

paràmetres

Suport
10²⁵

FLOP

Una mica d’història, per situar-nos

  1. 1888CajalDibuixa la neurona com a cèl·lula independent. El cervell deixa de ser una malla contínua.
  2. 1897SherringtonPosa nom a la sinapsi: el salt on una neurona influeix la següent.
  3. 1943McCulloch i PittsLa neurona, per primer cop, en uns i zeros. Encara no aprèn.
  4. 1949HebbLes cèl·lules que disparen juntes reforcen la connexió. Practicar és això.
  5. 1958PerceptróRosenblatt afegeix l’aprenentatge. Una neurona, una recta, exemples.
  6. 1986RetropropagacióJa es poden entrenar moltes capes alhora. Neix la xarxa profunda.
  7. 2017TransformerL’atenció deixa que cada paraula miri les altres. Base dels LLM.
  8. avuiFàbricaLa mateixa recepta, ara en naus de xips, amb corrent i fred.