Un laboratori per entendre les capes
Capa a Capa
Del cervell a un model de llenguatge
Es diu Capa a Capa perquè una xarxa no és un sol truc. És la mateixa idea, repetida. Cada capa existeix perquè l’anterior es queda curta, i per entendre-ho no cal començar per ChatGPT: cal començar per una cèl·lula.
Si és la primera vegada que obres això, no cal saber programar ni haver sentit parlar de xarxes neuronals. Començarem pel principi de veritat: una cèl·lula del cervell. Cajal la va veure al microscopi. Sherrington va posar nom al salt entre cèl·lules. McCulloch i Pitts la van escriure amb uns i zeros. I fa unes dècades vam copiar aquest gest en una màquina. La busca que les màquines aprenguin i decideixin. El matís important: no raonen com nosaltres. Calculen probabilitats a partir d’exemples.
Què entenem aquí per intel·ligència artificial
És una part de la informàtica que construeix sistemes capaços de percebre l’entorn i d’actuar d’una manera que ens sembla intel·ligent: aprendre, decidir, respondre. La idea de fons és una màquina que millori amb l’experiència. El matís que ens interessa: quan diem que «raona», a la pràctica està ajustant a molts exemples, no seguint una lògica humana pas a pas.
Barreja programari, maquinari i percepció de l’entorn. Per això de vegades sembla que pensa, i per això també s’equivoca d’una manera estranya.
Què no és, per no perdre’ns
- No és una ment i no té intencions. No «vol» ajudar-te. Prediu quina peça de text és més probable a continuació, a partir de molts exemples.
- Que el text soni bé no vol dir que sigui cert. L’eloqüència no és correcció. Un model pot escriure una data falsa amb la mateixa fluïdesa que una de verdadera.
- No és màgia. És programari, electricitat i silici. Amplifica el teu criteri si tu el tens; no el substitueix si no el tens.
Què sí que és, dit a poc a poc
- Un model matemàtic enorme: milions o milers de milions de nombres (els paràmetres) ajustats per reconèixer patrons en text, imatges o so.
- Una màquina que, donat un tros de frase, aposta quina peça ve a continuació. Un paràgraf es construeix repetint aquesta aposta, una vegada i una altra.
- Un amplificador de capacitats. Si saps el que busques, et fa més ràpid. Si no, pot donar-te una falsa sensació que «ja ho fa tot sol».
Tres distincions per no perdre’s
Abans d’entrar a les capes, tres idees que tornen a tot arreu. Les hem pres del taller de fonaments d’IA per a gent curiosa, i les expliquem aquí perquè es puguin tocar.
Primera
Una calculadora sempre diu el mateix
Un programa clàssic és determinista: mateixa entrada, mateixa sortida. 2 + 3 són 5, les vegades que vulguis. Pots escriure un test i passar-lo.
2 + 3 = 5
L’has premut 0 vegades. El resultat no ha canviat mai.
Segona
Un model de llenguatge sorteja
La mateixa frase pot continuar de dues maneres. El model no té una sola resposta: té percentatges, i després . Puja la i el sorteig es fa més agosarat. Això és un sistema .
Els arbres són…
- verds77%
- alts15%
- vells6%
- salats2%
Prem el botó unes quantes vegades. Amb temperatura baixa, gairebé sempre surt la mateixa. Amb temperatura alta, es colen paraules rares.
Tercera, part A
Programar és escriure la regla
«Si hi ha diners I ganes, anem de viatge.» Tu penses la lògica. L’ordinador només l’executa. Si et deixes un cas, falla.
Tercera, part B
Aprendre és donar exemples
No escrius l’«si». Dónes casos de «això sí / això no» i la xarxa mou els pesos. Per això un perceptró pot decidir un viatge sense que tu li hagis escrit totes les combinacions.
Provar-ho al perceptróQuatre persones, abans de la màquina
Abans del perceptró hi ha una història que val la pena explicar amb calma. Sense ella, la «neurona artificial» sembla un invent caigut del cel.
1888–1906
Cajal
El cervell està fet de cèl·lules separades, no d’una malla contínua.
1897
Sherrington
El salt entre dues neurones es diu sinapsi. Allà viu l’aprenentatge.
1943
McCulloch i Pitts
La neurona, escrita amb uns i zeros. Encara no aprèn: la regla és fixa.
1949
Hebb
Si dues cèl·lules disparen juntes, la connexió es fa més forta.
La recepta, en sis passos
El model no veu paraules. Veu nombres. Després sorteja. Després enganxa i torna a començar.
01
Text
02
Fitxes
03
Nombres
04
Percentatges
05
Sorteig
06
Enganxar i repetir
Resums per emportar-te
Un full per capítol, per guardar o imprimir. Què és, quan sorgeix, per què cal, i la frase per recordar.
- 01 La neurona
- 02 El perceptró
- 03 Xarxa neuronal
- 04 Model de llenguatge
- 05 El suport
- 06 El taller
- 07 On solíem ensopegar
Publicat sota CC BY 4.0. Contingut editorial → CC BY 4.0 (Atribució). Pots copiar, adaptar i reutilitzar aquest material, fins i tot amb finalitats comercials, sempre que citis l’origen: Capa a Capa, de David Bernal López.
Preguntes que tornen
- La intel·ligència artificial pensa com una persona?
- No. No té una ment ni un pla amagat. A cada pas prediu la peça de text següent, l’enganxa, i torna a començar. Un paràgraf sembla pensat perquè aquesta loteria, repetida, sona fluent.
- Per què de vegades inventa dades amb tanta seguretat?
- Perquè ha après a escriure de manera fluent, no a distingir el que és cert. El percentatge que assigna a una paraula és una aposta, no una garantia. Per això pot al·lucinar: text plausible que no és veritat.
- On viu, de debò, un model?
- En nombres, desats a la memòria d’un xip. Sense silici i sense corrent el model no «continua pensant» en cap núvol abstracte: s’apaga, com un llum.
- Per què parlem de tantes capes?
- Perquè cadascuna existeix quan l’anterior es queda curta. Una sola neurona no basta. Una sola ratlla no separa el que cal. Un píxel no veu una cara. I una sola paraula no fa un paràgraf.
Què és cada peça, quan apareix i per què cal
Primer la cèl·lula del cervell i qui la va veure. Després tres còpies cada vegada més capaces, perquè l’anterior es queda curta. Al final, el lloc físic on es calculen els nombres.
01
Neurona
Una cèl·lula que rep estímuls, els suma i s’activa —o es queda en silenci. Cajal la va veure; la màquina la copia.
- Què és
- La unitat del cervell. Rep estímuls elèctrics per les dendrites, els suma al cos i, si passen un llindar, dispara per l’axó. No pensa: o s’activa, o no. Cajal va demostrar que són cèl·lules separades; Sherrington va anomenar el salt entre elles.
- Quan sorgeix
- El cervell, de sempre. Cajal dibuixa la neurona com a peça (1888). Sherrington anomena la sinapsi (1897). McCulloch i Pitts n’escriuen la primera fórmula (1943). Hebb explica el reforç (1949). El 1958 Rosenblatt copia el gest en una màquina.
- Per què sorgeix
- Veure, parlar o fer malabars: les neurones que cooperen tornen a disparar-se juntes, i la connexió es fa més forta. Sense aquest reforç no hi ha aprenentatge, ni biològic ni artificial. Per això comencem aquí, i no per ChatGPT.
02
Perceptró
Una màquina que diu sí o no.
- Què és
- La còpia numèrica d’una neurona. Cada factor (diners, ganes, clima) entra com 0 o 1, es multiplica per un pes —quant compta— i si la suma passa el llindar, el viatge es fa.
- Quan sorgeix
- El 1958, Frank Rosenblatt. Agafa la fórmula de McCulloch i Pitts —que encara no aprenia— i hi afegeix l’aprenentatge amb exemples: la màquina ajusta sola quant compta cada entrada.
- Per què sorgeix
- Ajustar a mà els pesos d’una xarxa gran és una consola infinita de pomells. El perceptró aprèn. El límit: només si els sí i els no es tallen amb una ratlla.
03
Xarxa neuronal
Diverses neurones en equip.
- Què és
- Una funció: entrades, una capa oculta que processa, una sortida. No programes l’interior. Dónes exemples i l’aprenentatge ajusta els pesos. XOR és la joguina; el color del text, el cas de veritat.
- Quan sorgeix
- Anys 80. Descobreixen com ensenyar a moltes capes alhora: l’error es reparteix cap enrere, neurona a neurona (retropropagació). S’acaba l’ajust a mà.
- Per què sorgeix
- Hi ha problemes fàcils per a tu i difícils d’escriure com if. Blanc o negre sobre un fons. Gos o plàtan. XOR. Una ratlla no basta: cal un equip, i exemples.
04
LLM
Una xarxa enorme que endevina la paraula següent.
- Què és
- No pensa un paràgraf. Parteix el text en fitxes, les passa a nombres, mira quines paraules importen ara i aposta la següent. L’enganxa i torna a començar. Estadística, no lògica.
- Quan sorgeix
- 2017, el transformer. 2018, GPT. Des d’aleshores no hi ha màgia nova: més dades, més capes, més context.
- Per què sorgeix
- Les xarxes anteriors llegien en fila i oblidaven el principi. L’atenció deixa que cada paraula miri les altres alhora. Per això pot completar «Els arbres són…» sense perdre el subjecte.
05
Els nombres necessiten un lloc
Les idees dels capítols anteriors no pesen: són receptes. Perquè un perceptró existeixi de veritat cal silici, corrent i un edifici que no s’escalfi.
- Què és
- El suport físic d’una xarxa: nombres desats a la memòria, moguts per transistors en un xip. Un GPU és un estadi de sumadors. Un datacenter és la fàbrica que els alimenta, els refreda i els connecta.
- Quan sorgeix
- 1947, el transistor. Després el xip, el GPU (2000s) i, amb els LLM, naus senceres de GPUs. L’idea de 1958 no va canviar: va canviar quantes vegades es pot repetir per segon.
- Per què sorgeix
- Un perceptró són 12 bytes. Un model gran no cap en un portàtil, triga anys a entrenar-s’hi, i s’escalfa. El datacenter existeix per temps, memòria i calor — no per màgia.
Els capítols, per entrar-hi quan vulguis
- 01
Neurona
Una cèl·lula que rep estímuls, els suma i s’activa —o es queda en silenci. Cajal la va veure; la màquina la copia.
Entrar en aquest capítol - 02
Perceptró
Una màquina que diu sí o no.
Entrar en aquest capítol - 03
Xarxa neuronal
Diverses neurones en equip.
Entrar en aquest capítol - 04
LLM
Una xarxa enorme que endevina la paraula següent.
Entrar en aquest capítol - 05
Suport
La recepta, en silici.
Entrar en aquest capítol
És la mateixa idea, a una altra escala
El cervell no inventa un òrgan nou per a cada ofici: reforça les , és a dir, les connexions. La màquina fa una cosa semblant. Una s’activa o no. El perceptró copia aquest gest amb nombres. Diverses neurones juntes poden resoldre coses que una sola no pot. Un model de llenguatge fa servir aquesta mateixa idea, milions de vegades, per proposar la paraula següent. La no és màgia: és una recepta enorme de , difícil de explicar d’una sentada.
Així es dibuixa una xarxa: cercles (neurones) i línies (connexions). Les del mig descobreixen formes que una sola ratlla no veu.
- 01. Una neurona biològica rep estímuls, els suma i s’activa si superen un llindar. Practicar enforteix la connexió.
- 02. El perceptró copia aquest gest amb nombres: cada factor compta més o menys, hi ha un llindar, i la resposta és sí o no.
- 03. Diverses neurones en capes s’ajuden. Si l’entrada és una foto, els píxels són la primera capa; les del mig busquen peces (un ull, una boca); l’última aposta un percentatge.
- 04. Un model de llenguatge aplica aquesta idea al text i proposa la paraula següent. Que el text soni bé no vol dir que sigui cert.
- 05. Aquesta recepta només existeix si un xip la calcula, una vegada i una altra, amb electricitat i amb fred.
- Perceptró
- 3
- MLP XOR
- 13
- LLM
- 10⁹+
- Suport
- 10²⁵
paràmetres
paràmetres
paràmetres
FLOP
Una mica d’història, per situar-nos
- 1888CajalDibuixa la neurona com a cèl·lula independent. El cervell deixa de ser una malla contínua.
- 1897SherringtonPosa nom a la sinapsi: el salt on una neurona influeix la següent.
- 1943McCulloch i PittsLa neurona, per primer cop, en uns i zeros. Encara no aprèn.
- 1949HebbLes cèl·lules que disparen juntes reforcen la connexió. Practicar és això.
- 1958PerceptróRosenblatt afegeix l’aprenentatge. Una neurona, una recta, exemples.
- 1986RetropropagacióJa es poden entrenar moltes capes alhora. Neix la xarxa profunda.
- 2017TransformerL’atenció deixa que cada paraula miri les altres. Base dels LLM.
- avuiFàbricaLa mateixa recepta, ara en naus de xips, amb corrent i fred.