Capítol 04 · decoder-only

Model de llenguatge

Una xarxa enorme que endevina la paraula següent.

Un model de llenguatge no és una xarxa d’un altre planeta: són moltes capes d’un tipus especial, apilades. Parteix el text en trossos, els converteix en nombres, mira quines paraules importen ara i proposa la següent. No raona com una persona: calcula què hi encaixa. I després ho torna a fer.

Què és
No pensa un paràgraf. Parteix el text en fitxes, les passa a nombres, mira quines paraules importen ara i aposta la següent. L’enganxa i torna a començar. Estadística, no lògica.
Quan sorgeix
2017, el transformer. 2018, GPT. Des d’aleshores no hi ha màgia nova: més dades, més capes, més context.
Per què sorgeix
Les xarxes anteriors llegien en fila i oblidaven el principi. L’atenció deixa que cada paraula miri les altres alhora. Per això pot completar «Els arbres són…» sense perdre el subjecte.

Guia, pas a pas 1 / 4

El model no llegeix: fitxes

«stem» es parteix en . No són lletres: són peces d’un vocabulari. A partir d’aquí, tot són nombres.

Completar la frase

Un LLM puntua cada fitxa candidata i passa les puntuacions per un . Aquí hi ha tres pesos que pots tocar: gramàtica, sentit i hàbit. Veus el càlcul. No veus una raó humana de per què mil milions de nombres preferirien una paraula: això és la .

Després de «són» hi encaixa un adjectiu. «De» és molt freqüent, però aquí queda coix.

  • alts31%
  • verds32%
  • vius19%
  • de8%
  • gats3%
  • ràpids8%

z = w_g·gramàtica + w_s·sentit + w_h·hàbit. Després softmax(z / T). T és la .

La recepta, en sis passos

El model no veu paraules. Veu nombres. Després sorteja. Després enganxa i torna a començar.

  1. 01

    Text

  2. 02

    Fitxes

  3. 03

    Nombres

  4. 04

    Percentatges

  5. 05

    Sorteig

  6. 06

    Enganxar i repetir

Una pregunta per assegurar

A cada pas, què decideix un LLM?

Tria una opció. No es guarda res; és només per pensar.

Una idea que sovint confon

«Atenció és que el model es concentra, com una persona.»

És una mitjana ponderada entre vectors. Una paraula pot mirar-ne una altra al 40 % i un article al 5 %. No hi ha un focus de consciència: hi ha una matriu.

Si t’endús una sola idea

Un LLM no pensa el paràgraf. Prediu la fitxa següent, l’enganxa, i torna a llegir-ho tot. La intel·ligència aparent és aquesta loteria, repetida, a escala enorme.

Per què no n’hi ha prou amb una xarxa més grossa

Una xarxa densa barreja tot amb uns fixos. Un model de llenguatge, a cada frase, decideix qui val la pena mirar. Això és . Toca una paraula: les barres diuen a qui presta atenció.

«menja» mira sobretot…

  • El4%
  • gat35%
  • de5%
  • la5%
  • Maria35%
  • menja16%

Quan escriu, el futur encara no existeix. Per això «menja» pot mirar «gat», però «gat» no pot mirar «menja». Una xarxa clàssica no té aquest joc: no pregunta, només multiplica.

Al·lucinar és el mateix sorteig

El model no té un calaix de veritats. Té percentatges de text. De vegades la paraula més probable és falsa, perquè al text es veu més. Això és una : no menteix, sorteja.

La capital d’Austràlia és…

  • Sydney47%
  • Canberra29%
  • Melbourne16%
  • Perth8%

Prem el botó. La més votada no és la correcta.

El model no et recorda: veu una finestra

Un xat no té memòria teva. Té una : les últimes peces que hi càpiguen. El que queda a l’esquerra, per al model, ja no existeix. Encara que tu te’n recordis.

Holaem dic Annatinc un gates diu Ninaés vellaavui no menjaestic preocupadaquè li donoaiguai aracom es deia?

Ara mateix només veu 6 peces. En un model real aquesta finestra pot ser de milers o de centenars de milers. Però el principi és el mateix: si no cap, no hi és.

Entrenar i fer servir no són el mateix

Sovint es barregen. Entrenar és construir la recepta: moure amb molts exemples, car i lent. és cuinar un plat: llegir els pesos que ja hi són i respondre la teva pregunta. El xat que obres tu és inferència, no entrenament.

EntrenarFer servir (inferència)
Què faMira exemples, calcula l’error i reescriu els pesos.Llegeix uns pesos ja fixats i prediu la peça següent.
Quan passaAbans, a un laboratori o un datacenter. Setmanes, de vegades.Ara, quan tu escrius una frase. Segons.
Es mouen els pesos?Sí. Això és l’aprenentatge.No. Els pesos estan congelats.
Què costaMoltes GPU, molta calor, molts diners. Una vegada (o de tant en tant).Una mica d’electricitat per cada pregunta. Es pot fer en un portàtil si el model és petit.

Si un xat «s’equivoca», no està aprenent de tu en aquell moment. Està sortejant amb uns pesos que algú altre va moure fa mesos.

Seguir al capítol següentSuport