Modele rekurencyjne przetwarzają tokeny jeden po drugim — dalekie zależności bledną i nic się nie zrównolegla. Kluczowa idea: sama atencja, bez rekurencji — każdy token patrzy na każdy inny w jednym kroku, a cała sekwencja trenuje się równolegle. Architektura, na której zbudowano niemal każdy późniejszy duży model językowy.
Treść i typografia
Klocki, z których składa się proza. Każdy z nich konsumuje wyłącznie semantyczną warstwę tokenów — przemaluj paletę, a wszystkie pójdą w ślad.
§1.1Callout
Pięć wariantów; title zastępuje domyślną etykietę wariantu (Note / Intuition / Warning / Important / Abstract — te same domyślne, których używa składnia cytatu, lokalizowane przez labels). Strona Wszystko naraz pokazuje te same znaczniki w pisowni cytatu i surowego HTML-a.
§1.2Chip
Odznaki w linii, do statusów i kategorii, w czterech wariantach wspólnych dla tagów PaperCard i chipów HubCard: stabilny beta badawczy nowy — albo z własnym odcieniem dla palet tematycznych: własny odcień
§1.3Grid
Jedna siatka, trzy skóry (plain, card, cmp). Karty:
Najpierw tokeny. Kolejność importów jest częścią kontraktu: tokeny, potem warstwa treści, potem chrome witryny.
Tylko warstwa semantyczna. Komponenty nigdy nie dotykają surowych kolorów — przemaluj paletę, a wszystkie pójdą w ślad.
I skóra porównawcza, stworzona do paneli „przed / po”:
Bez strażnika — niedomknięte ** wypływa na produkcję jako dwie dosłowne gwiazdki.
Ze strażnikiem — build pada z plikiem:linią:kolumną i daszkiem pod znakiem.
§1.4Steps
Lista markdownowa na pionowej szynie:
- Dodaj oba submoduły i zależności
file:. - Zaimportuj
tokens.css,base.cssoraz (dla wiki)browse.cssw globalnym arkuszu stylów. - Wepnij
siteMarkdown()wastro.config. - Nadpisz paletę pierwszej warstwy pigmentami swojej tożsamości.
§1.5Stats
- warstwy tokenów
- 2
- komponenty
- 24
- szerokości sondy
- 4
- kroków budowania
- 0
§1.6PaperCard
Koń roboczy przeglądów literatury — alias, pełny tytuł, tagi z miejscem publikacji, metadane autorów, linki i dwa dedykowane sloty:
Pod nagłówkiem sekcji pogłębionej jednolinijkowy przekład na ludzki język (.speak) mówi czytelnikowi, co moduł robi, zanim przyjdzie mechanizm:
Atencja to miękka tablica wyszukiwania: każdy token pyta „kto jest dla mnie istotny?” i dostaje ważoną mieszankę odpowiedzi.
§1.7References
- Vaswani i in., Attention Is All You Need, NeurIPS 2017.
- Knuth, The TeXbook — powód, dla którego podłoża matematyki dostają własny odcień papieru.
- W3C, Web Content Accessibility Guidelines 2.2 — poprzeczka kontrastu AA, pod którą audytowane są tokeny.