Słowniczek · AI

Recurrent depth (zapętlone transformery)

Recurrent depth, nazywany też zapętlonymi transformerami (looped transformers), to sposób budowania modelu językowego, w którym te same bloki sieci są używane wielokrotnie dla jednej odpowiedzi. Zwykły transformer przepuszcza dane przez kolejne, osobne warstwy — każda ma własne wagi. Model z rekurencyjną głębokością przepuszcza je przez ten sam zestaw bloków kilka razy z rzędu.

Po co się to robi

Efektem jest większa głębokość obliczeń przy mniejszej liczbie parametrów do przechowania. Model o dwudziestu dwóch blokach użytych dwukrotnie daje czterdzieści cztery przejścia, ale waży tyle, co dwadzieścia dwa. Spada koszt trenowania i uruchamiania, a jakość odpowiedzi zostaje. Pamięć podręczna na klucze i wartości nie oszczędza nic — każde przejście potrzebuje własnej.

Dlaczego to budzi spory

Dotąd modele rozumujące „myślały na głos": rozpisywały kolejne kroki w języku naturalnym, a ten zapis dało się przeczytać i sprawdzić. Kiedy część rozumowania przenosi się do wewnętrznych pętli obliczeniowych, przestaje być wyrażona słowami. Badacze bezpieczeństwa nazywają to problemem monitorowalności: trudniej ustalić, dlaczego model podjął taką, a nie inną decyzję.

Co to znaczy w praktyce

  • Model o krótszym śladzie rozumowania nie musi być mniej rzetelny — bywa po prostu sprawniejszy.
  • Kontrola przesuwa się z uzasadnienia na wynik: sprawdzasz, czy odpowiedź zgadza się z niezależnym źródłem.
  • Sama architektura i tok myślenia to dwa różne poziomy — zapętlenie nie jest tożsame z ukrywaniem rozumowania.

Pojęcie weszło do szerszego obiegu we wrześniu 2026 roku, przy premierze modelu GPT-6 Astra. Zobacz też: LLM i okno kontekstowe.

Pytania i odpowiedzi

Najczęściej zadawane pytania

Zwykły transformer ma osobne warstwy, każda z własnymi wagami, i dane przechodzą przez nie raz. Model z rekurencyjną głębokością przepuszcza dane kilka razy przez ten sam zestaw bloków. Efekt obliczeniowy jest podobny do głębszej sieci, ale wag do przechowania jest mniej, więc model taniej się trenuje i uruchamia.

Nie bezpośrednio. Zapętlenie to mechanizm obliczeniowy, a tok myślenia to osobna warstwa — widoczne kroki rozpisane w języku naturalnym. Sporne jest to, że modele korzystające z tej techniki wypisują krótsze i mniej szczegółowe uzasadnienia, przez co trudniej sprawdzić, jak doszły do wyniku. Część badaczy bezpieczeństwa uznaje ten kierunek za ryzykowny.

Technika trafiła do szerokiej świadomości przy premierze GPT-6 Astra we wrześniu 2026 roku, choć badania nad zapętlonymi transformerami prowadzono wcześniej na mniejszych modelach otwartych. OpenAI nie potwierdziło szczegółów architektury, a karta systemowa modelu odnotowuje regres w czytelności śladu rozumowania względem poprzednika.

Powiązane artykuły