Kwestia tego, w jaki sposób agent AI podejmuje kolejne decyzje, dotyczy samego rdzenia jego architektury. U fundamentu leży tak zwana pętla odbieranie–układanie planu–wykonywanie, w której program najpierw odbiera informacje z otoczenia, następnie analizuje dostępne możliwości, a wreszcie realizuje wybraną akcję. Cały ten obieg powtarza się wielokrotnie, aż do uzyskania zamierzonego efektu.
Sercem tego procesu jest model językowy, który odgrywa rolę wewnętrznego głosu doradczego agenta. To on interpretuje instrukcje użytkownika, rozbija złożone zadanie na mniejsze podzadania i sugeruje kolejność ich wykonania. Otoczenie modelu stanowią pomocnicze narzędzia – wyszukiwarki, kalkulatory, interfejsy API – które agent wywołuje wtedy, gdy wymaga konkretnych danych spoza swojej wiedzy treningowej.
Interesującym elementem architektury jest tak zwana pamięć robocza, w której agent przechowuje kontekst bieżącego zadania. Dzięki niej nie traci nici nawet wtedy, gdy procedura rozkłada się na kilka etapów i potrzebuje przeskakiwania między różnymi źródłami informacji. To właśnie ta zdolność odróżnia agenta od prostego skryptu, który wykonuje jedynie z góry zapisaną listę poleceń.
Osobną sprawą pozostaje mechanizm ewaluacji własnych działań. Odpowiednio skonstruowany agent jest w stanie rozpoznać, że otrzymany wynik odbiega od zamierzonego, i cofnąć się do wcześniejszego etapu, by spróbować alternatywnej ścieżki. Taka autokorekta przybliża działanie maszyny do ludzkiego zwyczaju sprawdzania własnej pracy przed jej oddaniem.