Učenje modela akcija
Učenje modela akcija (engl. action model learning), ponekad skraćeno učenje akcija, područje je strojnog učenja koje se bavi stvaranjem i izmjenom znanja softverskog agenta o učincima i preduvjetima akcija koje se mogu izvesti u njegovoj okolini. To se znanje obično zapisuje jezikom za opis akcija utemeljenim na logici te služi kao ulazni podatak automatskim planerima.
Učenje modela akcija važno je kada se ciljevi mijenjaju. Nakon što je agent neko vrijeme djelovao, može se poslužiti prikupljenim znanjem o akcijama u domeni kako bi donosio bolje odluke. Po tome se učenje modela akcija razlikuje od podržanog učenja jer omogućuje zaključivanje o akcijama umjesto skupih pokušaja u stvarnom svijetu.[1] Riječ je o obliku induktivnog zaključivanja, u kojem novo znanje nastaje na temelju agentovih opažanja.
Uobičajen razlog za bavljenje učenjem modela akcija činjenica je da je ručno određivanje modela akcija za planere često težak i dugotrajan posao sklon pogreškama, osobito u složenim okolinama.
Modeli akcija
Neka je zadan skup za učenje koji se sastoji od primjera , pri čemu su i opažanja stanja svijeta u dvama uzastopnim vremenskim koracima i , a je primjerak akcije opažen u koraku . Cilj je učenja modela akcija općenito izgraditi model akcija , u kojem je opis dinamike domene zapisan nekim formalizmom za opis akcija, primjerice STRIPS-om, ADL-om ili PDDL-om, a funkcija vjerojatnosti definirana nad elementima od .[2]
Mnoge suvremene metode učenja akcija ipak pretpostavljaju determinizam i ne uče funkciju . Osim po toj pretpostavci, pojedine se metode razlikuju i po tome kako se nose s ostalim svojstvima domene, primjerice s djelomičnom opservabilnošću ili sa šumom u osjetilnim podacima.
Metode učenja akcija
Suvremeni pristupi
Novije metode učenja akcija primjenjuju različite pristupe i širok raspon alata iz raznih područja umjetne inteligencije i računalne logike. Kao primjer metode utemeljene na logici sudova može se navesti algoritam SLAF (engl. Simultaneous Learning and Filtering), koji iz agentovih opažanja tijekom vremena gradi dugu logičku formulu, a zatim je tumači s pomoću rješavača problema zadovoljivosti (engl. SAT solver).[1] Tehnika u kojoj se učenje također pretvara u problem zadovoljivosti, u ovom slučaju u težinski MAX-SAT, i u kojoj se rabe isti rješavači, ostvarena je u sustavu ARMS (engl. Action-Relation Modeling System).[3]
Dva međusobno slična i posve deklarativna pristupa učenju akcija utemeljena su na paradigmi logičkog programiranja answer set programming (ASP)[4] te na njezinu proširenju, reaktivnom ASP-u.[5] U jednom je radu primijenjen pristup induktivnoga logičkog programiranja odozdo prema gore.[6] Nekoliko rješenja nije izravno utemeljeno na logici, primjerice učenje modela akcija s pomoću algoritma perceptrona[7] ili višerazinsko pohlepno pretraživanje prostora mogućih modela akcija.[8] U starijem radu iz 1992. učenje modela akcija proučavano je kao proširenje podržanog učenja.[9]
Postoje i algoritmi koji rade uz drukčije pretpostavke. FAMA djeluje i kada dio opažanja nedostaje te daje općenit (engl. lifted) model planiranja; učenje modela akcija tretira kao problem planiranja, pazeći da naučeni model odgovara zadanim opažanjima.[10] NOLAM može naučiti općenite modele akcija i iz zašumljenih ili nepotpunih podataka.[11] LOCM se oslanja isključivo na redoslijed akcija u podacima i zanemaruje pojedinosti o stanjima između njih.[12] Obitelj metoda za sigurno učenje modela akcija (SAM, engl. safe action model) stvara modele koji jamče da će planovi izrađeni s pomoću njih doista biti provedivi u stvarnom svijetu.[13] Njezino proširenje N-SAM može učiti modele akcija s numeričkim uvjetima i učincima.[14]
Numerički modeli akcija poput N-SAM-a mogu se upotrijebiti i za poboljšanje uspješnosti podržanog učenja, i to algoritmom RAMP.[15]
Literatura
Većina se radova o učenju akcija objavljuje u časopisima i na konferencijama posvećenima umjetnoj inteligenciji općenito, primjerice u časopisima Journal of Artificial Intelligence Research (JAIR), Artificial Intelligence i Applied Artificial Intelligence (AAI) te na konferencijama udruge AAAI. Unatoč srodnosti tema, učenje modela akcija obično se ne obrađuje na konferencijama posvećenima planiranju, kao što je Međunarodna konferencija o automatskom planiranju i raspoređivanju (ICAPS).
Poveznice
- Umjetna inteligencija
- Inteligentni agenti
- Indukcija (logika)
- Logičko programiranje
- Predstavljanje znanja
- Rudarenje podataka
Izvori
- ↑ 1,0 1,1 • Nepoznat parametar:
issn
• Nepoznat parametar:doi-access
• Nepoznat parametar:arxiv
• Parametaraccess-datenije dopušten u klasijournal
• Parametardatenije dopušten u klasijournal
• Parametarurlnije dopušten u klasijournal
• Parametartypenije dopušten u klasijournal - ↑ • Nepoznat parametar:
doi-access
• Nepoznat parametar:issue
• Parametartypenije dopušten u klasijournal
• Parametardatenije dopušten u klasijournal - ↑ • Nepoznat parametar:
issue
• Nepoznat parametar:doi-access
• Parametardatenije dopušten u klasijournal
• Parametartypenije dopušten u klasijournal - ↑
• Nepoznat parametar:
chapter-url
• Parametarchapternije dopušten u klasibook
• Parametaraccess-datenije dopušten u klasibook - ↑
• Nepoznat parametar:
chapter-url
• Parametarchapternije dopušten u klasibook
• Parametaraccess-datenije dopušten u klasibook - ↑
• Parametar
chapternije dopušten u klasibook - ↑ • Nepoznat parametar:
hdl-access
• Nepoznat parametar:hdl
• Parametaraccess-datenije dopušten u klasijournal
• Parametardatenije dopušten u klasijournal
• Parametarurlnije dopušten u klasijournal
• Parametartypenije dopušten u klasijournal - ↑
• Nepoznat parametar:
chapter-url
• Parametarchapternije dopušten u klasibook
• Parametaraccess-datenije dopušten u klasibook
• Parametarurl-statusnije dopušten u klasibook
• Parametararchive-datenije dopušten u klasibook
• Parametararchive-urlnije dopušten u klasibook - ↑ • Nepoznat parametar:
doi-access
• Nepoznat parametar:issue
• Parametartypenije dopušten u klasijournal
• Parametardatenije dopušten u klasijournal - ↑ • Nepoznat parametar:
doi-access
• Parametartypenije dopušten u klasijournal
• Parametardatenije dopušten u klasijournal - ↑ • Nepoznat parametar:
doi-access
• Parametartypenije dopušten u klasijournal
• Parametardatenije dopušten u klasijournal - ↑ • Nepoznat parametar:
issue
• Parametartypenije dopušten u klasijournal
• Parametardatenije dopušten u klasijournal - ↑ Juba, Brendan; Le, Hai S.; Stern, Roni. 2021. Safe Learning of Lifted Action Models (PDF). Proceedings of the 18th International Conference on Principles of Knowledge Representation and Reasoning (KR 2021) (engleski). str. 379–389. DOI:10.24963/kr.2021/36 . Pristupljeno 21. kolovoza 2026.
- ↑ • Nepoznat parametar:
issue
• Nepoznat parametar:doi-access
• Parametardatenije dopušten u klasijournal
• Parametartypenije dopušten u klasijournal - ↑ Integrating Reinforcement Learning, Action Model Learning, and Numeric Planning for Tackling Complex Tasks. arXiv 0. 18. veljače 2025. Pristupljeno 2026-08-21.