aalto1 untyped-item.component.html

Automating Red Teaming with deep reinforcement learning

Loading...
Thumbnail Image

URL

Journal Title

Journal ISSN

Volume Title

Perustieteiden korkeakoulu | Master's thesis
Electronic archive copy is available via Aalto Thesis Database.

Department

Major/Subject

Mcode

SCI3042

Language

en

Pages

77+1

Series

Abstract

Defending networks against automated intelligent attacks requires advanced defensive solutions. Employing learning-based defensive solutions can be needed for combating the most advanced threats. Lack of varied training data is a significant challenge that prevents companies from deploying learning-based defenses. Gathering enough attack data is expensive and often infeasible. An intelligent red teaming agent that can perform realistic attacks on networks can alleviate the problem. However, there is little scientific evidence of the feasibility of fully automated attacks with machine learning. In this work, we demonstrate that automating some red teaming activities with machine learning is plausible. We model a common red teaming task, local privilege escalation, as a partially observable Markov decision process (POMDP) and solve the problem using deep reinforcement learning (deep RL). We devise an agent state and an action space that makes achieving the desired result feasible. Our agent employs a state-of-the-art model-free reinforcement learning algorithm, A2C. Training the deep RL agent requires thousands of episodes and performing the necessary actions in a full-featured operating system can be prohibitively slow. We tackle this issue by training the agent on a simulator of Windows 7. The trained agent is transferable to a real OS without any adjustments. The trained RL agent can escalate privileges in the Windows 7 OS using a wide variety of different privilege escalation techniques in the presence of realistic misconfigurations. Collecting sensor data of the attacks is possible. However, the simulated environment and our problem formalization imply that the agent can only learn what is implemented in the simulator and supported by the state and action spaces.

Edistyneitä puolustusjärjestelmiä vaaditaan puolustamaan tietokoneverkkoja automatisoiduilta älykkäiltä hyökkäyksiltä. Kaikkein edistyneimpiä uhkia vastaan saatetaan tarvita koneoppimista hyödyntäviä puolustusratkaisuja. Monipuolisen opetusdatan puute on merkittävä haaste, joka estää oppimiseen perustuvien puolustusratkaisujen käyttöönoton. Tarvittavan datan kerääminen hyökkäyksistä on kallista ja usein mahdotonta. Älykäs red team -agentti, joka pystyy suorittamaan realistisia hyökkäyksiä tietokoneverkkoja vastaan, voi helpottaa ongelmaa. Tieteellinen näyttö täysin automatisoiduista hyökkäyksistä kuitenkin puuttuu. Tässä työssä näytämme, että joidenkin red team -toimintojen automatisointi koneoppimisen avulla on mahdollista. Mallinnamme yleistä red team -tehtävää, käyttöoikeuksien laajentamista, osittain havaittavalla Markov-päätösprosessilla (POMDP), minkä ratkaisemme syvävahvistusoppimisella. Suunnittelemme agentin tilan ja toiminnot siten, että se kykenee hallitsemaan tehtävän. Hyödynnämme viimeisintä tekniikkaa edustavaa mallivapaan vahvistusoppimisen algoritmia, A2C:tä. Agenttimme vaatii tuhansia jaksoja oppiakseen, ja tarvittavien toimintojen suorittaminen todellisessa käyttöjärjestelmässä voi olla hidasta. Ratkaisemme tämän ongelman kouluttamalla agentin kehittämässämme Windows 7 -simulaattorissa. Koulutettu agentti osaa toimia myös todellisessa käyttöjärjestelmässä muutoksitta. Näytämme, että koulutettu syvävahvistusoppimisagenttimme kykenee laajentamaan käyttöoikeuksiaan järjestelmänvalvojaksi Windows~7:ssä hyödyntäen monia yleisiä tietoturvaa vaarantavia virheitä konfiguraatioissa. Näistä hyökkäyksistä pystytään keräämään dataa. Simuloitu ympäristö ja ongelman mallinnuksemme kuitenkin rajoittavat agentin oppimiskykyä. Agentti voi oppia vain sen, mitä simulaattorimme ja agentin tila sekä toiminnot tukevat.

Description

Supervisor

Ilin, Alexander

Thesis advisor

Karpuk, David

Other note

Citation

Endorsement

Review

Supplemented By

Referenced By