졸업 프로젝트 리뷰
졸업 프로젝트 리뷰
개요
- 프로젝트명: Hybrid PTR-PPO 알고리즘을 활용한 클라우드 GPU 자원 할당 최적화
- 기간: 2025.09 ~ 2025.12
- 소개: Alibaba GPU 트레이스 데이터를 활용하여, 수요 예측(Forecasting)과 강화학습(RL)을 결합한 하이브리드 알고리즘 기반의 선제적 오토스케일링 아키텍처를 제안하고 구현
연구 목적
선제적 자원 할당 (현재뿐만이 아니라 미래까지도!): 기존의 사후 대응적인 오토스케일링의 한계를 극복하기 위해, 시계열 예측 모델(LSTM/GRU)의 미래 예측값을 강화학습 에이전트의 상태(State) 공간에 결합하여 선제적인(Proactive) 대응을 목표로 한다.
샘플 효율성 극대화 (데이터의 활용성을 높이자!): On-policy 알고리즘인 PPO의 데이터 비효율성 문제를 해결하기 위해, Trajectory 단위의 Replay Buffer(PTR)를 구축하여 과거 데이터의 재활용률을 높이고 학습 안정성을 개선한다.
사용 기술 및 아키텍처
Language: Python
Frameworks & Libraries: PyTorch (모델 설계 및 최적화), Pandas/NumPy (로그 데이터 전처리), OpenAI Gym (커스텀 RL 환경 구축) Algorithms: Hybrid RL (Forecasting + RL), PTR-PPO, LSTM
돌아보며
- 배운 점: PPO와 PTR이라는 알고리즘의 수학적 배경과 한계를 이해하고, 이를 실제 코드로 구현하며 알고리즘을 엔지니어링하는 경험을 하였다.
- 아쉬운 점: 알고리즘에 따라 오토스케일링이 작동하는 것은 사실이나 코드 상으로는 10개의 구간으로 이산화하여 잘라놓았다. 이로 인해 미세한 수요 변화에 유연하게 대응하는 데 한계가 있었다. 이는 추후에 연속적 행동 공간을 지원하는 알고리즘으로 발전시킨다면 더 좋은 퍼포먼스를 보일 수 있지 않을까 기대되는 점이다.
This post is licensed under CC BY 4.0 by the author.
