RF 강화학습: 모델을 비교하기 전에 맞춘 조건
행동 예산, 시나리오, 도달 가능성을 구분해 RF 제어 정책의 비교 기준을 구현한 경험.
2026 · 시뮬레이션 연구 · 문제 정의·설계·구현·검증 담당
Python · Gymnasium · Stable-Baselines3 · MLflow
RF 매칭은 회로의 조절 요소를 움직여 반사 전력을 줄이는 제어 문제입니다. 이 연구에서는 합성 회로 환경을 구성하고 DQN·PPO·SAC를 비학습 기준선과 비교했습니다. 목표 상태에 처음 도달하는 획득과, 부하가 달라질 때 그 상태를 유지하는 추적을 별도 과제로 다뤘습니다.
제가 먼저 정한 것은 비교의 조건이었습니다. 정책의 성공률 차이가 학습 능력에서 왔는지, 더 유리한 행동 조건에서 왔는지 해석할 수 있어야 했습니다.
같은 한 번의 행동이 같은 기회를 뜻하는가
이산 정책과 연속 정책은 움직임을 표현하는 방식이 다릅니다. 한쪽이 한 번에 한 축만 움직이고 다른 쪽이 두 축을 움직일 수 있다면, 같은 제어 주기 수를 주어도 실제 이동 기회가 달라집니다.
따라서 한 주기 동안 허용하는 총이동량을 동일하게 제한했습니다. 행동 표현은 달라도 허용된 움직임의 예산은 맞추고 결과를 비교하도록 구성했습니다. 단순히 각 알고리즘의 기본 설정을 그대로 실행한 순위보다, 차이를 설명할 수 있는 비교를 만들기 위한 선택이었습니다.
도달할 수 없는 목표와 정책의 실패를 구분
회로와 행동의 제약 때문에 목표 상태에 도달할 수 없는 시나리오도 있습니다. 이를 모두 정책 실패로 집계하면 어려운 조건을 얼마나 포함했는지에 따라 성공률이 달라집니다.
평가에서 도달 가능 여부를 별도로 표시하고 도달 가능한 시나리오의 성공률을 함께 집계했습니다. 정책 자체를 개선해야 하는지, 문제의 목표나 허용 행동을 재검토해야 하는지 나눠 볼 수 있게 했습니다.
학습 점수와 정책 선택 사이에 둔 검증
| 판단할 내용 | 구성한 평가 조건 |
|---|---|
| 어떤 방법과 비교할 것인가 | DQN·PPO·SAC와 무제어·무작위·센서 기반 탐색 기준선 |
| 같은 문제를 풀었는가 | 동일 시나리오 집합과 행동 예산, 시나리오 식별값 기록 |
| 학습에 익숙한 조건만 평가했는가 | 학습·검증·평가 난수 초기값 분리 |
| 제어 품질만 좋아진 것은 아닌가 | 반사율·중단 조건·구동량·추론 지연을 함께 기록 |
| 환경이 달라져도 유효한가 | 센서·구동기 지연, 변하는 부하, 학습 범위 밖 부하를 구분 |
실험 설정과 시나리오, 정책, 실행 기록을 연결했습니다. 실제 센서로 얻을 수 없는 정보를 사용하는 기준선은 진단용으로 구분해, 적용 가능한 제어기와 같은 의미의 성과로 읽히지 않게 했습니다.
구현한 범위와 다음 판단
저는 문제 정의부터 설계 판단, 구현과 검증을 담당했으며 AI 도구를 활용했습니다. 이 경험의 결과는 정책이 유효한 조건을 비교하고 해석할 평가 구조입니다. 실제 장비 적용 전의 시뮬레이션 연구이므로 여기서 얻은 성공률을 설비의 안전성이나 생산 성과로 확대하지 않습니다.
다음 모델을 추가하더라도 같은 과제·행동 예산·시나리오에서 비교하고, 복잡도와 실행 비용을 늘릴 만큼 효과가 있는지를 판단하는 기준으로 이 구조를 사용합니다.