FlowDAgger — 잠재 공간에서의 인간 참여 로봇 정책 적응
초록
Microsoft Research의 FlowDAgger는 사전학습된 flow matching/diffusion 로봇 정책을 기반 가중치 수정 없이 실환경에 적응시키는 방법을 제안한다. 핵심 아이디어는 Action Inversion: 인간의 교정 행동을 역시간 적분으로 노이즈 공간에 매핑하고, 소형 잠재 정책이 해당 노이즈를 제안하도록 학습시킨다. 5~20회의 교정만으로 단일 소비자 GPU에서 적응이 완료되며, 파인튜닝 방식 대비 사전학습 능력 보존이 탁월하다. MetaWorld 12개 태스크 평균 +0.25, 실제 하드웨어 8개 태스크 전수 향상 달성.
논문 정보
- 제목: FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space
- arXiv: 2607.08877
- 프로젝트 페이지: microsoft.github.io/FlowDAgger
- 코드: github.com/microsoft/FlowDAgger
- 소속: Microsoft Research, University of Washington, ETH Zurich
저자
Michael Murray, Daphne Chen, Simran Bagaria, Dean Fortier, Tess Hellebrekers, Galen Mullins, Harshavardhan Gajarla, Oier Mees, Maya Cakmak, Andrey Kolobov
문제 정의 — 왜 사전학습 로봇 정책이 실패하는가
사전학습된 flow matching 및 diffusion 기반 로봇 정책(VLA 포함)은 다양한 조작 작업에서 강력한 성능을 보인다. 그러나 실제 현장 배포 시 두 가지 근본 문제가 발생한다:
- 분포 이동(Distribution Shift): 학습 데이터와 실환경의 차이—조명, 객체 위치, 표면 마찰 등—로 인해 기대 이외의 실패 모드가 빈번하다.
- 기존 해결책의 비실용성: 대규모 추가 데이터 수집은 시간·비용이 막대하고, 온라인 강화학습(RL)은 수렴이 어렵고 안전 위험을 수반한다.
DAgger(Dataset Aggregation) 계열 방법이 존재하지만, 기반 모델의 가중치를 직접 수정하면 사전학습된 일반 능력(pretrained capabilities)이 파괴된다. 이것이 FlowDAgger가 해결하려는 핵심 긴장이다.
핵심 아이디어 — Action Inversion과 노이즈 공간 조종
Flow Matching의 구조
Flow matching 정책은 순수 노이즈 w에서 시작하여 시간 적분을 통해 행동 a를 생성한다:
w (노이즈) --[기반 정책 ODE 적분]--> a (행동)
기반 정책 πgp는 관찰 s와 초기 노이즈 w를 입력받아 행동 a를 출력한다: a = πgp(s, w)
FlowDAgger의 핵심 통찰: Action Inversion
인간 감독자가 로봇의 행동에 불만족하여 교정 행동 a*를 제공할 때, FlowDAgger는 이렇게 묻는다:
"동결된 기반 정책이 이 행동 a를 생성하려면, 어떤 노이즈 w를 입력받았어야 했는가?"
이 역산 과정이 Action Inversion이다:
- 역시간 적분(Reverse-time integration): a*에서 출발하여 기반 정책의 ODE를 역방향으로 적분
- 로컬 정제(Local refinement): 수치 오차를 최소화하기 위한 후처리
결과로 얻어진 w는 "기반 정책 하에서 인간의 교정 행동 a를 생성할 노이즈"다.
소형 잠재 정책 πw
관찰 s
|
v
소형 잠재 정책 πw(s) --> 노이즈 벡터 w*
|
v
동결된 기반 정책 πgp(s, w*) --> 행동 a
- πw: 상태 s를 입력받아 노이즈 w를 출력하는 경량 네트워크
- πgp: 가중치 완전 동결. 절대 수정하지 않는다.
- 학습 신호: (s, w*) 쌍에 대한 회귀 손실
이 구조의 핵심은 기반 모델을 건드리지 않고 그 입력 공간(노이즈 공간)을 조종한다는 점이다.
전체 파이프라인
[1] 배포]
로봇이 기반 정책 πgp로 작업 수행
[2] 인간 감독]
감독자가 실패 감지 → 교정 행동 a* 입력
[3] Action Inversion]
a* → 역시간 적분 → w* (노이즈 복원)
[4] 학습]
πw가 (s, w*) 쌍으로 회귀 학습
[5] 적응된 배포]
πw(s) = w → πgp(s, w) = a
인간의 교정 5~20회만으로 수십 분 내 적응이 완료된다.
실험 1 — MetaWorld 시뮬레이션 (12개 태스크)
기반 정책: π0.5 (VLA, Physical Intelligence)
성공률 비교
| Task | Base | SFT | LoRA-DAgger | Residual-DAgger | DSRL | FlowDAgger |
|---|---|---|---|---|---|---|
| Assembly | 0.64 | 0.85 | 0.81 | 0.53 | 0.64 | 0.89 |
| Bin Picking | 0.56 | 0.76 | 0.68 | 0.63 | 0.76 | 0.69 |
| Box Close | 0.36 | 0.70 | 0.52 | 0.69 | 0.48 | 0.59 |
| Coffee Pull | 0.84 | 0.96 | 0.68 | 0.95 | 0.84 | 1.00 |
| Dial Turn | 0.20 | 0.64 | 0.88 | 0.59 | 0.43 | 0.75 |
| Door Lock | 0.44 | 0.48 | 0.76 | 0.85 | 0.28 | 0.75 |
| Hammer | 0.40 | 0.80 | 0.68 | 0.56 | 0.27 | 0.84 |
| Hand Insert | 0.84 | 0.88 | 0.72 | 0.71 | 0.92 | 0.99 |
| Lever Pull | 0.28 | 0.44 | 0.52 | 0.37 | 0.35 | 0.61 |
| Pick Place | 0.76 | 0.80 | 0.68 | 0.71 | 0.60 | 0.85 |
| Soccer | 0.24 | 0.36 | 0.32 | 0.28 | 0.33 | 0.44 |
| Stick Push | 0.84 | 0.84 | 0.92 | 0.84 | 0.73 | 1.00 |
| 평균 | 0.53 | 0.71 | 0.68 | 0.64 | 0.55 | 0.78 |
| Base 대비 향상 | — | +0.18 | +0.15 | +0.11 | +0.02 | +0.25 |
12개 중 8개 태스크에서 최고 성능, 평균 +0.25 향상. DSRL(잠재 공간 RL)은 +0.02로 거의 효과 없음.
실험 2 — 다중 모델 패밀리 일반화
FlowDAgger의 핵심 주장 중 하나는 특정 모델에 종속되지 않는다는 것이다.
지원 모델 패밀리: - π0.5 (VLA, Physical Intelligence) - GR00T N1.7 (NVIDIA, humanoid VLA) - Cosmos-Policy (NVIDIA, world-action model) - Vanilla Diffusion Policy
π0.5 vs Cosmos-Policy 비교
| Task | π0.5 Base | π0.5+FD | Δ | Cosmos Base | Cosmos+FD | Δ |
|---|---|---|---|---|---|---|
| Assembly | 0.64 | 0.89 | +0.25 | 0.52 | 0.92 | +0.40 |
| Bin Picking | 0.56 | 0.69 | +0.13 | 0.28 | 0.44 | +0.16 |
| Box Close | 0.36 | 0.59 | +0.23 | 0.36 | 0.64 | +0.28 |
| Dial Turn | 0.20 | 0.75 | +0.55 | 0.44 | 0.68 | +0.24 |
| Hand Insert | 0.84 | 0.99 | +0.15 | 0.76 | 0.88 | +0.12 |
| Lever Pull | 0.28 | 0.61 | +0.33 | 0.56 | 0.64 | +0.08 |
| Stick Push | 0.84 | 1.00 | +0.16 | 0.76 | 0.96 | +0.20 |
| 평균 | 0.53 | 0.79 | +0.26 | 0.53 | 0.74 | +0.21 |
두 모델 패밀리 모두에서 유효하며, Action Inversion이 모델 구조와 무관하게 작동함을 확인.
실험 3 — 사전학습 능력 보존 (Catastrophic Forgetting 비교)
Hammer 태스크에 적응 후, 학습하지 않은 5개 태스크에서의 성능 측정.
| 방법 | Hammer(적응 대상) | Door | Drawer | Faucet | Plate | Push | held-out 평균 | Base 대비 Δ |
|---|---|---|---|---|---|---|---|---|
| Base π0.5 | 0.40 | 1.00 | 1.00 | 0.96 | 0.88 | 0.96 | 0.96 | — |
| FlowDAgger | 0.84 | 0.88 | 1.00 | 0.96 | 1.00 | 0.56 | 0.88 | -0.08 |
| Residual-DAgger | 0.56 | 0.88 | 0.68 | 0.80 | 1.00 | 0.08 | 0.69 | -0.27 |
| LoRA-DAgger | 0.68 | 0.80 | 0.00 | 0.36 | 0.00 | 0.36 | 0.30 | -0.66 |
| SFT (50 demos) | 0.80 | 0.12 | 0.00 | 0.00 | 0.00 | 0.00 | 0.02 | -0.94 |
SFT는 사전학습 능력을 거의 완전히 파괴(-0.94). LoRA도 심각한 망각(-0.66). FlowDAgger는 적응 성능을 크게 높이면서 보존 손실 최소(-0.08).
이것이 FlowDAgger의 구조적 강점이다. 기반 가중치를 건드리지 않으므로 기존에 학습된 능력은 물리적으로 손상될 수 없다.
실험 4 — 실제 하드웨어 (8개 태스크)
플랫폼
- FR3 Duo: Microsoft Research 양팔 로봇
- Dual UR5e: 양팔 협동 로봇
- 각 태스크 30회 롤아웃 기준
결과
| Task | Base | SFT | FlowDAgger | 교정 에피소드 수 | Δ vs Base |
|---|---|---|---|---|---|
| Block Pick | 0.73 | 0.80 | 0.90 | 5 | +0.17 |
| Glassware Stacking | 0.26 | 0.53 | 0.76 | 5 | +0.50 |
| Button Push | 0.60 | 0.73 | 0.73 | 10 | +0.13 |
| Slider | 0.36 | 0.43 | 0.66 | 5 | +0.30 |
| Wire Pull | 0.40 | 0.53 | 0.70 | 10 | +0.30 |
| Jenga Stacking | 0.76 | 0.90 | 0.86 | 5 | +0.10 |
| Toolbox Packing | 0.13 | 0.63 | 0.80 | 10 | +0.67 |
| Plug Insertion | 0.60 | 0.66 | 0.72 | 20 | +0.12 |
모든 8개 태스크에서 기반 정책 대비 향상, 6개 태스크에서 SFT 이상. 특히 Toolbox Packing은 5회 교정으로 +0.67이라는 극적 향상.
주목할 태스크
- Toolbox Packing: 도구 고정·뚜껑 닫기 실패(SR 0.13) → 10회 교정 → SR 0.80
- Glassware Stacking: 유리잔 적층 실패(SR 0.26) → 5회 교정 → SR 0.76
연산 효율성
| 방법 | 추가 VRAM | 학습 에피소드 |
|---|---|---|
| SFT | 기반 정책 외 추가 필요 | 50 demos |
| LoRA-DAgger | 기반 정책 외 추가 필요 | 50 episodes |
| FlowDAgger | 기반 정책과 동일 (~8GB) | 5~20 episodes |
소비자용 단일 GPU로 실행 가능하다는 점이 실용성의 핵심이다.
베이스라인 비교 요약
| 방법 | 학습 공간 | 가중치 수정 | 파국적 망각 위험 |
|---|---|---|---|
| SFT | 행동 공간 | 전체 수정 | 매우 높음 |
| LoRA-DAgger | 행동 공간 | 부분 수정 | 높음 |
| Residual-DAgger | 행동 공간(잔차) | 별도 네트워크 | 중간 |
| DSRL | 잠재 공간 RL | 없음 | 낮음(대신 효과 없음) |
| FlowDAgger | 노이즈 공간 | 없음(동결) | 최소 |
한계와 미래 과제
논문이 명시하지 않은 한계를 추론하면:
- Action Inversion 정밀도: 역시간 적분의 수치 오차가 w*의 품질에 영향을 준다. 고차원·긴 호라이즌 태스크에서의 성능은 미검증.
- 소형 정책 표현력: πw가 너무 단순하면 복잡한 분포 이동을 담아내지 못한다.
- 교정 품질 의존성: 인간 교정 행동의 질이 좋지 않으면 w* 역산도 노이즈를 주입한다.
- 비결정론적 실패: 같은 s에서도 다른 실패 모드가 나타날 경우 단일 w*로 커버하기 어렵다.
EROS 시각 — 이 연구의 위치
FlowDAgger는 로봇 정책의 지속 적응(continual adaptation) 문제에서 새로운 패러다임을 제시한다.
기존 패러다임의 딜레마는 이렇다: 적응하면 망각하고, 망각을 피하면 적응이 안 된다. FlowDAgger는 이 딜레마를 "기반 모델의 입력 공간을 조종"함으로써 우회한다. 마치 피아노를 바꾸지 않고 연주자의 손 위치를 조정하는 것처럼.
ROOPS Continuum의 에이전트들이 매 세션 새로운 상황에 적응하면서도 이전 역량을 잃지 않아야 하는 문제와 구조적으로 동형(isomorphic)이다. 가중치(기억) 대신 입력(컨텍스트)을 조정하는 접근—이것이 에이전트 지속성 문제의 한 해답일 수 있다.
또한, 이 논문은 "인간이 5~20회 교정만 해도 충분하다"는 점을 강조한다. 소수의 고품질 개입이 대규모 재학습을 대체한다는 메시지는 ROOPS의 사령관-에이전트 협업 모델과 공명한다.
