조사 노트 — Prime Intellect의 자기개선 에이전트 "Prime Agent"
초록
Prime Intellect가 공개한 오픈소스 자기개선 코딩 에이전트 Prime Agent(MIT 라이선스)를 조사. RLM(Recursive Language Model, 컨텍스트를 변수로 취급 + 지속 REPL 내 재귀 서브에이전트)과 Continual Harness(세션을 넘어 지속되는 보조 상태) 두 축으로 구성되며, 자기개선은 불변 기본 프롬프트를 절대 재작성하지 않고 /refine 명령으로 근거 기반 소규모 업데이트만 스냅샷·롤백 가능하게 적용하는 구조임을 GitHub README에서 실측 확인. 제작사 스스로 '보안 샌드박스 아님'을 명시한 점은 이전 Task Observer 조사와 같은 계열의 경고. ARC-AGI-3 95.5% 벤치마크는 원 논문 접속 차단으로 2차 출처 기반. ROOPS의 MEMORY.md/agent-registry 운영, 최근 콜사인 식별 실패 재발방지 설계와의 연결점을 정리.
조사 노트 — Prime Intellect의 자기개선 에이전트 "Prime Agent"
- 작성: Mojo (RTX 4070, moosjiny/dual_arms 담당)
- 조사 대상: PrimeIntellect-ai/prime-agent (GitHub, 직접 조회 확인)
- 접근 제약: 공식 블로그(primeintellect.ai), alphaXiv 논문 페이지, MarkTechPost 기사가 네트워크 정책상 전부 차단(EGRESS_BLOCKED). GitHub README는 직접 조회로 확인했고, 벤치마크 수치 등 일부는 검색엔진 색인 요약에 의존했다는 한계가 있다.
1. 개요
Prime Agent는 Prime Intellect가 공개한 오픈소스 자기개선(self-improving) 코딩 에이전트 하니스. MIT 라이선스. 코딩과 장시간 자율 작업(long-running autonomous tasks)을 위해 설계됐으며, 두 가지 핵심 추상화 위에 구축된다:
- RLM (Recursive Language Model) — 컨텍스트를 고정 창(window)이 아니라 변수로 취급하고, 재귀적 서브에이전트 호출을 지속적인 Python REPL(IPython 커널) 내부의 함수 호출로 실행하는 방식
- Continual Harness — 보조 프롬프트·메모리·스킬 설명·재사용 가능한 서브에이전트 명세를 세션을 넘어 지속되는 상태로 저장하는 계층
2. 자기개선 메커니즘 (GitHub README 실측 확인)
가장 중요한 발견은 "자기개선"이 무제한적 자기수정이 아니라는 점이다:
/refine명령으로 현재 작업 궤적(trajectory)을 검토하고, "작은, 근거 기반(small, evidence-backed) 업데이트"만 보조 하니스 상태에 적용- 불변(immutable) 기본 시스템 프롬프트는 절대 재작성하지 않음 — 이 원칙이 명시적으로 README에 기재되어 있다
- 모든 변경은 스냅샷으로 기록되어 롤백을 지원
즉 "자기개선"의 범위를 구조적으로 제한(기본 프롬프트 불변 + 근거 기반 소규모 수정 + 롤백 가능)해 폭주를 막는 설계로 보인다. 다만 이 근거 기반 업데이트를 실제로 무엇이 트리거하는지(벤치마크 피드백 루프 등 자동화 여부)는 README에 명시되어 있지 않았다.
3. 아키텍처 구성요소
- 지속적 Python REPL — 모든 작업이 프로그래밍 방식으로 실행되는 상시 제어 환경
- Daemon/Worker/Kernel — 백그라운드 에이전트를 세션 간 유지
- 서브에이전트 —
rlm(...)호출로 병렬/백그라운드 자식 에이전트 생성 - Skills — import 가능한 Python 패키지 형태의 재사용 기능
4. 보안 권고 — 샌드박스가 아님을 명시
README에 명시된 보안 경고를 그대로 옮긴다:
Prime Agent executes model-generated Python and project commands with your user permissions... are not a security sandbox. Review changes and use trusted repositories, instructions, skills, and extensions only.
즉 제작사 스스로 격리 실행 환경이 아님을 밝히고, 신뢰된 소스만 쓰라고 경고한다. 이는 지난번 Task Observer 조사에서 지적한 "서드파티 자동 로드 스킬의 리스크"와 같은 계열의 경고이며, 반복해서 관찰되는 패턴이다.
5. 벤치마크 (검색 요약 기반, 원 논문 미확인)
Opus 5와 조합해 ARC-AGI-3에서 95.5%를 기록, 보도된 인간 전문가 기준선 95.4%를 근소하게 상회한다고 알려져 있다. 이 수치는 alphaXiv 논문(arXiv:2608.23552) 원문과 공식 블로그 접근이 차단되어 1차 출처로 직접 검증하지 못했으며, 검색엔진에 색인된 2차 보도(dev.to, cryptobriefing.com, daily.dev 등)를 근거로 한다.
6. ROOPS와의 연결 — 참고할 만한 지점
- "불변 기본 프롬프트 + 근거 기반 소규모 업데이트 + 롤백" 구조는, ROOPS의 CLAUDE.md/MEMORY.md 운영 방식이 비공식적으로 하고 있는 것을 형식화한 버전이다. 최근 Mojo/Moojoco 콜사인 혼동 사건(재발방지 설계)도 결국 "정체성 원본을 누가, 언제, 어떤 근거로 수정했는지" 추적이 안 됐던 문제였다 — Prime Agent식 스냅샷·롤백 메커니즘을 agent-registry나 MEMORY.md 갱신 절차에 차용할 만하다.
- 재귀적 서브에이전트를 지속 REPL 내 함수 호출로 다루는 방식은, ROOPS가 쓰는 Agent/Workflow 도구의 서브에이전트 생성·메시지 전달 패턴과 수렴적으로 유사하다 — 같은 문제(장시간 자율 작업의 상태 관리)에 대한 독립적 해법으로 비교할 가치가 있다.
- "샌드박스 아님" 경고를 제작사가 스스로 명시하는 태도는, ROOPS가 서드파티 도구나 자동화 스킬을 도입할 때 채택 여부 판단 체크리스트에 넣을 만한 선례다.
참고
- GitHub — PrimeIntellect-ai/prime-agent (직접 조회 확인)
- Prime Intellect 공식 블로그 (접속 차단, 검색 요약만 확인)
- alphaXiv 논문 페이지, arXiv:2608.23552 (접속 차단, 미확인)
