쿠버네티스 위에서 에이전트를 직접 학습시킨다: 마이크로소프트 Orchard 프레임워크 정리
마이크로소프트 리서치는 2026년 8월 3일 에이전트를 실제 배포 하네스 안에서 직접 학습시키는 오픈소스 프레임워크 Orchard를 공개했다. 핵심은 쿠버네티스 기반 환경 계층인 Orchard Env로 격리된 샌드박스 수천 개를 병렬로 띄우고, 학습과 배포에 같은 하네스를 쓰는 것이다. 이 방식으로 학습한 Orchard-SWE는 활성 파라미터 약 30억 개(30B-A3B)만으로 SWE-bench Verified에서 69.7%, 가치 모델 리랭킹을 붙였을 때 73.0%를 기록했다. ASAP은 마이크로소프트 리서치 공식 블로그를 1차 출처로 Orchard의 구조와 수치, 그리고 남은 질문을 정리한다.
학습과 배포를 같은 하네스로 묶은 Orchard Env
Orchard의 출발점은 마이크로소프트 리서치가 "학습과 배포의 불일치"로 부르는 문제다. 오늘날 에이전트는 파일 시스템과 네트워크, 여러 프로세스를 동시에 다루는 상태 유지형 하네스 안에서 돌아가는데, 공개된 학습 도구는 대체로 이런 하네스를 그대로 감당하지 못한다. 그래서 연구자는 단순화한 대체 환경에서 학습한 뒤 실제 환경에 배포하게 되고, 학습에서 본 세계와 배포에서 만나는 세계가 어긋난다.
Orchard Env는 이 간극을 환경 계층으로 메운다. 쿠버네티스 위에서 동작하는 경량 환경으로, 격리된 구성 요소를 병렬로 수천 개까지 생성하고 관리하고 제거한다. 제공하는 기능은 샌드박스 관리와 파일 입출력, 네트워킹, REST API이며, Codex와 OpenClaw, ZeroClaw 같은 실제 에이전트 하네스를 그대로 붙일 수 있다. 학습이 배포될 하네스 안에서 종단으로 이뤄지므로, 학습된 정책이 실제 도구 호출 순서와 실패 양상까지 같은 조건에서 익힌다는 것이 설계 의도다.
활성 파라미터 30억 개로 SWE-bench Verified 69.7%가 나온 경로
Orchard-SWE는 30B-A3B 구조로 활성 파라미터가 약 30억 개인 모델이며, SWE-bench Verified에서 69.7%를 기록했다. 여기에 과거 롤아웃으로 학습한 40억 파라미터 가치 모델을 붙여 후보를 재정렬하면 73.0%로 올라간다. 마이크로소프트 리서치는 이 수치가 10배 이상 큰 모델을 쓰는 프론티어 시스템에 근접한다고 설명했다.
이 성능에 도달한 학습 절차는 여러 단계를 겹친 형태다. 먼저 MiniMax-M2.5와 Qwen3.5-397B 두 공개 가중치 모델에서 뽑은 에이전트 상호작용 10만 7,000건으로 증류를 수행한다. 이어서 부분적으로만 성공한 시도에서도 배우도록 설계된 크레딧 할당 지도학습을 적용하고, 성공 신호가 드물게 나타나는 조건을 겨냥한 Balanced Adaptive Rollout 강화학습으로 마무리한다. 온폴리시 증류와 프로세스 보상 모델은 희소한 최종 보상을 조밀한 신호로 바꾸는 역할을 맡는다.
웹 탐색과 개인 비서로 확장한 두 모델
Orchard-GUI는 40억 파라미터 비전 언어 모델로 웹 탐색 과제를 담당하며, WebVoyager 74.1%, Online-Mind2Web 67.0%, DeepShop 64.0%로 평균 68.4%를 기록했다. 학습에 쓴 데이터는 증류한 시연 400건과 개방형 학습 과제 2,200건이다. 벤치마크 세 종이 각각 일반 웹 탐색과 실환경 과제, 쇼핑 시나리오를 다루므로 단일 도메인 과적합으로 설명하기 어려운 분포를 커버한다.
개인 비서 영역의 Orchard-Claw는 합성 과제 200개만으로 학습해 Claw-Eval에서 최대 3회 시도 조건 기준 59.6%를 달성했다. 같은 모델을 더 강한 ZeroClaw 에이전트 시스템과 결합하면 73.9%로 올라간다. 200개라는 학습 과제 수는 이 분야에서 이례적으로 작은 규모이며, 환경과 하네스가 충실하면 과제 수를 줄여도 학습이 성립한다는 주장의 근거로 제시됐다.
병목이 알고리즘에서 환경으로 옮겨갔다는 신호
Orchard 발표에서 가장 중요한 대목은 벤치마크 점수가 아니라 무엇을 오픈소스로 내놨는지에 있다. 마이크로소프트 리서치가 공개한 것은 모델 가중치와 데이터셋만이 아니라 환경 계층 전체이며, 이는 에이전트 학습의 실질적 병목이 학습 알고리즘이 아니라 인프라라는 진단을 담고 있다. 지난 2년간 에이전트 연구의 공개 자산은 대체로 데이터셋과 벤치마크, 프롬프트 전략에 몰려 있었다. 반면 수천 개 샌드박스를 동시에 띄우고 상태를 관리하며 실패를 회수하는 실행 인프라는 각 조직이 사내에서 다시 만들어 쓰는 영역으로 남아 있었다.
세 도메인을 한 프레임워크에 함께 담은 구성도 같은 방향을 가리킨다. 소프트웨어 엔지니어링과 웹 탐색, 개인 비서는 관측 형태도 보상 구조도 다르다. 이 셋이 같은 Orchard Env 위에서 학습됐다는 사실은 환경 계층이 도메인 종속적이지 않게 추상화됐다는 뜻이며, 새 도메인을 붙이는 비용이 낮다는 주장으로 읽힌다. 프레임워크의 가치가 개별 모델 점수보다 여기서 나온다.
숫자에서 인상적인 부분과 신중할 부분
인상적인 쪽은 파라미터 대비 효율이다. 활성 파라미터 30억 개로 SWE-bench Verified 69.7%를 낸 것은 같은 벤치마크에서 훨씬 큰 모델이 차지하던 구간에 소형 모델이 들어왔다는 뜻이다. 학습 데이터 규모도 작다. 소프트웨어 엔지니어링에서 10만 7,000건, 웹 탐색에서 2,600건 남짓, 개인 비서에서 200건이라는 숫자는 대규모 데이터 수집 없이도 하네스 충실도를 높이는 쪽으로 예산을 옮길 수 있다는 뜻이다.
신중하게 읽어야 할 지점은 비교 조건이다. 73.0%는 가치 모델 리랭킹을 적용한 값이므로 추론 시점에 여러 후보를 생성하고 40억 파라미터 모델로 재정렬하는 추가 연산이 들어간다. 활성 파라미터 30억 개라는 표현도 총 파라미터 30B 규모의 MoE 구조에서 나온 값이므로 메모리 요구량은 활성 파라미터 기준으로 계산하면 안 된다. Orchard-Claw의 59.6%는 최대 3회 시도 조건이며, 73.9%는 모델 자체가 아니라 더 강한 에이전트 시스템과 결합한 결과다. 세 숫자 모두 조건을 떼어내면 다른 이야기가 된다.
국내 팀에게 실제로 달라지는 것
국내에서 에이전트를 도입하려는 팀에게 Orchard가 바꾸는 계산은 모델 선택이 아니라 인프라 선택이다. 자체 데이터로 에이전트를 학습시키려던 조직은 지금까지 대체로 두 갈래 중 하나를 택했다. 프론티어 API 모델에 프롬프트와 도구를 얹거나, 오픈 가중치 모델을 단순화한 환경에서 미세조정하는 방식이다. 첫째는 비용과 데이터 반출 문제가 걸리고, 둘째는 학습과 배포의 불일치를 그대로 떠안는다.
Orchard가 제시하는 세 번째 길은 이미 쓰고 있는 쿠버네티스 클러스터를 학습 환경으로 재사용하는 것이다. 활성 파라미터 30억 개 규모 모델이면 온프레미스 서빙이 현실적인 범위에 들어오고, 규제 산업에서 데이터가 조직 밖으로 나가지 않는 구성도 가능해진다. 다만 수천 개 샌드박스를 병렬로 굴리는 학습은 GPU가 아니라 클러스터 운영 역량을 요구하므로, 이 방향의 진입 장벽은 연구 인력이 아니라 플랫폼 엔지니어링 쪽에 생긴다.
남은 질문
첫째, 세 도메인 모두 검증 가능한 성공 신호가 존재하는 영역이다. 소프트웨어 엔지니어링은 테스트 통과 여부로, 웹 탐색은 목표 달성 여부로 보상을 정의할 수 있다. 성공 판정이 모호한 업무, 예를 들어 문서 작성이나 의사결정 보조에서 같은 절차가 작동하는지는 이번 공개 범위 밖이다.
둘째, 벤치마크 점수와 실제 저장소 사이의 간격이 남는다. SWE-bench Verified는 검증된 과제 집합이며, 사내 코드베이스의 빌드 환경과 사설 의존성, 문서화되지 않은 관행은 벤치마크가 재현하지 않는 조건이다.
셋째, 마이크로소프트 리서치는 학습 경험을 재사용해 에이전트가 누적적으로 학습하는 방향을 향후 과제로 제시했다. 지금 공개된 것은 도메인별로 따로 학습한 세 모델이며, 한 도메인에서 얻은 경험이 다른 도메인으로 이전되는지는 아직 데이터가 없다. 프레임워크의 진짜 시험대는 이 이전 학습이 성립하는지에 달려 있다.
출처: 마이크로소프트 리서치 공식 블로그 "Orchard: An open framework for scalable agentic AI"(Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Jianfeng Gao, 2026년 8월 3일) 기반 ASAP 정리. 코드는 github.com/microsoft/Orchard, 데이터셋은 huggingface.co/datasets/microsoft/Orchard에 공개됐다.

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr