모델과 작업별 GitHub Copilot 에이전틱 하니스의 성능 및 효율성 평가 (새 탭에서 열림)
GitHub은 모델 자체의 지능뿐 아니라 도구·컨텍스트·작업 흐름을 조율하는 에이전틱 하니스(harness)가 실제 성능을 좌우한다고 주장합니다. 동일한 모델과 작업을 기준으로 비교한 결과, GitHub Copilot 하니스는 모델 제공업체의 하니스와 비슷한 작업 해결률을 유지하면서 대부분 더 적은 토큰을 사용하는 것으로 나타났습니다. 따라서 하나의 하니스를 개선하면 Copilot CLI, 앱, 코드 리뷰, IDE 등 여러 제품 경험이 함께 향상된다는 결론입니다.
에이전틱 하니스의 역할
- 모델은 기본적인 추론 능력을 제공하지만, 하니스가 그 능력을 실제 작업에 적용하는 방식을 결정합니다.
- 하니스는 다음 요소를 조율합니다.
- 사용할 도구
- 모델에 제공할 컨텍스트
- 작업 실행 순서와 워크플로
- 메모리 및 MCP 서버 활용
- GitHub Copilot의 하니스는 Copilot SDK의 공통 구성 요소입니다.
- Copilot CLI, Copilot 앱, Copilot 코드 리뷰, VS Code·Xcode 등 다양한 GitHub 및 Microsoft 경험에서 공유됩니다.
- GitHub은 좋은 하니스의 조건으로 빠른 속도, 낮은 토큰 사용량, 예측 가능성을 제시합니다.
벤치마크 비교 방법
- 공개 벤치마크와 GitHub·Microsoft 대규모 코드베이스에서 도출한 내부 벤치마크를 함께 사용합니다.
- 통제된 실험 결과를 실제 사용 지표와 온라인 실험으로 보완합니다.
- 비교 시 다음 조건을 동일하게 맞췄습니다.
- 같은 모델
- 같은 벤치마크 작업
- 동일하게 정규화한 컨텍스트 윈도우
- 동일한 추론 수준
- 동일한 도구 선택 및 MCP 서버
- 비교 대상은 다음과 같습니다.
- GitHub Copilot CLI
- Claude 모델의 기본 하니스인 Claude Code
- GPT 모델의 기본 하니스인 Codex CLI
- 평가 모델은 Claude Sonnet 4.6, Claude Opus 4.7, GPT-5.4, GPT-5.5입니다.
사용한 벤치마크
- SWE-bench Verified
- 오픈소스 Python 저장소의 사람이 검증한 버그 수정 500개
- 코딩 에이전트의 대표적인 산업 표준 벤치마크
- SWE-bench Pro
- 여러 단계의 추론과 광범위한 코드 변경이 필요한 어려운 작업
- 실제 소프트웨어 엔지니어링에 가까운 복잡한 문제를 평가
- SkillsBench
- 에이전트가 스킬을 얼마나 효과적으로 사용하고 호출하는지 평가
- TerminalBench
- 개발자가 사용하는 명령줄·터미널 기반 작업 수행 능력 측정
- Win-Hill
- Windows 컨테이너에서 실행되는 내부 벤치마크
- 운영체제와 실행 환경이 달라져도 성능이 유지되는지 검증
토큰 효율
- 동일한 모델과 작업을 사용했을 때 Copilot 하니스는 대부분의 설정에서 더 적은 토큰을 소비했습니다.
- 토큰 사용량이 줄었음에도 전반적인 작업 완료율은 다른 모델 제공업체 하니스와 비슷한 수준이었습니다.
- Claude Sonnet 4.6과 Opus 4.7에서는 Copilot CLI가 비교된 모든 사례에서 더 나은 결과를 보였습니다.
- GPT-5.4와 GPT-5.5에서도 대부분 Copilot CLI가 우세했지만, SWE-bench Verified에서는 각각 7%, 4% 낮은 성능을 기록했습니다.
- 단순히 비용을 줄이는 것이 아니라, 작업 해결 능력을 유지하면서 토큰 소비를 낮추는 것이 핵심입니다.
작업 해결률
- 전체적으로 Copilot 하니스의 작업 해결률은 모델 제공업체 하니스와 대등했습니다.
- SWE-bench Verified에서는:
- Sonnet 4.6과 Opus 4.7에서 Copilot CLI가 더 높은 해결률을 보였습니다.
- GPT-5.4와 GPT-5.5에서는 더 낮았습니다.
- SWE-bench Pro에서는:
- Sonnet 4.6에서만 Copilot CLI가 소폭 낮았습니다.
- 나머지 모델에서는 더 나은 성능을 보였습니다.
- SkillsBench에서는 Claude 모델에서 낮았지만 GPT 모델에서는 더 높았습니다.
- Win-Hill에서는 모든 모델에서 같거나 더 나은 결과를 기록했습니다.
- TerminalBench 2에서는:
- Sonnet 4.6과 Opus 4.7에서 더 높았습니다.
- GPT-5.5에서는 동률이었습니다.
- GPT-5.4에서는 더 낮았습니다.
- 저자들은 모델의 확률적 특성으로 인한 실행별 변동을 고려하면 이러한 차이는 실질적으로 “동등한 수준”이라고 해석합니다.
실행별 변동성과 비용 분석
- TerminalBench 2.0을 사용해 작업 해결률뿐 아니라 작업당 비용과 실행별 변동도 분석했습니다.
- 벤치마크 결과는 한 번의 실행만으로 하니스 성능을 판단하기 어렵다는 점을 보여줍니다.
- 같은 에이전트와 모델 조합도 실행마다 결과가 달라질 수 있습니다.
- 평가에서는 더 많은 작업을 해결하면서 비용을 적게 쓰는 구성이 더 좋은 것으로 간주합니다.
- Copilot CLI는 이러한 분석에서 모델 제공업체 하니스와 비교해 같거나 더 나은 해결률·토큰 효율을 보였습니다.
실용적인 의미
- 모델을 선택할 때 모델의 벤치마크 점수만 보지 말고 하니스의 도구 사용, 컨텍스트 관리, 토큰 효율도 함께 평가해야 합니다.
- 여러 모델을 한 제품에서 사용해야 한다면, 특정 모델에 종속되지 않으면서 성능을 유지하는 공통 하니스가 유리합니다.
- 실제 도입 전에는 SWE-bench 같은 표준 평가뿐 아니라 조직의 코드베이스와 터미널 작업을 반영한 내부 벤치마크를 반복 실행하는 것이 좋습니다.
- 단일 실행 결과보다 해결률, 비용, 토큰 사용량, 실행 간 변동을 함께 비교해야 신뢰할 수 있는 판단을 내릴 수 있습니다.