Sonnet·Opus 조합으로 Fable 5를 따라잡을 수 있을까 — 하네스 설계와 5개 태스크 검증기
목차
Fable 5에 소스로 공식 프롬프팅 문서(Prompting Claude Fable 5)를 넘겨, Opus 4.8과의 성능 차가 어디서 생기는지를 분석시킨 다음, Sonnet·Opus를 조합해 Fable 5급 성과물을 출력하는 하네스의 설계와 구현을 시켜 봤습니다.
구현 후에는 Fable 5 단발과, Sonnet·Opus를 조합한 하네스에 같은 구현 태스크를 흘려 품질·시간·비용을 비교했습니다. 평가는 5개 태스크로 진행했고, 같은 프로바이더 안에서의 자기 평가가 되지 않도록 다른 프로바이더의 GPT5.5(Codex)로 평가했습니다.
검증 결과, 하네스는 Fable 5와 동등에 가까운 수준까지 도달하는 케이스가 있음은 확인됐습니다. 한편 Fable 5 단발 쪽이 안정적인 장면도 있었고, 품질에서 명확히 웃도는 패턴은 이번 검증에서는 발견되지 않았습니다. API 경유로 쓸 수 있다면, 이번에 만든 하네스는 쓰지 않고 Fable 5 단발로 쓰는 쪽이 시간·비용·품질 균형에서 유리하다는 결과였습니다.
Fable 5와 Opus 4.8의 비교 분석 결과
문서에 따르면, Fable 5는 Opus 4.8 대비 대략 다음 지점이 향상되어 있다.
- 장시간, 스스로 계속 달릴 수 있다
- 어려운 문제를 한 방에 올바르게 만들 수 있다(초회 정확성)
- 버그를 찾아내는 힘이 높다(코드 리뷰·디버그 검출률이 명확히 위)
- 서브에이전트에 대한 위임과 통솔이 능숙하다
- 과거의 교훈을 기억해 다음에 살릴 수 있다(메모리 활용)
- 독립된 검증 역에게 자기 일을 체크시킨다(자기 검증)
위 항목이 "Sonnet·Opus에 모자란 것"이 되므로, 하네스로 그것들을 보완하는 구조를 만들도록 설계시켰습니다.
어떻게 만들었나
분석 결과를 바탕으로, Fable 5가 내장한 능력을 하네스의 공정에 하나씩 대응시켰습니다.
- 과거의 교훈을 기억한다 → 구현 전에 메모리에서 관련 교훈을 읽어 내 계획·검증·공격 역에 넘긴다
- 한 방에 올바르게 만든다 → 사양의 전개와 구현 계획을 상류 공정에서 단단히 굳히는 공정을 둔다
- 자기 검증 → 테스트를 실제로 돌리는 담당(기계적 체크)과, 사양과 대조하는 검증 역을 나눠 병행시킨다
- 버그를 찾아낸다 → 일부러 부수러 가는 "공격 역"을 항상 2체 달리게 하고, 유효해 보이는 지적만 Opus가 판정하게 한다
- 위임과 통솔 → 워크플로로 서브에이전트를 병렬로 부려 처리한다
- 진척 보고의 뒷받침 → 완료 보고 하나하나를 실제 증거와 대조해 감사한다
- 장시간의 자율 → "어떻게 되면 끝인가"를 명확히 한 루프와, 폭주하지 않기 위한 정지 조건을 마련한다
검증 결과와 하네스의 변천
아래는 같은 프로바이더 안에서의 자기 평가가 되지 않도록, 다른 프로바이더로 완전히 갈아타 GPT5.5(Codex)로 검증한 결과입니다.
| 평가 대상 | Fable 5 단발 | 하네스 | 시간비 | 비용비 | GPT 검증 판정 |
|---|---|---|---|---|---|
| 1번째 | 숨김 18/18, 종합 98점 | 숨김 18/18, 종합 83점 | 약 31배 | 약 58배 | 기능만은 동점. 다만 실운용 품질에서는 명확히 불합격. |
| 2번째 | 숨김 29/30, 종합 96점 | 숨김 29/30, 종합 96점 | 2.19배 | 0.62배 | 품질은 동점. 사양의 모순을 찾았지만, 상류 판단에서 기존 거동을 우선해 틀렸다. |
| 3번째 | 숨김 31/31, 종합 98점 | 숨김 31/31, 종합 98점 | 4.27배 | 1.51배 | 품질은 동점 만점. 사양 모순 규칙과 메모리 읽기는 들었지만, 상시 반증·감사는 허탕이었다. |
| 4번째 | 숨김 36/36, 종합 98점 | 숨김 36/36, 종합 98점 | 4.24배 | 1.94배 | 처음으로 수정·반증·중재·감사·교훈 기록이 발화. 다만 수정 대상은 제품 결함이 아니라 테스트 망라 누락이라, 품질 차는 나지 않았다. |
| 5번째 | 자체 테스트 118/118, 상호 테스트 23/23 | 자체 테스트 114/114, 상호 테스트 25/27 | 1.61배 | 0.94배 | 차이는 입력 검증의 세세한 경계 2건. |
※ 표의 "숨김"은 숨김 인수 테스트(사전에 공개하지 않은 채점용 테스트)의 통과 수입니다.
1번째: 풀 구성 하네스의 실패와, 방어층의 가치
첫 하네스는 수정·반증·중재·감사를 상시 깊게 돌리는 구성이었습니다. 숨김 인수 테스트는 Fable 5와 같은 18/18까지 도달했습니다. 그러나 시간은 약 31배, 토큰은 약 58배, 에이전트 수와 툴 실행 횟수도 크게 불어나 쓸 수 없는 상태였습니다. 이 결과를 받아, 풀 구성에서 문제 발생 시에만 깊이 파는 구성으로 바꿨습니다.
2번째: 에스컬레이션형으로 비용은 개선, 상류 판단 미스는 잔존
통합 후의 하네스는 수정이 일어나지 않는 한 반증·중재·감사를 기동하지 않는 구성으로 바뀌었습니다. 그 결과 1번째와 비교해 실행 비용은 대폭 개선됐습니다. 숨김 테스트는 Fable 5와 하네스가 나란히 29/30이었고, 떨어뜨린 항목도 같았습니다.
다만 실패의 질은 달랐습니다. Fable 5는 기존 거동과 사양 문구의 어긋남을 놓쳤지만, 하네스는 어긋남을 찾아냈음에도 "기존 동작 유지"를 우선해 사양 쪽을 물리쳤습니다.
3번째: 사양 모순 규칙과 메모리는 들었지만, 시간이 늘었다
2번째의 반성에서 "사양과 기존 거동이 모순되면 사양을 정으로 삼는다"는 규칙, 과거 교훈 읽기, 사양의 독립 감사, 상시 반증이 추가됐습니다. 결과적으로 같은 계통의 함정은 양쪽 다 피했고, 숨김 테스트는 31/31 동점 만점이었습니다.
다만 하네스의 품질층은 이 태스크에서는 품질 차를 만들지 못했습니다. 수정 0회, 반증은 허탕, 감사도 문제없음으로, 상시 반증과 감사는 발화하지 않았습니다.
4번째: 에스컬레이션층은 움직였지만, 품질 우위는 미관측
4번째에서는 처음으로 수정 루프, 반증, 중재, 실증 감사(보고를 증거와 대조하는 감사), 교훈 기록이 실제로 발화했습니다. 반증자가 낸 그럴듯한 우려에 대해, 중재 역이 기존 거동과의 비교와 실측을 써서 불필요한 수정을 멈춘 지점은 좋은 움직임이었습니다. 오검출을 막는 방어층으로는 기능하고 있습니다.
한편 숨김 테스트는 Fable 5도 하네스도 36/36으로, 제품 코드상의 결함은 양쪽 다 한 방에 제로였습니다. 다만 사양 감사의 일부가 도중에 실패한 채 진행된 점은 검증층의 약점으로 남았습니다.
5번째: 덩치 큰 태스크에서의 평가
Fable 5 쪽은 자체 테스트 118/118, 하네스 쪽은 자체 테스트 114/114였습니다. 나아가 상호 검증으로, Fable 5 쪽이 만든 추가 테스트를 하네스 쪽에 대면 25/27, 하네스 쪽이 만든 추가 테스트를 Fable 5 쪽에 대면 23/23이었습니다.
차이가 난 2건은 모두 입력 검증의 경계입니다. 주요 기능 부분은 상호 테스트에서도 대체로 통과했습니다.
다만 이 결과로도 하네스가 Fable 5를 웃돌았다고는 할 수 없습니다. Fable 5는 상대 쪽 추가 테스트를 전부 통과했고, 하네스는 Fable 5 쪽 추가 테스트를 2건 떨어뜨렸습니다. 품질 차는 작지만, 엄밀 비교에서는 Fable 5가 근소하게 위였습니다.
최종적인 하네스의 형태
검증을 거쳐, 현시점에서는 다음 6단계 흐름이 되었습니다.
① 교훈 읽기 과거에 빠졌던 함정을 메모리에서 주워 뒤 공정에 넘긴다
↓
② 사양 전개와 계획 무엇을 만들지 명확히 하고, 인수 기준을 검증 가능한 형태로 늘어놓는다
↓
③ 구현 + 사양 체크(병행)
만들면서, 별도 담당이 "계획의 사양이 원래 티켓에서 어긋나지 않았는가"를 감사
↓
④ 체크 테스트를 실제로 돌리는 담당과, 사양과 대조하는 검증 역을 병행으로.
안 되면 고친다. 같은 실패를 반복하고 있으면 일찍 사람에게 에스컬레이션
↓
⑤ 공격(반증) 공격 역 2체를 각도를 나눠 상시 실행. 유효한 지적은 Opus가 판정
↓
⑥ 메모(문제가 있었을 때만)
보고 내용을 증거와 대조해 감사 → 얻은 교훈을 메모리에 기록
결론
현재의 하네스는 Fable 5와 동등에 가까운 수준까지 도달하는 결과가 되었습니다. 여러 평가에서 Fable 5 단발과 동등한 품질까지 도달했고, 수정·반증·중재·감사 같은 구조가 실제로 기능하는 것도 확인했습니다.
한편 Fable 5 단발 쪽이 안정적인 결과도 있어, 완전한 대체는 되지 못했습니다. 이번 검증에서는 하네스가 품질에서 명확히 Fable 5를 웃도는 패턴은 찾지 못했습니다.
API 경유로 Fable 5를 이용할 수 있는 경우, 현재로서는 Fable 5 단발을 쓰는 쪽이 시간·비용·품질 균형에서 유리합니다. 하네스는 공정이 늘어나는 만큼 검증과 반증에 두께를 실을 수 있는 반면, 실행 시간과 비용이 불어나기 쉽고 안정성에도 아직 과제가 남았습니다.
다만 구독 플랜 이용 환경이나 Fable 5를 직접 쓸 수 없는 환경에서는, Sonnet·Opus만으로는 닿기 어려운 품질을 사양 전개·검증·반증·감사의 흐름으로 보완해 Fable 5 상당의 성과물에 가까워질 수 있음은 확인됐습니다.
이 글이 도움이 됐다면 추천해 주세요