Harness Engineering
01 / 06
24
interface / evaluation
SWE-agent와 lm-eval이 “모델 밖 설계”의 효과를 보여준 해
25
production harness
운영 에이전트가 context, tool, permission, trace를 한 계층으로 묶기 시작
26

하네스가
연구 주제가 됐다

2024-2026 논문 흐름으로 보는 AI agent runtime substrate의 부상

Trend Line
02 / 06
2024 -> 2026

모델 성능에서 실행 계층으로

질문이 바뀝니다. “모델이 코드를 잘 짜나?”에서 “모델-하네스-환경 시스템이 검증 가능한 일을 끝내나?”로.

2024

Interface matters

SWE-agent: ACI 설계가 SWE-bench 성능을 바꿈. lm-eval: 평가 하네스의 prompt/metric 차이가 순위를 바꿈.

2025

Runtime becomes product

상용 coding agent들은 context compaction, permission gates, traces, memory, tool routing을 제품 품질의 핵심으로 다룸.

2026

Harness becomes object

AI Harness Engineering, AHE, Meta-Harness, Harness-Bench가 하네스를 정의·최적화·측정 대상으로 끌어올림.

Sources: SWE-agent 2405.15793, lm-eval 2405.14782, Meta-Harness 2603.28052, AHE 2604.25850, Harness-Bench 2605.27922
2024
03 / 06
SWE-agent

Agent-computer interface

LM에게 사람이 쓰는 shell을 그대로 주면 비효율과 오류가 커집니다. 검색, 파일 보기, 편집, lint feedback을 LM 친화적으로 재설계하자 성능이 올랐습니다.

공신력

NeurIPS 2024. 코드·데이터·trajectory 공개. 이 묶음에서 가장 단단한 선행 연구.

lm-eval

Evaluation harness

평가도 하네스입니다. prompt 문구, whitespace, few-shot, metric 구현 차이가 모델 순위까지 바꾸므로 실행 설정을 재현 가능하게 고정해야 합니다.

공신력

EleutherAI lm-evaluation-harness 기반. peer review보다 실사용 채택에서 신뢰가 강함.

핵심 전환: 모델을 고정해도 interface와 evaluation setup이 결과를 크게 바꾼다.
2025
04 / 06
Production pattern

하네스는
운영 계층이다

상용 agent는 더 이상 “LLM + prompt”가 아닙니다. 작업 상태를 유지하고, 도구를 제한하고, 실패를 해석하고, 검증 증거를 남기는 runtime이 붙습니다.

하네스
맥락
선택·압축·기억
도구
실행·권한·복구
상태
계획·진행·중단점
증거
trace·test·report
모델
잠재 능력
런타임
읽는 법: 2025년의 제품 흐름은 2026년 논문들이 “harness engineering”이라고 명명한 대상이다.
2026
05 / 06
Paper map

논문 흐름 지도

2024년에는 interface와 evaluation setup의 효과가 보였고, 2026년에는 harness 자체를 설계·최적화·측정 대상으로 분리했습니다.

2024.05.06 / 2405.15793

SWE-agent

ACI 설계가 coding agent 성능을 바꾼다는 증거.

2024.05.23 / 2405.14782

lm-eval

평가 prompt, metric, few-shot 설정도 결과를 바꾸는 하네스임을 정리.

2026.03.05 / 2603.05344

OpenDev

terminal agent의 scaffolding, harness, context engineering 패턴화.

2026.03.30 / 2603.28052

Meta-Harness

execution trace를 보고 harness code를 고치는 outer-loop 최적화.

2026.04.09 / 2604.08224

Externalization

memory, skills, protocols, harness를 모델 밖 인프라로 묶는 관점.

2026.04.28 / 2604.25850

AHE

observability로 tools, middleware, memory를 자동 진화.

2026.05.13 / 2605.13357

AI Harness Engineering

context, tools, memory, state, verification 등 11개 책임으로 공식화.

2026.05.27 / 2605.27922

Harness-Bench

model-harness configuration 단위로 성능을 측정하는 benchmark.

Trend
효과 발견 -> 운영 계층화 -> 자동 개선 -> 정의와 측정
날짜는 arXiv v1 제출일 기준. 공신력은 2026년 7월 1일 기준: arXiv preprint 중심, peer review는 별도 확인 필요.
Closing
06 / 06

하네스는
성능의
공저자다

Takeaway
End
01

2024는 증거

interface와 evaluation setup이 모델 성능 해석을 바꾼다는 경험적 근거.

02

2025는 제품화

context, tools, permissions, traces가 운영 agent의 기본 체력이 됨.

03

2026은 학문화

하네스를 정의하고 자동 최적화하며 benchmark로 측정하는 흐름이 생김.

Left/Right: slides | B: static | Esc: index