2024-2026 논문 흐름으로 보는 AI agent runtime substrate의 부상
질문이 바뀝니다. “모델이 코드를 잘 짜나?”에서 “모델-하네스-환경 시스템이 검증 가능한 일을 끝내나?”로.
SWE-agent: ACI 설계가 SWE-bench 성능을 바꿈. lm-eval: 평가 하네스의 prompt/metric 차이가 순위를 바꿈.
상용 coding agent들은 context compaction, permission gates, traces, memory, tool routing을 제품 품질의 핵심으로 다룸.
AI Harness Engineering, AHE, Meta-Harness, Harness-Bench가 하네스를 정의·최적화·측정 대상으로 끌어올림.
LM에게 사람이 쓰는 shell을 그대로 주면 비효율과 오류가 커집니다. 검색, 파일 보기, 편집, lint feedback을 LM 친화적으로 재설계하자 성능이 올랐습니다.
NeurIPS 2024. 코드·데이터·trajectory 공개. 이 묶음에서 가장 단단한 선행 연구.
평가도 하네스입니다. prompt 문구, whitespace, few-shot, metric 구현 차이가 모델 순위까지 바꾸므로 실행 설정을 재현 가능하게 고정해야 합니다.
EleutherAI lm-evaluation-harness 기반. peer review보다 실사용 채택에서 신뢰가 강함.
상용 agent는 더 이상 “LLM + prompt”가 아닙니다. 작업 상태를 유지하고, 도구를 제한하고, 실패를 해석하고, 검증 증거를 남기는 runtime이 붙습니다.
2024년에는 interface와 evaluation setup의 효과가 보였고, 2026년에는 harness 자체를 설계·최적화·측정 대상으로 분리했습니다.
ACI 설계가 coding agent 성능을 바꾼다는 증거.
평가 prompt, metric, few-shot 설정도 결과를 바꾸는 하네스임을 정리.
terminal agent의 scaffolding, harness, context engineering 패턴화.
execution trace를 보고 harness code를 고치는 outer-loop 최적화.
memory, skills, protocols, harness를 모델 밖 인프라로 묶는 관점.
observability로 tools, middleware, memory를 자동 진화.
context, tools, memory, state, verification 등 11개 책임으로 공식화.
model-harness configuration 단위로 성능을 측정하는 benchmark.
interface와 evaluation setup이 모델 성능 해석을 바꾼다는 경험적 근거.
context, tools, permissions, traces가 운영 agent의 기본 체력이 됨.
하네스를 정의하고 자동 최적화하며 benchmark로 측정하는 흐름이 생김.