ooo plugin, fat skill, autoresearch contract, Ouroboros 실행/평가 루프를 하나의 연구 워크플로우로 묶은 검증 결과.
baseline만 다시 실행한 보고서, policy inspection만 있는 산출물, metric 없는 개선 주장은 연구 자동화가 아니다.
실험 후보, 실행 명령, 변경 파일, metric, 결론이 ledger에 남고, 최종 결과가 baseline과 비교되어야 한다.
program.md, train.py, metric, budget을 handoff로 변환
모호한 범위와 실패 조건을 닫음
contract를 top-level 구조로 승격
baseline과 후보 실험을 실제 실행
command, metric, ledger, edit boundary 확인
실패하면 복구, 통과하면 evidence로 종료
후보를 바꾸고, 고정된 metric으로 점수를 비교하고, 가장 좋은 configuration을 남긴다.
baseline -> smoothing -> bigram -> trigram -> backoff -> combined
인터뷰로 Seed를 수렴시키고, 실행 결과를 AC와 formal evaluator로 검증한다.
interview -> seed -> execution -> evaluate -> reflect
plugin은 실행 버튼이 아니라 연구 문맥을 운반하는 도메인 어댑터다.
연구 목표와 metric
fat skill adapter
compact contract
top-level fields
실험과 ledger
고정 corpus에서 다음 문자를 예측하는 확률 모델을 만들고, validation bits-per-byte인 val_bpb를 낮추는지 측정했다.
val_bpb는 낮을수록 좋다. baseline은 3.791757, 최종 best는 3.406207이다.
모델 후보와 확률 계산만 수정
dataset, split, metric 고정
각 실행 60초 budget
Seed contract · metric, budget, command, artifact policy를 먼저 고정.
Pre-run gate · 6개 후보 순서와 train.py edit boundary 확인.
Execute · baseline에서 smoothing, mix, trigram, backoff, combined로 진행.
Ledger subtree · 모든 row와 non-baseline candidate evidence 검증.
Close · final metric 개선, invalid-run 분리, verification plan coverage 확인.
bigram-heavy
변경 전 기준. 이 값을 넘지 못하면 개선이 아니다.
확률 보정
smoothing과 unigram-bigram 비율 조정만으로 큰 초반 개선.
문맥 확장
trigram component가 크게 개선했고, sparse backoff는 추가 개선 없음.
final best
좋았던 요소만 조합. low smoothing, bigram 0.58, trigram 0.30.
AC tree, agent action, experiment ledger가 서로를 검증하는 research trace가 된다.
interview, seed repair, run, sub-AC verification, evaluate가 session/cursor로 이어진다.
AC 1-9가 dependency graph처럼 닫힌다. AC5는 ledger completeness와 baseline-only 방지로 다시 갈라졌다.
각 후보의 command, changed files, val_bpb, conclusion이 row로 남는다.
후보를 실행한 이유와 실패/개선 판정이 output report로 남는다.
command 실행, metric 계산, fixed-file boundary, forbidden output 부재를 다시 확인한다.
Seed grade A -> Run complete -> Evaluate APPROVED, semantic score 0.86.
최적화 방향과 fallback parser를 명시한다.
train.py만 editable, program.md와 prepare.py는 fixed.
command, changed files, metric, conclusion을 남긴다.
non-zero, traceback, timeout, missing metric은 invalid.
seed.md는 brief, saved Seed path는 runtime-owned.
baseline-only report를 성공으로 보지 않는다.
불명확한 요구사항과 실패 조건을 닫는다.
후보를 실제 코드 변경과 command로 실행한다.
metric과 ledger가 기준을 만족하는지 평가한다.
실패하면 contract 또는 실행 계획을 고쳐 재시도한다.
fat skill은 연구 도메인의 판단 기준을 Seed contract로 운반한다.
후보 실험과 metric 비교를 ledger로 남겨 baseline-only를 막는다.
interview, execution, evaluate, reflect로 연구 자동화를 검증 가능한 루프로 닫는다.