Ouroboros Auto Research
01 / 11
Research Workflow Report

자동 연구를
검증 가능한 루프로

ooo plugin, fat skill, autoresearch contract, Ouroboros 실행/평가 루프를 하나의 연구 워크플로우로 묶은 검증 결과.

Thesis
02 / 11

연구 자동화는
실험 증거가
있어야 한다.

Problem
Claim

baseline만 다시 실행한 보고서, policy inspection만 있는 산출물, metric 없는 개선 주장은 연구 자동화가 아니다.

검증 기준

실험 후보, 실행 명령, 변경 파일, metric, 결론이 ledger에 남고, 최종 결과가 baseline과 비교되어야 한다.

Process
03 / 11
Ouroboros loop

plugin prepare에서 formal evaluate까지

01

Prepare

program.md, train.py, metric, budget을 handoff로 변환

02

Interview

모호한 범위와 실패 조건을 닫음

03

Seed

contract를 top-level 구조로 승격

04

Run

baseline과 후보 실험을 실제 실행

05

Evaluate

command, metric, ledger, edit boundary 확인

06

Reflect

실패하면 복구, 통과하면 evidence로 종료

Verified path: Seed grade A -> run 9/9 AC -> evaluate APPROVED
Integration
04 / 11
Karpathy autoresearch + Ouroboros

두 루프를 분리하지 않고 결합한다

Autoresearch 방식

program과 metric이 중심

후보를 바꾸고, 고정된 metric으로 점수를 비교하고, 가장 좋은 configuration을 남긴다.

baseline -> smoothing -> bigram -> trigram -> backoff -> combined

Ouroboros 방식

contract와 평가가 중심

인터뷰로 Seed를 수렴시키고, 실행 결과를 AC와 formal evaluator로 검증한다.

interview -> seed -> execution -> evaluate -> reflect

System
05 / 11
Architecture

fat skill: 연구 도메인에서 Seed contract로

plugin은 실행 버튼이 아니라 연구 문맥을 운반하는 도메인 어댑터다.

program.md

연구 목표와 metric

plugin

fat skill adapter

auto_goal

compact contract

Seed

top-level fields

Run

실험과 ledger

Evaluate
Experiment
06 / 11
What was the experiment?

작은 character LM의 validation bpb를 낮추는 실험

고정 corpus에서 다음 문자를 예측하는 확률 모델을 만들고, validation bits-per-byte인 val_bpb를 낮추는지 측정했다.

Metric

val_bpb는 낮을수록 좋다. baseline은 3.791757, 최종 best는 3.406207이다.

editable

train.py

모델 후보와 확률 계산만 수정

fixed

prepare.py

dataset, split, metric 고정

runtime

6 runs

각 실행 60초 budget

AC tree progression
AC1

Seed contract · metric, budget, command, artifact policy를 먼저 고정.

AC2/4

Pre-run gate · 6개 후보 순서와 train.py edit boundary 확인.

AC3

Execute · baseline에서 smoothing, mix, trigram, backoff, combined로 진행.

AC5.1/5.2

Ledger subtree · 모든 row와 non-baseline candidate evidence 검증.

AC6-9

Close · final metric 개선, invalid-run 분리, verification plan coverage 확인.

Results
07 / 11
Six measured candidates

후보가 바뀔 때마다 val_bpb가 어떻게 움직였나

1 · baseline

bigram-heavy

변경 전 기준. 이 값을 넘지 못하면 개선이 아니다.

3.791757
2-3 · smoothing / mix

확률 보정

smoothing과 unigram-bigram 비율 조정만으로 큰 초반 개선.

3.600373
4-5 · trigram / backoff

문맥 확장

trigram component가 크게 개선했고, sparse backoff는 추가 개선 없음.

3.445821
6 · combined

final best

좋았던 요소만 조합. low smoothing, bigram 0.58, trigram 0.30.

3.406207
Improvement: 0.385550 lower val_bpb · best candidate: combined-58-30
Traceability
08 / 11
AC tree as event store

실험이 어떻게 발전했는지 재생할 수 있다

AC tree, agent action, experiment ledger가 서로를 검증하는 research trace가 된다.

Event stream

행동 기록

interview, seed repair, run, sub-AC verification, evaluate가 session/cursor로 이어진다.

AC tree

검증 분해

AC 1-9가 dependency graph처럼 닫힌다. AC5는 ledger completeness와 baseline-only 방지로 다시 갈라졌다.

Experiment ledger

실험 진화

각 후보의 command, changed files, val_bpb, conclusion이 row로 남는다.

Agent evidence

누가 왜 했나

후보를 실행한 이유와 실패/개선 판정이 output report로 남는다.

Formal evaluate

종료 판정

command 실행, metric 계산, fixed-file boundary, forbidden output 부재를 다시 확인한다.

Observed run

9/9 AC

Seed grade A -> Run complete -> Evaluate APPROVED, semantic score 0.86.

Plugin Philosophy
09 / 11
Fat skill, domain expertise

좋은 plugin은 명령이 아니라 판단 기준을 담는다

01

Metric

최적화 방향과 fallback parser를 명시한다.

02

Boundary

train.py만 editable, program.md와 prepare.py는 fixed.

03

Ledger

command, changed files, metric, conclusion을 남긴다.

04

Validity

non-zero, traceback, timeout, missing metric은 invalid.

05

Seed policy

seed.md는 brief, saved Seed path는 runtime-owned.

06

Anti-fake

baseline-only report를 성공으로 보지 않는다.

Research Loop
10 / 11
Method

반복되는 루프, 누적되는 증거

Interview

불명확한 요구사항과 실패 조건을 닫는다.

Execution

후보를 실제 코드 변경과 command로 실행한다.

Evaluate

metric과 ledger가 기준을 만족하는지 평가한다.

Reflect

실패하면 contract 또는 실행 계획을 고쳐 재시도한다.

Interview
Execution
Evaluate
Reflect
Closing
11 / 11

자동 연구의
완료 조건은
승인이 아니라 증거다.

Summary
End
01

Plugin

fat skill은 연구 도메인의 판단 기준을 Seed contract로 운반한다.

02

Autoresearch

후보 실험과 metric 비교를 ledger로 남겨 baseline-only를 막는다.

03

Ouroboros

interview, execution, evaluate, reflect로 연구 자동화를 검증 가능한 루프로 닫는다.

Left/Right: slides | B: static | Esc: index