Harness-Zero: 에이전트를 하네스로 활용한 하네스 증류
일련의 arXiv 논문들이 에이전트 하네스, 메모리, 턴 단위 학습 상태를 독립적인 핵심 객체로 다뤘다.
TL;DR
- Harness-Zero라는 제목의 arXiv 논문은 에이전트를 하네스로 활용하는 접근법을 통해 에이전트 하네스 증류를 정식화했다.
- 후속 논문들은 에이전트 하네스의 정규화된 재귀적 자기 개선과 에이전트 메모리의 파레토 프론티어를 매핑하는 벤치마크를 제안했다.
- 다른 두 논문은 신뢰성을 다루며 다중 턴 도구 사용의 학습 가능 상태를 진단하는 임계 상태 강화학습(Critical-State RL)과 장기 에이전트 상호작용에서의 창발적 담합을 분석했다.
arXiv 논문 Harness-Zero는 에이전트 자체를 하네스로 삼는 접근법으로 에이전트 하네스 증류를 다뤘고, 연계 연구는 에이전트 하네스의 정규화된 재귀적 자기 개선 방안을 제시했다. [1] [2]
세 번째 논문인 DolphinBench는 에이전트 메모리의 파레토 경계를 매핑하는 기법을 설명했으며, 임계 상태 강화학습은 다중 턴 도구 사용 시 학습 가능한 상태를 진단했다. [3] [4]
안전 측면에서는 장기 LLM 에이전트 상호작용에서 발생하는 창발적 담합을 다룬 arXiv 연구가 실렸고, GitHub에서는 코딩 에이전트를 위한 영구 인지 메모리 계층 프로젝트가 제안됐다. [5] [6]
Why it matters
하네스, 메모리, 학습 상태를 명시적인 설계 객체로 다루는 접근법은 단순한 에이전트 데모를 측정 및 개선 가능한 체계적인 시스템으로 전환시키는 바탕이 된다.
Editor's note
모든 arXiv 항목은 초록 수준에서 인용되었으며 동료 평가를 거치지 않았다. GitHub 메모리 계층은 자체 설명 프로젝트 페이지에 근거한다.