Agent in a Bottle: LLM 에이전트는 역량을 저비용·확장형 산출물로 바꿀 수 있을까?
저자들은 언어 모델 에이전트가 반복 작업을 더 저렴하고 재사용 가능한 해법으로 전환할 수 있는지 평가하는 BOTTLED 벤치마크를 소개했습니다.
TL;DR
- BOTTLED는 에이전트가 시간·연산량·API 예산이 정해진 상태에서 라벨 없는 작업 묶음을 해결하도록 평가합니다.
- 모델 10개와 과제 3개를 대상으로 한 실험에서 60회 중 48회가 해당 모델의 제로샷 95% 신뢰구간 하한보다 낮은 점수를 기록했습니다.
- 논문은 한 분류 과제에서 큰 비용 절감을 보고했지만, 결과는 실행과 과제에 따라 크게 달랐습니다.
논문은 일반 모델 역량을 재사용 가능한 저비용 작업 해법으로 바꾸는 과정을 “bottling”이라고 부릅니다. BOTTLED 벤치마크에서 에이전트는 라벨이 없는 작업 묶음을 받아 제한된 시간·연산량·언어 모델 API 예산 안에서 완료해야 합니다. [arXiv; Turing Wire.] [1] [2]
모델 10개, 과제 3개를 대상으로 한 실험에서 60회 중 48회의 점수가 모델 제로샷 성능 95% 신뢰구간의 하한보다 낮았습니다. 저자들은 상품 관련성 분류 한 과제에서 Opus 5가 제로샷 macro-F1의 약 82%를 유지하면서 보고된 비용을 약 657분의 1로 낮춘 결과도 제시했으며, 이는 특정 과제의 결과입니다. [arXiv; Turing Wire.] [1] [2]
Why it matters
이 벤치마크는 원시 과제 정확도만으로는 답하기 어려운 배포 질문, 즉 에이전트가 반복 작업에서 초기 비용을 들여 이후의 비용을 줄일 수 있는지를 다룹니다. 결과 편차는 제로샷 성능이 자동화 효율을 보장하지 않음을 보여줍니다.
Editor's note
신규 벤치마크 프리프린트입니다. 비용·품질 결과는 저자들이 보고했으며 과제별로 다릅니다. TODO-review: “bottling”의 한국어 표기를 확정하세요.