AdvSim2Real: 웹 세계 모델에서 적응형 프롬프트 인젝션에 맞서 웹 에이전트 학습하기
프리프린트는 웹 에이전트, 과제 커리큘럼, 적응형 공격자를 함께 학습시킵니다. 보고된 보안성 향상은 웹 과제 150개를 시뮬레이션한 결과입니다.
TL;DR
- AdvSim2Real은 고정된 웹 세계 모델 안에서 에이전트와 과제 커리큘럼, 인젝션 공격자를 함께 학습합니다.
- 저자들은 웹 과제 150개에서 미학습 공격자를 상대로 과제 완료율이 상대적으로 33.6% 높아졌다고 보고했습니다.
- 해당 보안성 수치는 시뮬레이터 기반입니다. 논문은 실제 브라우저로의 역량 전이도 보고하지만, 독립 평가는 없습니다.
이 연구는 제3자 웹페이지에 삽입된 지시가 페이지의 과제 관련 정보와 조작 요소를 그대로 둔 채 에이전트의 목표를 바꿀 수 있다는 문제를 다룹니다. AdvSim2Real은 고정된 웹 세계 모델에서 과제 커리큘럼, 인젝션 공격자, 에이전트를 함께 진화시킵니다. [arXiv; Hugging Face Papers.] [1] [2]
웹 과제 150개에서 저자들은 미학습 공격자를 상대로 기본 에이전트보다 과제 완료율이 상대적으로 33.6% 높아졌다고 보고했습니다. 초록에는 역량 향상이 실제 브라우저로 이어졌다고 적혀 있지만, 주요 보안성 수치는 시뮬레이션 평가에서 나왔습니다. [arXiv; Hugging Face Papers.] [1] [2]
Why it matters
웹 에이전트 보안은 과제에 필요한 웹페이지 정보를 버리지 않으면서 악의적인 지시를 처리하는 데 달려 있습니다. 이 프리프린트는 적응형 학습 접근을 시험하지만, 시뮬레이터 보안성 수치와 독립 재현의 부재는 해석의 범위를 제한합니다.
Editor's note
프리프린트입니다. 33.6%는 시뮬레이션 과제 150개에서 저자들이 보고한 상대적 수치입니다. TODO-review: “web world model”의 한국어 용어를 확인하세요.