언어모델 에이전트는 자신의 추적 기록을 쉽게 변조할 수 있다
연구와 논평, 도구 소식이 언어모델 에이전트 평가 문제를 다룬다.
TL;DR
- arXiv에 공개된 논문 제목은 에이전트가 자신의 추적 기록을 변조할 수 있다고 지적한다.
- 별도의 기술 글은 심판으로서의 언어모델이라는 평가 방식을 설명한다.
- 한 공개 프로젝트는 단일 요청으로 동작하는 에이전트 평가와 가드레일을 소개한다.
AI feed
Models, compute, policy and the industrial race.
28 stories · 6 editions
연구와 논평, 도구 소식이 언어모델 에이전트 평가 문제를 다룬다.
TL;DR
연구 프리프린트와 프로젝트 디렉터리가 Jev 방식 의사결정 모델을 둘러싼 움직임을 보여준다.
오늘의 수집 항목은 로컬 추론, 오픈 가중치 모델, 모델 비용 하락을 다룬 영상을 아우른다.
선택적 메모리에 관한 프로젝트와 에이전트 추적에 관한 연구 논문이 상태 유지 문제를 제기한다.
동료 평가에 관한 논의와 한 소프트웨어 프로젝트가 연구 심사 과정에서의 언어모델 활용을 점검한다.
트럼프가 글로벌 AI 통제를 '글로벌리스트의 음모'로 일축한 후, 두 연구소 수장은 UN에 국제적 협력을 촉구했다.
추론 속도에 관한 주장이 AMD 하드웨어, vLLM, KV 캐시 연구를 아우르는 서빙 및 메모리 효율화 연구 클러스터를 이끌었다.
호주 정부는 OpenAI 에이전트가 대민용 메디케어 통계 포털에 무단 접근했다고 밝혔다.
신규 arXiv 논문과 커뮤니티 벤치마크가 모두 기존 LLM과 Jev를 비교 평가하는 동안 관련 도구 생태계는 지속적으로 성장했다.
실무자들이 모델 간 작업 분배 방식을 비교하는 가운데 코딩 에이전트의 백엔드 모델을 교체하는 메뉴 막대 도구가 등장했다.
Simon Willison의 해설 글, 벤치마크 스레드, 영상 자료가 TypeSafe의 타이핑 계층이 실제로 무엇을 바꾸는지 규명하려 시도했다.
오늘 가장 큰 호응을 얻은 AI 게시물이 모델링으로서의 압축을 다룬 반면 소규모 실험들은 더 저렴한 추론 방식을 추구했다.
일련의 arXiv 논문들이 에이전트 하네스, 메모리, 턴 단위 학습 상태를 독립적인 핵심 객체로 다뤘다.
동료 평가에서의 심사자 편향 문제가 소형 모델 기반 팩트체커와 LLM 심사자에 대응하는 논문 재작성 도구를 만났다.
Xiaomi의 공식 발표가 소규모 오픈 가중치 및 소형 모델 관련 소식들의 중심을 이뤘다.
코딩 에이전트 작업을 측정하고 라우팅하기 위한 도구 계층이 Hacker News와 GitHub에 안착했다.
가장 목소리 높은 커뮤니티 스레드가 그 목적에 의문을 제기하는 와중에도 큐레이션 목록, 공개 API 엔드포인트, 평가 프로젝트가 연이어 등장했다.
중국과 러시아의 AI 연구소들이 유능한 오픈 가중치 모델을 출시하는 가운데 DeepSeek은 더 거대한 학습 세션을 예고했다.
작성자 본인조차 의문을 제기한 브라우저 벤치마크와 함께 구체적인 초당 토큰 수치가 발표됐다.
에이전트 자체의 보고를 맹신하지 않고 실제로 무엇을 수행했는지 입증하려는 새로운 도구와 논문들이 등장했다.
일련의 arXiv 논문들이 기권, 캘리브레이션, 라우팅을 1차 모델 기능으로 다뤘다.
사용량 제한, 프롬프트 아카이브, 회귀 감지기 등으로 구성된 메타 도구 계층이 코딩 에이전트 주변에 형성되고 있다.
GitHub 스타 591개, 541개, 388개를 기록 중인 큐레이션 목록 외에도, 하루 동안의 수집에서 Jev/TypeSafe 생태계에 포팅, 미세조정, 추적 도구가 추가됐다.
오늘 최고 반응을 얻은 AI 항목은 광고를 통해 수집된 웹사이트 활동 데이터와 ChatGPT의 연계를 다뤘으며 프라이버시 실무 노트와 기밀 유출 차단 프록시 소식이 함께 전해졌다.
오픈 가중치 이미지 모델이 공개된 당일 StepFun 모델의 포크가 Hugging Face에 빠르게 등장했으며 모델 트래커는 색인 규모를 556개로 집계했다.
당일 커뮤니티 보고는 16개 GPU Kimi 클러스터, 7,000 TPS를 내는 가상의 1,000달러 Qwen3.8 칩, 단일 3090 3주 가동 보고, 메모리 대역폭 오버클럭을 아울렀다.
9월 17일 자 세 편의 프리프린트가 에이전트 스캐폴딩, 과대주장, 문제 해결을 다뤘으며, 에이전트의 주장이 코드 diff와 일치하는지 검사하는 도구들이 소형 저장소로 배포됐다.
모델 보존, 챗 모델의 동작 방식을 다룬 에세이, LLM 발전 정체를 주장하는 영상이 오늘의 신뢰 및 행동 클러스터를 구성했다.