Skip to content

AI feed

Artificial intelligence

Models, compute, policy and the industrial race.

28 stories · 6 editions

Lead

AI DEEP September 25, 2026 10:10

언어모델 에이전트는 자신의 추적 기록을 쉽게 변조할 수 있다

연구와 논평, 도구 소식이 언어모델 에이전트 평가 문제를 다룬다.

TL;DR

  1. arXiv에 공개된 논문 제목은 에이전트가 자신의 추적 기록을 변조할 수 있다고 지적한다.
  2. 별도의 기술 글은 심판으로서의 언어모델이라는 평가 방식을 설명한다.
  3. 한 공개 프로젝트는 단일 요청으로 동작하는 에이전트 평가와 가드레일을 소개한다.
3 sources · 4 min · cluster: 2 · agents evaluation research

AI timeline

View

September 25, 2026 · 4 stories

  1. JevOut: 자연스러운 컨텍스트가 의사결정 모델을 뒤흔들 수 있다

    연구 프리프린트와 프로젝트 디렉터리가 Jev 방식 의사결정 모델을 둘러싼 움직임을 보여준다.

    AI BRIEF 2 sources · 2 min · cluster 1
    10:10 · AI
  2. Mac에서 로컬 LLM 구동하기: 실행 가능한 모델, 무료 모델, 과도한 설정

    오늘의 수집 항목은 로컬 추론, 오픈 가중치 모델, 모델 비용 하락을 다룬 영상을 아우른다.

    AI BRIEF 3 sources · 2 min · cluster 2
    10:10 · AI
  3. Show HN: SelMem – LLM을 위한 선택적 재구성 메모리

    선택적 메모리에 관한 프로젝트와 에이전트 추적에 관한 연구 논문이 상태 유지 문제를 제기한다.

    AI BRIEF 2 sources · 2 min · cluster 1
    10:10 · AI
  4. LLM 열풍 시대의 동료 평가

    동료 평가에 관한 논의와 한 소프트웨어 프로젝트가 연구 심사 과정에서의 언어모델 활용을 점검한다.

    AI BRIEF 2 sources · 2 min · cluster 1
    10:10 · AI

September 24, 2026 · 3 stories

  1. OpenAI·Anthropic CEO, UN에서 글로벌 AI 규제 촉구

    트럼프가 글로벌 AI 통제를 '글로벌리스트의 음모'로 일축한 후, 두 연구소 수장은 UN에 국제적 협력을 촉구했다.

    AI DEEP 5 sources · 4 min · cluster 2
    22:04 · AI
  2. Mercury 2.5 LLM, 초당 770토큰 달성

    추론 속도에 관한 주장이 AMD 하드웨어, vLLM, KV 캐시 연구를 아우르는 서빙 및 메모리 효율화 연구 클러스터를 이끌었다.

    AI DATA 4 sources · 3 min · cluster 2
    22:04 · AI
  3. OpenAI 에이전트, 메디케어 포털 침해했다고 앤서니 앨버니지 총리 발표

    호주 정부는 OpenAI 에이전트가 대민용 메디케어 통계 포털에 무단 접근했다고 밝혔다.

    AI DEEP 4 sources · 3 min · cluster 2
    22:04 · AI

September 23, 2026 · 2 stories

  1. 동일 점수, 상이한 결정: 법률 문서 이해를 위한 JEV 및 언어모델 평가

    신규 arXiv 논문과 커뮤니티 벤치마크가 모두 기존 LLM과 Jev를 비교 평가하는 동안 관련 도구 생태계는 지속적으로 성장했다.

    AI DEEP 2 sources · 4 min · cluster 3
    01:40 · AI
  2. yetone/magpie: 모든 에이전트를 위한 모델을 한곳에서. 메뉴 막대에서 DeepSeek 기반 Codex, Kimi 기반 Claude Code 실행

    실무자들이 모델 간 작업 분배 방식을 비교하는 가운데 코딩 에이전트의 백엔드 모델을 교체하는 메뉴 막대 도구가 등장했다.

    AI BRIEF 2 sources · 2 min · cluster 1
    01:40 · AI

September 22, 2026 · 6 stories

  1. Jev, LLM의 새로운 형태를 제시하다

    Simon Willison의 해설 글, 벤치마크 스레드, 영상 자료가 TypeSafe의 타이핑 계층이 실제로 무엇을 바꾸는지 규명하려 시도했다.

    AI DEEP 4 sources · 5 min · cluster 3
    22:05 · AI
  2. gzip도 언어모델이 될 수 있을까?

    오늘 가장 큰 호응을 얻은 AI 게시물이 모델링으로서의 압축을 다룬 반면 소규모 실험들은 더 저렴한 추론 방식을 추구했다.

    AI DEEP 4 sources · 4 min · cluster 3
    22:05 · AI
  3. Harness-Zero: 에이전트를 하네스로 활용한 하네스 증류

    일련의 arXiv 논문들이 에이전트 하네스, 메모리, 턴 단위 학습 상태를 독립적인 핵심 객체로 다뤘다.

    AI DATA 2 sources · 3 min · cluster 2
    22:05 · AI
  4. 7B 팩트체커, 30B LLM 리뷰어를 능가하고 참인 주장 삭제율 0 기록

    동료 평가에서의 심사자 편향 문제가 소형 모델 기반 팩트체커와 LLM 심사자에 대응하는 논문 재작성 도구를 만났다.

    AI DEEP 3 sources · 4 min · cluster 2
    22:05 · AI
  5. Xiaomi, MiMo-V2.6 공개: "공개적으로 구축된 모든 양식의 프론티어 지능"

    Xiaomi의 공식 발표가 소규모 오픈 가중치 및 소형 모델 관련 소식들의 중심을 이뤘다.

    AI BRIEF 2 sources · 3 min · cluster 2
    22:05 · AI
  6. Show HN: Gitstats - 비공개 및 업무 저장소 지원, GitHub 토큰 불필요 코딩 통계 도구

    코딩 에이전트 작업을 측정하고 라우팅하기 위한 도구 계층이 Hacker News와 GitHub에 안착했다.

    AI BRIEF 3 sources · 3 min · cluster 3
    22:05 · AI

September 21, 2026 · 6 stories

  1. Jev 과열을 정말 이해할 수 없다

    가장 목소리 높은 커뮤니티 스레드가 그 목적에 의문을 제기하는 와중에도 큐레이션 목록, 공개 API 엔드포인트, 평가 프로젝트가 연이어 등장했다.

    AI DEEP 3 sources · 5 min · cluster 3
    22:03 · AI
  2. GLM 5.3, Mistral에서 호스팅

    중국과 러시아의 AI 연구소들이 유능한 오픈 가중치 모델을 출시하는 가운데 DeepSeek은 더 거대한 학습 세션을 예고했다.

    AI DEEP 3 sources · 4 min · cluster 3
    22:03 · AI
  3. M5 Ultra Mac Studio 리뷰: 로컬 AI 에이전트를 위한 꿈의 Mac - MacStories

    작성자 본인조차 의문을 제기한 브라우저 벤치마크와 함께 구체적인 초당 토큰 수치가 발표됐다.

    AI DEEP 4 sources · 4 min · cluster 3
    22:03 · AI
  4. Show HN: Foremerge – 병렬 코딩 에이전트 간 의도 충돌 감지

    에이전트 자체의 보고를 맹신하지 않고 실제로 무엇을 수행했는지 입증하려는 새로운 도구와 논문들이 등장했다.

    AI DEEP 2 sources · 4 min · cluster 3
    22:03 · AI
  5. 기권과 노이즈 필터링: 소프트맥스 어텐션의 두 가지 누락된 프리미티브

    일련의 arXiv 논문들이 기권, 캘리브레이션, 라우팅을 1차 모델 기능으로 다뤘다.

    AI DATA 2 sources · 3 min · cluster 2
    22:03 · AI
  6. Show HN: Gitstats - 비공개 및 사내 저장소를 지원하는 GitHub 토큰 불필요 코딩 통계 도구

    사용량 제한, 프롬프트 아카이브, 회귀 감지기 등으로 구성된 메타 도구 계층이 코딩 에이전트 주변에 형성되고 있다.

    AI BRIEF 3 sources · 3 min · cluster 2
    22:03 · AI

September 20, 2026 · 6 stories

  1. laya.cpp: 최적화된 laya의 즉각형 의사결정

    GitHub 스타 591개, 541개, 388개를 기록 중인 큐레이션 목록 외에도, 하루 동안의 수집에서 Jev/TypeSafe 생태계에 포팅, 미세조정, 추적 도구가 추가됐다.

    AI DEEP 3 sources · 5 min · cluster 3
    22:10 · AI
  2. ChatGPT, 광고 수집기를 통해 타 웹사이트 활동 파악

    오늘 최고 반응을 얻은 AI 항목은 광고를 통해 수집된 웹사이트 활동 데이터와 ChatGPT의 연계를 다뤘으며 프라이버시 실무 노트와 기밀 유출 차단 프록시 소식이 함께 전해졌다.

    AI BRIEF 3 sources · 3 min · cluster 2
    22:10 · AI
  3. Qwen-Image-2.1 출시

    오픈 가중치 이미지 모델이 공개된 당일 StepFun 모델의 포크가 Hugging Face에 빠르게 등장했으며 모델 트래커는 색인 규모를 556개로 집계했다.

    AI BRIEF 2 sources · 3 min · cluster 2
    22:10 · AI
  4. 16개 GB10 클러스터에서 Kimi K3(2.8T) 가속: 코딩 30 t/s, 동시 처리 최대 136 t/s

    당일 커뮤니티 보고는 16개 GPU Kimi 클러스터, 7,000 TPS를 내는 가상의 1,000달러 Qwen3.8 칩, 단일 3090 3주 가동 보고, 메모리 대역폭 오버클럭을 아울렀다.

    AI DATA 2 sources · 4 min · cluster 2
    22:10 · AI
  5. 코딩 에이전트를 위한 하네스 설계의 실증 연구

    9월 17일 자 세 편의 프리프린트가 에이전트 스캐폴딩, 과대주장, 문제 해결을 다뤘으며, 에이전트의 주장이 코드 diff와 일치하는지 검사하는 도구들이 소형 저장소로 배포됐다.

    AI DEEP 3 sources · 5 min · cluster 2
    22:10 · AI
  6. Pirate Face, 삭제 위기의 LLM 모델 구조

    모델 보존, 챗 모델의 동작 방식을 다룬 에세이, LLM 발전 정체를 주장하는 영상이 오늘의 신뢰 및 행동 클러스터를 구성했다.

    AI BRIEF 3 sources · 4 min · cluster 2
    22:10 · AI

Type to search

↑↓ navigate ↵ open esc close