AI Paper Digest

어제 · 2편

OpenKnowledge – Obsidian/Notion의 오픈소스 AI-first 대안

Git 기반 동기화와 Claude/Codex/Cursor 연동을 내장한 로컬 우선 마크다운 에디터로, AI 에이전트의 두 번째 뇌(LLM Wiki)로 활용할 수 있는 오픈소스 도구다.

성경을 RAG Database로 구축한 프로젝트: Cross Canon

성경 전체를 RAG(검색 증강 생성) 데이터베이스로 인덱싱해 주제나 키워드로 관련 성경 구절을 의미론적으로 검색할 수 있는 웹 서비스다. 종교 텍스트에 RAG를 적용한 실용적 예시로, 유사한 프로젝트를 만들려는 개발자에게 참고가 된다.

6월 24일 (수) · 5편

[Agent]arXiv

Unfireable Safety Kernel: AI 에이전트를 위한 Execution-Time AI Alignment

AI 에이전트가 자신의 안전장치를 우회할 수 없도록, 에이전트 프로세스 바깥에 수학적으로 증명된 강제 통제 게이트를 배치하는 아키텍처

[Agent]HN

RubyLLM: 주요 AI 프로바이더를 모두 지원하는 Ruby 프레임워크

OpenAI, Claude, Gemini 등 주요 AI 프로바이더를 단일 인터페이스로 통합한 Ruby 프레임워크로, Rails 통합과 에이전트 기능까지 지원해 Ruby 개발자가 AI 기능을 빠르게 붙일 수 있다.

[Eval]arXiv

Function Calling을 넘어서: Tool-Environment 신뢰성 문제 하에서의 Tool-Using Agent 벤치마크

실제 환경처럼 API가 망가지거나 결과가 이상할 때 LLM 에이전트가 얼마나 잘 버티는지 측정하는 벤치마크 ToolBench-X 공개.

[RAG]HN

Haystack: 프로덕션 수준의 AI Agent와 RAG를 위한 오픈소스 프레임워크

deepset이 만든 오픈소스 AI 오케스트레이션 프레임워크로, LangChain의 대안으로 주목받고 있으며 모듈형 파이프라인 방식으로 RAG·Agent·멀티모달 앱을 프로덕션까지 구축할 수 있다.

[Agent]HN

Qwen-AgentWorld: 범용 에이전트를 위한 Language World Model

Alibaba Qwen 팀이 AI 에이전트가 행동 결과를 미리 시뮬레이션할 수 있는 'Language World Model'을 공개했다. 에이전트 훈련과 실행 경로 검증에 새로운 패러다임을 제시하는 연구다.

6월 23일 (화) · 5편

[Agent]arXiv

SHERLOC: Code Repair Agent를 위한 구조화된 Diagnostic Localization 프레임워크

버그 위치만 알려주는 게 아니라 '왜, 어떻게 고쳐야 하는지'까지 진단 리포트를 생성해서 코드 수정 에이전트의 성능을 높이는 training-free 프레임워크

[Agent]HN

peerd – 브라우저에서 완전히 실행되는 AI Agent Harness

백엔드 서버 없이 Chrome/Firefox 확장 프로그램으로만 동작하는 AI 에이전트 실행 환경으로, 브라우저 탭을 직접 조작하고 WASM Linux VM까지 구동할 수 있어 프라이버시와 보안을 동시에 챙길 수 있다.

[Agent]arXiv

SAFARI: Active Investigation 기반의 장거리 Agentic Fault Attribution 확장

수백만 토큰 넘는 에이전트 실행 로그에서 버그 발생 지점을 찾아내는 도구 기반 진단 프레임워크

[Fine-tuning]HN

Neural Particle Automata: 자기조직화 파티클 시스템을 학습하는 신경망 모델

고정된 격자 대신 움직이는 파티클 위에서 동작하는 Neural Cellular Automata의 확장 버전으로, 형태 생성·포인트 클라우드 분류·텍스처 합성 등 다양한 작업에서 자기조직화 동작을 학습할 수 있다.

[Cost]HN

Anthropic이 나를 Claude Code에서 밴했는데 어떻게 해야 할지 모르겠다

VPN 사용 또는 동일 카드 재사용으로 Anthropic Claude Code 계정이 이유 불명으로 정지당한 사용자의 사례와, 커뮤니티에서 나온 대안 및 우회 방법 논의.

6월 22일 (월) · 6편

[Agent]arXiv

Self-Compacting Language Model Agents: Rubric 기반 적응형 Context 압축

LLM 에이전트가 스스로 '지금 요약해도 되는지'를 판단하는 rubric을 추가하면, 파인튜닝 없이도 고정 주기 요약보다 정확도는 높고 비용은 30~70% 낮아진다.

[Eval]HN

Prompt Injection의 본질은 Role Confusion이다

LLM이 시스템 프롬프트, 사용자 입력, 툴 출력을 구분하지 못하는 구조적 결함이 prompt injection의 근본 원인이라는 ICML 2026 논문으로, 현재 LLM 보안 아키텍처의 한계를 명확히 분석한다.

[Agent]arXiv

Attention을 활용한 악성 Agent Skill 탐지: Locate-and-Judge

LLM 에이전트 마켓플레이스에 퍼진 악성 Skill 파일을 Attention 기반으로 저렴하게 탐지하는 2단계 파이프라인

[Cost]HN

Moebius: 0.2B 파라미터로 10B급 성능을 내는 이미지 인페인팅 모델

FLUX.1-Fill-Dev(11.9B) 대비 2% 미만의 파라미터(0.22B)로 동급 또는 그 이상의 인페인팅 품질을 달성하면서 추론 속도는 15배 빠른 경량 모델. 소비자용 GPU나 엣지 디바이스에서도 고품질 인페인팅이 가능해진다.

[Eval]HN

LG 스마트 TV 앱의 절반 가까이에 Residential Proxy SDK가 심어져 있다

6,038개의 LG·Samsung 스마트 TV 앱을 스캔했더니 2,058개에서 사용자의 IP를 몰래 팔아 트래픽을 중계하는 Residential Proxy SDK가 발견됐다. TV는 컴퓨터처럼 감시받지 않아서 프록시 호스트로 거의 이상적인 환경이다.

[Agent]HN

Oak – AI 에이전트를 위해 설계된 Git 대안 VCS

AI 에이전트가 코드 작업을 더 효율적으로 수행할 수 있도록 설계된 새로운 버전 관리 시스템(VCS)으로, lazy mount, JSON-first CLI, 멀티 레포 에이전트 워크스페이스 등을 제공한다. 다만 커뮤니티에서는 Git 대비 실질적 우위가 충분히 증명되지 않았다는 회의적 반응이 많다.

6월 21일 (일) · 1편

[Agent]HN

Recall — Claude Code를 위한 완전 로컬 프로젝트 메모리 도구

Claude Code 세션이 끝날 때마다 프로젝트 컨텍스트를 처음부터 다시 설명해야 하는 문제를 외부 API 없이 로컬에서 해결하는 Python 기반 오픈소스 도구다.

6월 20일 (토) · 1편

[Agent]HN

Show HN: 거절 대신 펜 테스트를 수행하도록 post-training한 모델

Kimi K2.6 모델을 post-training해서 보안 거부 응답 없이 실제 취약점 스캔과 펜 테스트를 수행하는 CLI 도구 ArgusRed를 공개했다. 오픈 모델을 조금만 조정하면 AI 기반 해킹 도구를 누구나 만들 수 있다는 점에서 보안 커뮤니티에 논란이 되고 있다.