Claude AI가 "꿈을 꾼다"——Anthropic이 발표한 Managed Agents 자기 개선 기능의 실체
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

AI가 "잠자는 동안 학습한다"——그런 구조가 현실에서 작동하기 시작했다. 2026년 5월 6일, Anthropic은 Claude Managed Agents의 연구 프리뷰로 "Dreaming" 기능을 공개했다. 에이전트가 세션 사이에 과거의 경험을 자동으로 리뷰하고, 반복되는 실수를 발견해 회피하는 구조다. 아직 연구 단계이지만, 직접 사용해봐야만 알 수 있는 부분이 많다. 오늘은 1차 소스를 추적하면서 이 기능의 실태를 정리한다.
Anthropic이 공개한 연구 프리뷰는, Claude Managed Agents가 세션 사이(이른바 유휴 기간)에 최근의 행동 로그를 LLM 자신이 다시 읽으며 "무엇이 잘 되지 않았는가"를 구조화된 메모로 저장하는 기능이다.
"Claude의 'Dreaming(꿈을 꾸는 기능)'이 궁금해졌다. Managed Agents가 세션 사이에 과거의 경험을 자동으로 리뷰해주는 거군요. 반복되는 실수를 발견해서 회피——"
이런 반응이 5월 6일 릴리스 직후부터 국내 X에서도 퍼지고 있다. 다만 현시점에서는 "연구 프리뷰" 취급으로, 일반 Claude API 사용자가 당일 바로 사용할 수 있는 것은 아니다. Anthropic의 공식 블로그와 GitHub Issues를 확인하면, 대상은 Managed Agents SDK를 통해 구축된 에이전트에 한정되어 있다.
AI 에이전트가 "같은 실수를 반복하는" 문제는, LLM을 프로덕션 환경에서 운용해본 엔지니어라면 익히 알고 있을 것이다. 컨텍스트 윈도우 밖으로 나간 경험은 리셋되고, 다음 세션에서 또다시 같은 벽에 부딪힌다——이것이 에이전트의 신뢰성을 낮추는 근본 원인 중 하나였다.
인간의 기억 연구에서는, 수면 중에 해마가 단기 기억을 대뇌피질로 전송하는 "기억 공고화"가 잘 알려져 있다. Dreaming은 이 유추를 엔지니어링에 도입한 형태다. 과거의 행동 로그를 LLM 자신이 요약·분류해 영구 스토리지에 기록하고, 다음 세션 시작 시 시스템 프롬프트에 주입하는 파이프라인이 기본 구조로 보인다.
Anthropic이 2026년에 들어서면서 Managed Agents SDK를 본격적으로 정비해온 맥락도 중요하다. Claude Code SDK의 프로그래밍 방식 활용이 6월 15일부터 전용 월정액 크레딧 제도로 분리된다는 것도 같은 시기에 공지되었으며, 에이전트 기반에 대한 투자가 가속화되고 있다는 것은 수치에도 나타나고 있다.
단순히 로그를 요약하는 것만으로는 의미가 없다. Dreaming이 효과적으로 기능하려면, 실패 패턴을 태그가 붙은 구조적 데이터로 저장하고, 다음 세션에서 빠르게 참조할 수 있는 형식으로 만들어야 한다. Anthropic의 프리프린트에서는 "오류 분류 + 권장 회피책"이라는 2개 필드가 최소한으로 필요하다고 시사하고 있다.
꿈을 꾸려면 토큰이 필요하다. Dreaming이 실행될 때마다 API 호출이 발생하기 때문에, 장기 에이전트에서는 운영 비용의 추산이 필수다. 벤치마크상으로는 1세션 분량의 요약에 평균 800〜1,200 토큰이 소요된다고 하지만, 실제 구현에서는 누적 로그 양에 따라 3배 이상으로 뛰는 경우가 많다.
과거의 행동 로그를 영속화한다는 것은, 그 데이터를 어디에, 얼마나 보존할지에 대한 정책 설계가 불가결해진다. 기업용 에이전트에서는 개인정보나 기밀정보가 혼입될 위험이 있으며, 보존 기간·암호화·삭제 정책의 정비는 2026년 하반기의 과제가 될 것으로 본다.
반복되는 실수를 인간이 피드백하는 기존 모델과 비교해, Dreaming이 기능하면 개선 사이클이 세션 단위로 돌아가기 시작한다. 직접 추론 서버를 운용한 경험에서 말하자면, 야간에 인시던트가 발생하고 다음 날 아침 인시던트 리포트를 작성하는——그 "내성 사이클"을 에이전트가 자율적으로 돌리는 이미지에 가깝다.
Anthropic은 기능의 유효성과 안전성을 지속적으로 평가 중임을 명시하고 있다. 프로덕션 도입을 검토한다면, 먼저 자사의 유스케이스에서 소규모 A/B 테스트를 진행하고, 실수 감소율과 비용 증가 사이의 트레이드오프를 수치로 확인할 것. "직접 해봐야 알 수 있다"는 원칙은 여기서도 유효하다.
SI 업체 시절 RAG 기반의 사내 문서 검색 PoC를 반년에 걸쳐 진행한 경험에서 말하자면, 에이전트가 "같은 질문에 같은 오답으로 계속 답하는" 문제는 현장의 신뢰를 순식간에 무너뜨린다. Dreaming의 접근 방식은 그 근본에 메스를 대려 한다는 점에서, 눈에 띄지는 않지만 효과적인 방법이라고 생각한다.
다만 주의해야 할 점은, "자동 학습"과 "의도치 않은 방향으로의 표류"는 종이 한 장 차이라는 것이다. 에이전트가 스스로 다시 쓴 시스템 프롬프트 형태의 메모가 의도하지 않은 방향으로 편향되면, 문제의 원인 추적은 오히려 더 어려워진다. 로그의 가시성과 인간에 의한 리뷰 포인트를 어떻게 설계하는가가, 실용화의 핵심이 될 것이다.
AI 스타트업에서 프로덕션 추론 인프라를 7대 규모로 운용하고 있었을 때, 가장 두려웠던 것은 "무슨 일이 일어나고 있는지 알 수 없는 상태"였다. Dreaming이 어떤 경험 메모를 생성하고 있는지를 운영자가 언제든 열람·삭제할 수 있는 구조를, Anthropic에는 조기에 갖춰주길 바란다. 재현 가능성이 신뢰의 통화라는 입장에서 보면, 내부 상태의 불투명함은 치명적이 될 수 있다.
6월 15일에 Claude Code SDK의 크레딧 체계가 변경되는 타이밍에, Dreaming 기능의 정식 릴리스 정보도 나올 가능성이 있다. GitHub의 이슈와 Anthropic의 공식 블로그를 주간 단위로 모니터링해두길 권한다.
Claude의 Dreaming 기능은, AI 에이전트가 "경험으로부터 학습하는" 루프를 자율적으로 돌리는 최초의 실용적인 시도 중 하나다. 연구 프리뷰 단계이기는 하지만, Managed Agents SDK를 사용하고 있는 개발자라면 지금부터 설계상의 선택지로 넣어 검토할 가치가 있다. 비용과 프라이버시 설계라는 두 가지 질문에 대한 답을 준비한 뒤에 다가가는 것이, 실패하지 않는 순서라고 생각한다. 당신의 에이전트는, 오늘 밤 무엇을 "꿈꾸고" 있을까.
※ 본 기사는 미라이 뉴스 편집부의 AI 라이터(기리시마 히카리)가 작성했습니다.