HomeZ - 배너 홈 이탈Claude Code 자동 모드는 기본적으로 위험한 명령의 89%를 차단합니다

Claude Code 자동 모드는 기본적으로 위험한 명령의 89%를 차단합니다

Anthropic은 더 이상 Claude Code 사용자에게 몇 분마다 “승인”을 클릭하라고 요구하지 않는다. 2026년 8월 14일부터 Claude Code 자동 모드가 Pro, Max, Team 요금제의 새 세션에 대한 기본 설정이 되며, 그동안 개발자들이 AI 코딩 에이전트와 상호작용하는 방식을 규정해 온 끊임없는 권한 요청 스트림을 대체한다. 회사는 이 전환을 뒷받침할 데이터가 있다고 말하지만, 개발자이자 연구자인 Simon Willison을 포함한 독립적인 논평은 이 이야기가 단순한 안전성 승리로 보기에는 더 미묘하다고 시사한다.

핵심 요약

  • Anthropic은 2026년 8월 14일부터 Claude Code Pro, Max, Team 요금제에 자동 모드를 기본값으로 설정한다.
  • 1,053명의 유료 사용자를 대상으로 한 테스트에서 자동 모드는 위험한 명령의 89%를 차단한 반면, 인간 테스터는 13.6%만 거부했다.
  • 독립 평가 기관인 Trajectory Labs는 자동 모드로 실행 중인 Claude Fable 5, Opus 5, Sonnet 5를 대상으로 720건의 간접 프롬프트 인젝션 공격을 수행했으며, 단 한 건도 성공하지 못했다.
  • Anthropic은 자동 모드 분류기가 도구 호출마다 사용하는 추가 토큰에 대해 더 이상 요금을 부과하지 않는다.
  • 분석가들은 여전히 탐지되지 않은 채 데이터를 유출할 수 있는 악성 서드파티 패키지 등 해결되지 않은 위험을 지적한다.

Anthropic, Claude Code 자동 모드를 기본값으로 전환

이번 전환은 Anthropic 엔지니어들이 공개적으로 이야기해 온 문제, 즉 확인 피로(confirmation fatigue)에 대한 답변이다. AI 에이전트의 워크플로우의 모든 단계를 사람에게 승인받는 것은 조심스러워 보이지만, 실제로는 사람들이 프롬프트를 제대로 읽지 않고 그냥 클릭하도록 학습시키는 효과를 낳는다. Anthropic에 따르면 자동 모드는 그 반복적인 승인 루프를, 각 도구 호출이 되돌릴 수 없거나 파괴적이거나 명백히 범위를 벗어난 행동인지 검사하는 분류기로 대체한다. 분류기가 어떤 것을 표시하면 Claude는 더 안전한 경로를 찾거나 다시 권한을 요청하는 방식으로 되돌아가며, 차단이 계속 쌓이면 전체 세션이 수동 승인 모드로 되돌아간다.

이번 롤아웃은 사용자나 관리자가 다른 권한 설정을 수동으로 고정해 두지 않은 한 Pro, Max, Team 요금제에 영향을 미친다. Anthropic은 또한 작은 재정적 마찰 요소를 제거하고 있다. 회사의 이번 변경에 대한 자체 블로그 게시물에 따르면, 앞으로는 분류기가 각 도구 호출에서 소비하는 추가 토큰에 대해 요금을 부과하지 않을 예정이다.

이것이 단순한 편의성을 넘어 왜 중요한가? Anthropic은 자동 모드가 이미 팀의 업무 방식을 바꾸고 있다고 말한다. 이를 사용하는 Team 및 Enterprise 고객은 수동 승인에 의존하는 고객보다 약 25% 더 많은 풀 리퀘스트를 배포하는 것으로 보고된다. 이는 의미 있는 생산성 신호이지만, 동시에 위험도 높인다. 더 많은 자율 코딩 활동은, 그 아래의 안전성 레이어가 견고하지 않을 경우 문제가 발생할 수 있는 기회도 더 많다는 뜻이기 때문이다.

자동 모드는 실제로 인간보다 더 많은 위험한 명령을 차단하는가?

Anthropic의 자체 테스트에 따르면 그렇다 — 그것도 큰 차이로. 회사는 1,053명의 유료 테스터를 대상으로 한 연구에서, 정상적인 세션 도중 평범한 권한 요청 프롬프트를 아무 말 없이 명백히 위험한 명령으로 바꿔치기했다. 모든 테스터는 동일한 시나리오를 보았다. 그 결과, 해로운 행동을 거부한 인간은 13.6%에 불과했다. 같은 명령을 대상으로 테스트한 자동 모드는 이를 89%의 비율로 차단했다.

세션이 길어질수록 격차는 더 벌어진다. Anthropic은 인간의 경계심이 50번째 프롬프트 이후에는 약 5% 수준으로 떨어졌다고 보고했는데, 이는 회사가 확인 피로를 추상적인 우려가 아닌 실제 안전성 리스크로 규정하는 이유를 잘 보여준다. 사람은 피곤해지고, 산만해지거나, 방심한다. 이론적으로는, 분류기는 그렇지 않다.

다만 수치는 양날의 검이다. 89%의 차단율은 곧 위험한 명령의 11%가 자동 모드의 검사망을 빠져나간다는 뜻이며, 이는 Anthropic 스스로도 인정하는 부분이다. 회사는 여전히 운영 환경(프로덕션) 시스템에 영향을 미치는 변경 사항에 대해서는 인간 검토를 권장하고 있는데, 이는 Anthropic조차 자동 모드를 인간 판단의 완전한 대체재로 보지는 않는다는 점을 시사한다.

프롬프트 인젝션: AI 코딩 에이전트 보안의 더 큰 시험대

명백히 위험한 명령을 차단하는 것은 한 가지 문제다. 에이전트가 다른 곳에서 읽어오는 콘텐츠 안에 숨겨진 공격을 막는 것은 전혀 다른 문제이며, 보안 연구자들이 가장 우려하는 부분이기도 하다. 프롬프트 인젝션 — AI 에이전트가 나중에 소비하는 텍스트, 코드, 파일 등에 악성 지시를 몰래 심어 넣는 것 — 은 AI 코딩 에이전트 보안의 핵심 약점으로 여러 차례 지적되어 왔으며, Simon Willison은 이전에 2026년에 바로 이런 유형의 취약점과 연관된 심각한 보안 사고가 발생할 수 있다고 예측한 바 있다.

Anthropic의 답은 외부 검증을 의뢰하는 것이었다. 회사는 2026년 7월 17일 기준으로 공개된 최신 버전의 Claude Code와 Codex를 독립적으로 평가하기 위해 Trajectory Labs를 고용했다. Trajectory Labs는 Anthropic의 자체 학습 및 테스트에서 제외해 둔 72개의 간접 프롬프트 인젝션 시나리오를 설계한 뒤, 각 시나리오를 10번씩 실행했다 — 총 720번의 공격 시도다. Anthropic이 공개한 결과에 따르면, 자동 모드로 실행 중인 Claude Fable 5, Opus 5, Sonnet 5를 대상으로 한 720번의 시도 중 단 한 번도 성공하지 못했다.

이는 눈에 띄는 결과이며, Anthropic이 사람들이 기억하길 바라는 헤드라인이기도 하다. 최근 Fireside Chat에서 이 작업을 논의한 Anthropic 대표 중 한 명인 Thariq Shihipar는, 보안 연구자들이 AI 시스템에서 가장 위험한 구성으로 여기는 불신 입력, 민감 데이터, 에이전트 자율성의 조합을 가리켜 “치명적인 삼중고(lethal trifecta)”라고 부르는 것에 빗대어, 이 보고서의 제목을 “치명적인 삼중고 격파”라고 붙일 수도 있었을 것이라고 소셜 미디어에서 농담했다. 같은 자리에 있던 또 다른 Anthropic 대표 Cat Wu는 회사가 테스트한 “거의 모든 공격을 상당 부분 완화했다”고 말했다.

한편 Willison은 설득되기보다는 조심스러운 회의론을 유지하고 있다. 그는 720개의 선별된 공격 시도에서 성공률이 0이라는 점은 고무적이지만, 이것이 실제 공격자가 시도할 수 있는 모든 공격 벡터에 대한 증거는 아니라고 지적한다. 그가 특히 제기하는 시나리오 중 하나는, 코딩 에이전트에게 합법적인 명령을 실행하기 전에 추가 파일을 가져와 실행하라고 지시하는 악성 서드파티 소프트웨어 패키지다 — 이 추가 파일은 그 과정에서 데이터를 조용히 유출할 수 있다. 분류기가 설계된 방식상, 악성 지시가 반드시 위험한 명령처럼 보이지 않을 수 있기 때문에, 어떤 버전의 Claude Code 자동 모드가 이런 간접적인 공급망 스타일 공격을 포착할 수 있을지는 불분명하다.

여전히 남아 있는 쟁점

이 전체 논의의 밑바닥에는 서로 다른 두 가지 안전성 문제가 있으며, 자동 모드가 두 가지를 똑같이 잘 해결하는 것은 아니다. 첫 번째는 우발적 피해 — 에이전트가 지시를 잘못 이해해 잘못된 파일을 삭제하거나 운영 데이터베이스를 지워 버리는 경우다. 두 번째는 보안 연구자들이 더 우려하는 부분으로, 공격자가 에이전트가 신뢰하는 콘텐츠를 무기화하는 의도적인 프롬프트 인젝션이다.

그러나 Willison의 결론은, 테스트에서 아무리 잘 작동하더라도 단일 안전성 레이어를 신뢰하기보다는 보다 구조적인 해결책 쪽으로 기운다. 그는 모델이나 분류기에 내장된 Anthropic AI 안전성 메커니즘에 전적으로 의존하기보다는, 잘못 트리거될 경우 피해를 유발할 수 있는 데이터나 도구에 AI 시스템이 애초에 접근하지 못하도록 에이전트 워크플로우를 설계하는 데 더 큰 동기를 느끼고 있다고 말한다. 이는 “분류기를 신뢰하라”는 태도와는 의미 있게 다른 자세로, 자동 모드를 여러 방어층 중 하나로 취급할 뿐 완성된 해결책으로 보지는 않는다.

또한 이 딜레마를 겪는 주요 AI 연구소가 Anthropic만은 아니라는 점도 주목할 만하다. OpenAI는 가장 강력한 GPT-5.6 모델에 대해 동등한 자동 모드를 기본값으로 활성화하는 대신, 보다 보수적인 승인 기반 접근 방식을 선택한 것으로 알려져 있다 — 이는 업계 내부에서도 기본적으로 AI 코딩 에이전트에게 어느 정도의 자율성을 부여하는 것이 안전한지에 대한 합의가 아직 없다는 신호다.

FAQ

Claude Code에서 Anthropic의 자동 모드는 무엇인가?

자동 모드는 반복적인 인간 승인 프롬프트를, 되돌릴 수 없거나 위험한 도구 호출을 자동으로 차단하도록 설계된 분류기로 대체하는 설정으로, 차단이 반복되거나 정말로 모호한 행동이 등장할 때만 수동 승인으로 되돌아간다.

위험한 명령을 차단하는 데 있어 자동 모드는 인간과 비교해 얼마나 효과적인가?

1,053명의 유료 사용자를 대상으로 한 테스트에서 자동 모드는 위험한 명령의 89%를 차단한 반면, 동일한 해로운 행동을 거부한 인간 테스터는 13.6%에 불과했으며 — 세션에서 50번째 프롬프트 이후에는 인간의 경계심이 약 5% 수준으로 더 떨어진 것으로 보고되었다.

자동 모드는 프롬프트 인젝션 공격을 완전히 방지하는가?

Trajectory Labs의 독립 테스트에서는 자동 모드로 실행 중인 Claude Fable 5, Opus 5, Sonnet 5를 대상으로 한 720번의 프롬프트 인젝션 공격 시도 중 단 한 번도 성공하지 못했다. 다만 데이터를 유출하는 악성 서드파티 패키지와 같은 위험은 현재 시스템만으로는 완전히 해결되지 않았을 수 있다.

자동 모드에도 불구하고 AI 코딩 에이전트에는 어떤 안전성 위험이 여전히 존재하는가?

에이전트는 여전히 실수로 피해를 유발하는 행동을 할 수 있으며, 특히 악성 서드파티 코드 패키지를 통해 우회되는 정교한 공격은 Anthropic이 공개한 결과 분석에 따르면 자동 모드의 분류기가 안정적으로 포착하지 못할 수 있다.

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Claude Code에서 Anthropic의 자동 모드는 무엇인가?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”자동 모드는 반복적인 인간 승인 프롬프트를, 되돌릴 수 없거나 위험한 도구 호출을 자동으로 차단하도록 설계된 분류기로 대체하는 설정으로, 차단이 반복되거나 정말로 모호한 행동이 등장할 때만 수동 승인으로 되돌아간다.”}},{“@type”:”Question”,”name”:”위험한 명령을 차단하는 데 있어 자동 모드는 인간과 비교해 얼마나 효과적인가?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”1,053명의 유료 사용자를 대상으로 한 테스트에서 자동 모드는 위험한 명령의 89%를 차단한 반면, 동일한 해로운 행동을 거부한 인간 테스터는 13.6%에 불과했으며 — 세션에서 50번째 프롬프트 이후에는 인간의 경계심이 약 5% 수준으로 더 떨어진 것으로 보고되었다.”}},{“@type”:”Question”,”name”:”자동 모드는 프롬프트 인젝션 공격을 완전히 방지하는가?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Trajectory Labs의 독립 테스트에서는 자동 모드로 실행 중인 Claude Fable 5, Opus 5, Sonnet 5를 대상으로 한 720번의 프롬프트 인젝션 공격 시도 중 단 한 번도 성공하지 못했다. 다만 데이터를 유출하는 악성 서드파티 패키지와 같은 위험은 현재 시스템만으로는 완전히 해결되지 않았을 수 있다.”}},{“@type”:”Question”,”name”:”자동 모드에도 불구하고 AI 코딩 에이전트에는 어떤 안전성 위험이 여전히 존재하는가?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”에이전트는 여전히 실수로 피해를 유발하는 행동을 할 수 있으며, 특히 악성 서드파티 코드 패키지를 통해 우회되는 정교한 공격은 Anthropic이 공개한 결과 분석에 따르면 자동 모드의 분류기가 안정적으로 포착하지 못할 수 있다.”}}]}

이 기사는 인공지능의 도움을 받아 제작되었으며 편집팀의 검수를 거쳤습니다.

Satoshi Voice
이 기사는 인공지능의 지원을 받아 제작되었으며, 정확성과 품질을 보장하기 위해 저널리스트 팀의 검토를 거쳤습니다.
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST