보안 연구원들은 오랫동안 대형 언어 모델 에이전트가 사고 대응에서 가장 지루한 작업 중 하나를 가속해 줄 수 있기를 기대해 왔다. 바로, 흩어져 있는 로그와 텔레메트리를 사용해 공격자가 시스템을 어떻게 단계별로 이동했는지 퍼즐을 맞추는 작업이다. DiagChain이라는 새로운 진단 벤치마크는 이러한 기대를 시험대에 올려놓았고, 그 결과는 이 기술이 스스로 신뢰할 수 있는 수준으로 공격 체인 재구성을 처리하기까지는 아직 갈 길이 멀다는 점을 시사한다.
Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao 등 연구진이 개발한 DiagChain은 단순한 정확도 점수판이 아니다. 이 벤치마크는 시스템 텔레메트리에서 가져온 증거를 기반으로, 공격자가 취한 행동의 순차적 시퀀스를 재구성하려 할 때 LLM 에이전트가 어디에서, 왜 실패하는지를 보여주도록 특별히 설계되었다.
Summary
핵심 요약
- DiagChain은 단순한 합격/불합격 정확도를 넘어, 증거 기반 공격 체인 재구성에서 LLM 에이전트를 평가하는 진단 벤치마크이다.
- 벤치마크의 MAIN-69 스위트에는 여러 운영체제, 증거 노이즈 수준, 체인 길이에 걸친 69개 시나리오가 포함된다.
- ECRAG이라는 새로운 방법은 증거 검색을 재구성 중인 체인의 진화하는 구조화 표현과 결합한다.
- 테스트된 6개의 서로 다른 LLM 전반에서, 가장 성능이 좋은 구성조차 849개의 기준 단계 중 39.6%만 성공했다.
- 소형 모델은 검색된 증거를 활용하는 것 자체에 어려움을 겪는 반면, 대형 모델은 주로 그 증거를 올바른 순서로 배열하는 데 어려움을 겪는다.
DiagChain 소개: 공격 체인 재구성을 위한 새로운 벤치마크
DiagChain이 존재하는 이유는, 대부분의 기존 벤치마크가 최종 출력이나 전체 정확도 점수만을 살펴볼 뿐, 에이전트의 추론 과정에서 오류가 실제로 어떻게 형성되는지에 대한 통찰을 거의 제공하지 않기 때문이다. 이는 AI 에이전트가 실제 침해 사고 분류를 도울 만큼 신뢰할 수 있는지 판단하려는 보안 팀에게 의미 있는 공백이다.
DiagChain의 목적과 범위
DiagChain의 핵심은 진단 벤치마크로서, 증거 기반 사이버보안 작업을 위해 구축되었다는 점이다. 에이전트가 최종 공격 내러티브를 맞혔는지 틀렸는지만 평가하는 대신, 재구성 과정의 각 단계를 개별적으로 평가한다. 이러한 단계별 접근 방식은 LLM 에이전트의 추론이 정확히 어디에서 무너지는지, 즉 증거 수집 단계인지, 증거 해석 단계인지, 아니면 사건을 일관된 체인으로 정렬하는 단계인지 연구자들이 정확히 짚어낼 수 있게 해준다.
MAIN-69 시나리오 스위트의 구성
이 벤치마크의 중심은 MAIN-69로, 에이전트를 다양한 현실적인 조건에서 스트레스 테스트하기 위해 설계된 69개 시나리오 스위트이다. 이 시나리오들은 여러 운영체제에 걸쳐 있으며, 증거에 섞인 노이즈의 양이 다르고, 체인 길이도 서로 다르다. 즉, 일부 공격 시퀀스는 짧은 반면, 다른 것들은 더 긴 공격자 행동의 흐름을 추적해야 한다. 이러한 다양성은 조건이 깔끔하고 단순할 때뿐 아니라, 상황이 더 복잡하고 지저분해질 때에도 에이전트의 성능이 유지되는지를 드러내기 위한 것이다.
방법론적 혁신과 평가 지표
시나리오 스위트 외에도, DiagChain은 자체적인 검색 방법과 5부분으로 구성된 점수 체계를 도입하여, 실패 진단을 추측이 아닌 체계적인 과정으로 만들고자 한다.
증거 중심 검색 증강 생성(ECRAG)
이 논문의 핵심 기여 중 하나는 ECRAG으로, Evidence-Centric Retrieval-Augmented Generation의 약자이다. 표준적인 검색 증강 생성 설정과 달리, ECRAG는 증거 검색을 에이전트가 재구성하려는 체인의 진화하는 구조화 표현과 결합한다. 실질적으로 이는 시스템이 관련 증거를 한 번만 가져오고 끝내는 것이 아니라, 새로운 증거가 들어올 때마다 공격 체인에 대한 내부 그림을 지속적으로 업데이트한다는 의미이며, 이론적으로는 에이전트가 복잡한 다단계 침해를 더 일관되게 추적하는 데 도움이 되어야 한다.
진단 평가를 위한 다섯 가지 보완적 지표
어디에서 문제가 발생하는지 이해하기 위해, DiagChain은 재구성 과정의 각기 다른 단계를 겨냥한 다섯 가지 보완적 지표에 의존한다. 이 지표들을 함께 사용하면, 모든 실수를 하나의 일반적인 정확도 수치로 뭉뚱그리는 대신, 특정 실패 지점을 분리해낼 수 있다. 이것이 바로 이 벤치마크의 핵심 가치이다. 즉, “에이전트가 올바른 증거를 찾지 못했다”는 것과 “에이전트가 증거는 찾았지만 사건을 잘못된 순서로 배열했다”는 것을 구분해 주는 진단 평가는, 단일 합격/불합격 점수보다 이러한 시스템을 개선하는 데 훨씬 더 유용하다.
대형 언어 모델의 성능 평가
그렇다면 현재의 모델들은 실제로 어떻게 성능을 보였을까? 벤치마크 결과에 따르면, 그다지 좋지 않았다.
여섯 개 LLM을 사용한 실험 설정
연구팀은 MAIN-69 시나리오를 대상으로 여섯 개의 서로 다른 LLM을 사용해 평가를 수행했다. 이 설정을 통해, 서로 다른 역량을 가진 모델들이 동일한 증거 기반 재구성 작업을, 동일한 노이즈 조건과 체인 길이 난이도에서 어떻게 처리하는지 비교할 수 있었고, 이를 통해 전반적인 성능을 일관된 기준으로 비교할 수 있었다.
주요 성능 결과와 성공률
가장 눈에 띄는 수치는 냉정하다. 연구에서 가장 성능이 좋았던 구성조차 MAIN-69에 포함된 849개의 기준 단계 중 39.6%만 성공했다. 다시 말해, 가장 강력한 설정조차 벤치마크의 정답 단계와 비교했을 때 공격자 행동 시퀀스를 60% 이상 잘못 재구성했다는 뜻이다. 이는 지금 당장 공격 체인 재구성을 전적으로 AI 에이전트에게 맡기고자 하는 이들에게 중요한 현실 점검이 된다.
모델 크기와 재구성 난제에 대한 통찰
이 문제가 단순한 수치를 넘어 왜 중요한가? 실패 패턴이 모델 크기에 따라 다르며, 이 차이가 해결해야 할 두 가지 전혀 다른 엔지니어링 과제를 가리키기 때문이다.
소형 모델의 한계
연구진의 분석에 따르면, 소형 모델은 사건을 올바른 순서로 배열하는 것보다 더 기초적인 부분에서 어려움을 겪는다. 바로 검색된 증거를 출력에 제대로 반영하는 것 자체에 어려움을 겪는다는 점이다. 이는 소형 모델의 병목이 파이프라인의 더 이른 단계, 즉 증거가 에이전트의 추론을 실제로 뒷받침해야 하는 지점에 있다는 것을 시사하며, 이 단계에서 증거가 무시되거나 잘못 적용되는 문제가 발생한다.
대형 모델의 증거 순서화 문제
대형 모델은 이러한 첫 번째 허들을 더 잘 넘어서 재구성 과정의 더 깊은 단계까지 진행할 수 있다. 그러나 이들은 다른 벽에 부딪힌다. 바로 수집한 증거를 올바르게 순서화하는 것이 주요 병목이 되는 것이다. 이는 보다 미묘한 실패 양상으로, 모델이 올바른 조각들을 가지고 있음에도 불구하고, 그것들을 정확한 공격자 행동 시퀀스로 배열하는 데 어려움을 겪는다는 의미이며, 이는 실제 보안 조사에서 가장 중요한 출력물이다.
이러한 분할은 보안 운영에서 LLM 평가 벤치마크 도구를 구축하거나 배포하는 모든 이들에게 중요하다. 이는 단순히 모델 크기를 키우는 것만으로는 공격 체인 재구성이 자동으로 해결되지 않음을 의미한다. 두 가지 실패 양상은 서로 다른 해결책을 요구한다. 소형 모델에는 더 나은 증거 통합이, 대형 모델에는 더 나은 시퀀싱 또는 추론 전략이 필요하며, 만능형 개선 경로는 아니라는 것이다.
연구진은 이러한 발견을 단순한 종단 간 정확도 점수보다 진단 평가의 타당성을 뒷받침하는 근거로 제시한다. 단일 집계 수치는 보안 팀에게 “이 모델은 40%의 확률로 맞춘다”는 정도만 알려줄 뿐, 그 실패가 증거 누락, 증거 오독, 혹은 순서 뒤섞임 중 어디에서 비롯되는지는 알려주지 못한다. DiagChain의 단계별 지표는 이러한 공백을 메우기 위해 설계되었으며, 저자들이 설명하듯 앞으로 증거 기반 사이버보안 에이전트를 개선하는 데 활용할 수 있는 실행 가능한 인사이트를 제공한다.
FAQ
DiagChain은 무엇을 평가하도록 설계되었나요?
DiagChain은 진단적, 단계별 평가를 통해 증거 기반 공격 체인 재구성에서 대형 언어 모델 에이전트를 평가하도록 설계되었다.
MAIN-69 시나리오 스위트는 어떤 내용을 다루나요?
MAIN-69는 여러 운영체제, 다양한 증거 노이즈 수준, 서로 다른 공격 체인 길이를 포괄하는 69개 시나리오로 구성된다.
ECRAG 방법론은 공격 체인 재구성을 어떻게 개선하나요?
ECRAG는 증거 검색을 재구성된 체인의 진화하는 구조화 표현과 결합하여 체인 분석을 지원한다.
이 벤치마크에서 LLM에 대해 확인된 주요 성능 과제는 무엇인가요?
소형 모델은 검색된 증거를 통합하는 데 어려움을 겪는 반면, 대형 모델은 재구성 과정에서 증거를 올바른 순서로 배열하는 데 어려움을 겪는다.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”DiagChain은 무엇을 평가하도록 설계되었나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”DiagChain은 진단적, 단계별 평가를 통해 증거 기반 공격 체인 재구성에서 대형 언어 모델 에이전트를 평가하도록 설계되었다.”}},{“@type”:”Question”,”name”:”MAIN-69 시나리오 스위트는 어떤 내용을 다루나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”MAIN-69는 여러 운영체제, 다양한 증거 노이즈 수준, 서로 다른 공격 체인 길이를 포괄하는 69개 시나리오로 구성된다.”}},{“@type”:”Question”,”name”:”ECRAG 방법론은 공격 체인 재구성을 어떻게 개선하나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”ECRAG는 증거 검색을 재구성된 체인의 진화하는 구조화 표현과 결합하여 체인 분석을 지원한다.”}},{“@type”:”Question”,”name”:”이 벤치마크에서 LLM에 대해 확인된 주요 성능 과제는 무엇인가요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”소형 모델은 검색된 증거를 통합하는 데 어려움을 겪는 반면, 대형 모델은 재구성 과정에서 증거를 올바른 순서로 배열하는 데 어려움을 겪는다.”}}]}
이 기사는 인공지능의 도움을 받아 제작되었으며 편집팀의 검수를 거쳤습니다.

