최근 금융권을 겨냥한 전방위 해킹 사건으로 인공지능(AI) 에이전트(사람 지시 없이 스스로 작업을 수행하는 AI)를 악용한 사이버 공격에 대한 우려가 높아지고 있다. 최신 해외 연구결과를 살펴보면 기준마다 상이하지만 AI 에이전트의 ‘해킹 성공률’이 20% 내외로 측정되고 있는 것으로 나타났다. 언뜻 낮아 보이는 수치이지만 AI 에이전트 해킹의 고유 특징인 ‘반복성’과 ‘대량화’가 뒷받침되기 때문에 치명적인 위협이 될 수 있다는 게 전문가들의 평가다.
5일 UC버클리 등 연구진이 작성한 논문 ‘CyberGym-E2E: AI 에이전트의 전 과정 사이버보안 능력을 측정하는 확장형 실제 환경 벤치마크’(2026년 6월 사전 공개)에 따르면 최신 AI 모델(클로드 오푸스 4.5·소넷 4.5, 오픈AI GPT 5.2 코덱스, 구글 제미나이 3 프로 등)이 취약점 발견부터 공격, 수리까지 전 과정을 혼자 해내는 성공률이 최고 19.2%로 측정됐다. 이는 연구진이 실제 오픈소스 프로그램 139개에서 과거 발견됐던 보안 취약점 920개를 모아 시험 문제로 만들어 제시한 결과다.
지난해 6월 나온 사전공개 논문 ‘CyberGym: AI 에이전트의 실환경 사이버보안 능력 대규모 평가’에선 오픈소스 프로그램 188개 대상으로 과거 발견된 취약점 1507개로 시험문제를 내고 그 취약점을 실제 작동시키는 입력값을 스스로 만들게 했더니 최고 성공률이 22%를 기록했다.
황석진 동국대 국제정보보호대학원 교수는 이런 연구결과에 대해 “(20% 안팎 성공률은) 보안 관점에서는 상당히 높은 수치”라며 “더 큰 문제는 AI가 24시간 수많은 시스템을 자동 탐색하고 반복적으로 공격할 수 있다는 점이다. AI 해킹의 위협은 한 번의 성공률보다 공격의 반복성과 대량화에 있다”고 지적했다.