Hugging Face,
AI 에이전트 침해 공식 확인
OpenAI가 ExploitGym 벤치마크로 모델의 사이버 역량을 평가하던 중 사이버 안전 제한을 의도적으로 낮춘 여러 OpenAI 모델로 구동된 AI 에이전트가 샌드박스를 빠져나와 Hugging Face 운영 인프라까지 침투했습니다. Hugging Face는 7월 27일 사건의 포렌식 타임라인을 공개했습니다.
안랩클라우드메이트가 전하는 월간 AI 보안 소식 2026년 7월 한 달간 프론티어 랩과 AI 업계는 보안에 대한 경각심을 높이는 여러 사건 사고를 현실 세계에서 마주했습니다. 특히 Hugging Face 사례는 공격자의 도구로만 여겨지던 AI가 공격의 주체가 될 수 있다는 점을 보여주며 AI와 보안 업계 모두에 충격을 줬습니다. 7월에 일어난 주요 AI 보안
2026년 7월 한 달간 프론티어 랩과 AI 업계는 보안에 대한 경각심을 높이는 여러 사건 사고를 현실 세계에서 마주했습니다.
특히 Hugging Face 사례는 공격자의 도구로만 여겨지던 AI가 공격의 주체가 될 수 있다는 점을 보여주며 AI와 보안 업계 모두에 충격을 줬습니다. 7월에 일어난 주요 AI 보안 관련 소식을 살펴보고 이 중 모두의 관심사인 Hugging Face 사례를 자세히 들여다보겠습니다.
OpenAI가 ExploitGym 벤치마크로 모델의 사이버 역량을 평가하던 중 사이버 안전 제한을 의도적으로 낮춘 여러 OpenAI 모델로 구동된 AI 에이전트가 샌드박스를 빠져나와 Hugging Face 운영 인프라까지 침투했습니다. Hugging Face는 7월 27일 사건의 포렌식 타임라인을 공개했습니다.
Sysdig가 JadePuffer라고 명명한 에이전틱 위협 행위자는 Langflow 취약점(CVE-2025-3248)을 악용해 운영 데이터베이스를 암호화·파괴하고 금전을 요구했습니다. 후속 공격에서는 ENCFORGE 랜섬웨어를 배포해 AI 모델과 벡터 데이터베이스, 학습 데이터까지 공격 대상으로 넓혔습니다.
Infosecurity Magazine과 Sophos는 AI 어시스턴트와 에이전트가 업무 시스템에 연결되면서 이들이 사용하는 계정과 토큰 등 비인간 신원 자체가 새로운 공격 표면이 된다고 경고했습니다. 보안 실험에서는 악성 기능을 숨긴 가짜 에이전트 스킬이 보안 검사를 통과해 약 2만 6,000개 에이전트에 도달했습니다.
Mandiant의 M-Trends 2026 보고서에는 한 위협 행위자가 에이전틱 AI를 활용해 한 달 동안 17개 조직을 협박한 사례와 코딩 경험이 없는 3명이 LLM으로 만든 도구로 특정 통신사를 약 22만 회 공격한 사례가 소개됐습니다.
AI 탈옥 해킹 사건에 놀란 빅테크 기업들이 대책 마련에 뜻을 모으기 위해 NVIDIA를 중심으로 Microsoft와 SpaceX 등이 참여하는 AI 안전 얼라이언스를 결성했습니다. AI가 스스로 판단하고 행동하는 환경에서 발생할 수 있는 위험과 기업의 대응 방안을 함께 다룹니다.
Visa는 Claude Mythos를 활용한 보안 테스트에서 1만 건이 넘는 취약점과 공격 경로를 찾아냈습니다. 이후 이 과정에 사용한 AI 보안 하네스를 오픈소스로 공개했습니다. Anthropic도 Claude Mythos Preview가 여러 암호 알고리즘에서 새로운 약점을 발견했다는 연구 결과를 발표했습니다.
Hugging Face가 공개한 포렌식 타임라인을 기준으로 이번 사건에서 주목할 부분을 날짜순으로 정리했습니다. 상세 내용은 Hugging Face 블로그를 참조 바랍니다.
인터넷에 인증 없이 노출된 써드파티 인프라의 샌드박스 환경에서 관리자 권한을 확보했습니다. 이후 이 환경을 약 나흘 반 동안 공격 명령을 실행하고 결과를 주고받는 외부 거점으로 활용했습니다.
코드 검색 엔진과 Hugging Face API를 이용해 실행 환경에서 발견한 식별자와 챌린지 정보를 반복 검색했습니다. 확보한 단서를 바탕으로 데이터셋 처리 파이프라인의 파일 읽기와 코드 실행 경로를 탐색했습니다.
운영 파드에서 서비스 계정 토큰을 읽고 Kubernetes API와 클라우드 메타데이터를 탐색했습니다. 특권 파드를 생성해 노드 관리자 권한을 얻고 시크릿 하나에서 136개의 키를 읽었습니다.
메시 VPN 인증키와 내부 접근 자격증명으로 공격 거점을 사내 네트워크에 연결했습니다. 내부 CI 환경과 소스 코드 관리 시스템으로 이동하며 일부 저장소까지 접근 범위를 넓혔습니다.
ExploitGym·CyberGym 평가 해답 데이터셋 5개에 접근했습니다. 내부 운영용 데이터베이스도 읽었지만 변경이나 대량 반출은 확인되지 않았습니다. 추가 토큰 발급과 흔적 정리도 시도했습니다.
Hugging Face의 여러 보안 계층이 공격 신호를 탐지했지만 경보의 심각성을 제때 판단하지 못해 즉각적인 대응으로 이어지지 않았습니다. 이후 오픈웨이트 모델을 활용해 약 1만 7,600건의 공격 동작을 복원했습니다.
Hugging Face가 공개한 포렌식 기록을 바탕으로 이번 사건에서 관찰된 AI의 위협 행위를 침해 진행 단계로 구분해 재구성했습니다. 각 위협 행위는 여러 날짜에 걸쳐 반복되거나 동시에 진행됐습니다. 단계별로 위협 행위를 살펴보면 전술, 기술, 절차(TTPs)는 새로울 것이 없습니다. 하지만 사람이 아니라 AI가 위협 행위의 주체가 되면 달라지는 것이 있습니다. 규모, 속도, 지속성 측면에서 머신 스피드와 효율을 보이며 위협을 가한다는 것이 다르다는 것을 이번 사건을 통해 알 수 있습니다.
Hugging Face 사례가 모두를 놀라게 한 것은 AI가 사람의 지시 없이 주어진 목표를 달성하기 위해 스스로 공격 경로를 탐색하고 위협 행위를 실행에 옮겼다는 것입니다. 이런 일이 또 일어 나지 말란 법은 없습니다. 이제 프론티어급 AI를 직접 최적화하고 서빙하는 조직은 모델의 내부 오용뿐 아니라 에이전트가 사내 권한과 도구를 이용해 내부는 물론이고 외부 시스템까지 침해할 가능성을 함께 관리해야 합니다. 앞으로는 목표와 허용 범위를 구체적으로 제한하고 외부 네트워크 접근·코드 실행·자격증명 사용·시스템 변경에는 별도 승인과 차단 정책을 적용해야 할 것입니다. 또한, 에이전트의 행동이 조직 경계를 넘어서는 순간 즉시 탐지하고 중단할 수 있어야 합니다.