Strix, XBEN 96% 주장 — 벤더 보고 수치

Strix: 에이전트형 침투 테스트, XBEN 96%(벤더 보고), OWASP Top 10 범위, SARIF 2.1.0 출력, Garak·PyRIT 비교.

Strix, XBEN 96% 주장 — 벤더 보고 수치
Share

보안 벤더가 자사의 AI 에이전트가 벤치마크의 96%를 풀었다고 주장하면 숫자가 헤드라인이 됩니다. 하지만 중요한 세부사항은 누가 측정했느냐입니다. usestrix의 오픈소스 에이전트형 펜테스터 Strix가 바로 그런 주장을 내세웁니다.

XBEN 96%: 웹 챌린지 104개, 감사는 없음

Strix는 XBEN 벤치마크의 웹 챌린지 104개 중 100개를 풀었다고 보고됐습니다. 약 96%입니다. 다만 이 수치는 벤더와 커뮤니티가 보고한 것이며, 2026년 8월 기준 참조된 어떤 출처에서도 독립 재현 사례는 제시되지 않았습니다 . 감사된 결과가 아니라 자체 보고 결과로 보아야 합니다.

그 점수를 해석하기 전에 범위상 한계 두 가지를 먼저 봐야 합니다.

  • 웹 전용 벤치마크입니다. XBEN은 오직 웹 애플리케이션 챌린지 세트입니다. 네트워크 계층 공격, 클라우드 인프라 설정 오류, LLM 모델 안전성 probing은 다루지 않습니다. 따라서 96%라는 수치를 그런 영역에 그대로 적용할 수 없습니다 .
  • 비용은 고정값이 아닙니다. 보고된 챌린지당 약 3.37달러는 XBEN에서 GPT-5.4를 사용해 측정한 값입니다. 실제 비용은 모델 등급, 대상의 복잡도, 캠페인 깊이에 따라 달라집니다 .

채택 신호는 정확도와 별개입니다. Strix는 2026년 7월 GitHub Trending 1위에 올랐고, 24시간 동안 별 +2,137개를 기록한 것으로 보고됐으며, 현재는 대략 4.1만~4.6만 개의 별까지 성장했습니다 . 이는 인기 지표이지, 완성도나 정확도를 나타내는 척도는 아닙니다. 이 가이드의 나머지 부분에서는 도구를 직접 실행하고 그 결과를 firsthand로 판단하는 방법을 보여줍니다.

Strix를 실행하기 전에 준비할 것

XBEN 96%: 104 web challenges, unaudited (source: img2.helpnetsecurity.com)

Strix에는 네 가지 필수 조건이 있습니다. 실행 중인 Docker 데몬, 지원되는 LLM의 API 키, 대상을 테스트할 명시적 권한, 그리고 v1.1.0부터는 지출 한도입니다. 첫 번째가 없으면 proof-of-concept 검증이 전혀 실행되지 않습니다. 세 번째가 없으면 법을 어길 가능성이 큽니다.

  • Docker가 설치되어 실행 중이어야 합니다. 첫 실행 시 exploit-sandbox 이미지를 자동으로 가져옵니다. 이 샌드박스에서 Strix가 PoC를 작성하고 실행하므로, Docker가 없으면 검증 단계도 없고 확인된 finding도 없습니다 .
  • 지원 제공자의 LLM API 키가 필요합니다. Strix는 LiteLLM을 통해 라우팅되며 OpenAI GPT-5.4(openai/gpt-5.4), Anthropic Claude Sonnet 4.6(anthropic/claude-sonnet-4-6), Google Gemini 3 Pro Preview(vertex_ai/gemini-3-pro-preview), 또는 LLM_API_BASE를 통한 Ollama 같은 로컬 모델과 함께 작동합니다 .
  • 명시적인 법적 권한이 필요합니다. Strix는 실행 중인 애플리케이션을 대상으로 실제 exploit을 실행하고 작동하는 PoC를 생성합니다. 소유하지 않았거나 평가 권한이 없는 시스템을 대상으로 지정하는 것은 대부분의 관할권에서 불법입니다. 먼저 서면으로 범위를 정하세요.
  • 예산 상한이 필요합니다. v1.1.0에는 --max-budget-usd가 추가됐습니다 . 어떤 engagement든 시작하기 전에 하드 캡을 설정하세요. 실행당 비용은 캠페인 깊이에 따라 늘고 frontier-tier 모델에서는 빠르게 올라갑니다.

1분 안에 Strix 실행하기

Screenshot of https://www.helpnetsecurity.com/2025/11/17/strix-open-source-ai-agents-penetration-testing/

설치는 벤더와 GitHub README에서 제공하는 단일 명령으로 끝납니다. curl -sSL https://strix.ai/install | bash . 첫 실행 시 샌드박스 Docker 이미지를 자동으로 가져오므로 Docker는 이미 실행 중이어야 합니다. 환경 변수 두 개로 Strix를 백엔드에 연결하면 스캔할 준비가 됩니다.

export STRIX_LLM="openai/gpt-5.4"
export LLM_API_KEY="<your-key>"
strix --target ./app-directory

Strix는 LiteLLM 라우팅을 통해 LLM에 종속되지 않으므로 provider 문자열을 바꿀 수 있습니다. Claude Sonnet 4.6은 anthropic/claude-sonnet-4-6, Gemini 3 Pro Preview는 vertex_ai/gemini-3-pro-preview를 사용합니다. 로컬 추론의 경우 LLM_API_BASE를 Ollama 엔드포인트로 설정하면 사용량 기반 API에 토큰을 보내지 않아도 됩니다 .

--target 인자는 평가 모드를 결정합니다. 코드베이스와 GitHub 저장소 리뷰에는 로컬 디렉터리를, 블랙박스 웹 평가에는 URL을, 그레이박스 인증 테스트에는 세션 자격 증명을 전달합니다 . 자동화에서는 두 플래그가 중요합니다.

  • -n / --non-interactive는 headless로 실행되고, finding을 실시간으로 출력하며, 취약점이 발견되면 0이 아닌 코드로 종료합니다. CI/CD에서 pull request를 막는 데 충분합니다 .
  • strix view는 127.0.0.1에 바인딩된 대시보드를 열고 디스크의 실행 파일을 읽습니다. 클라우드로 업로드되는 것은 없습니다 .

2026년 7월 14일 릴리스된 v1.1.0을 사용하는 것이 좋습니다. 이 버전에는 기여자 20명의 PR 56개가 병합됐습니다 . GitHub code-scanning 수집을 위한 SARIF 2.1.0 emitter, LLM prompt-injection skill, weak-password detection, OAuth 및 prototype-pollution 검사, 대형 저장소용 bind-mount 옵션이 추가됐습니다 . SARIF 출력이 바로 Strix finding을 기존 GitHub security tab에 연결해 주는 부분입니다.

Strix는 앱 보안만 다룹니다: 공격 검증의 강점과 한계

How to fire Strix in under a minute

Strix는 애플리케이션 계층을 레드팀 방식으로 점검하며, 범위도 애플리케이션 계층에 한정됩니다. OWASP Top 10은 물론 그 너머까지 다룹니다. 깨진 접근 제어(IDOR, 권한 상승, 인증 우회), 인젝션(SQLi, NoSQLi, OS 명령 인젝션, SSTI), SSRF, XXE, 비즈니스 로직 결함, API 취약점이 포함됩니다 . 정적 스캐너와 Strix를 가르는 기준은 “PoC 없이는 finding도 없다”는 모델입니다. 각 이슈는 보고서에 오르기 전에 Python 샌드박스에서 실제로 익스플로잇되어야 하며, 동작하는 proof-of-concept로 검증되어야 합니다 .

Strix가 건드리지 않는 영역도 분명합니다. 네트워크 계층 침투 테스트, 클라우드 인프라 오구성, 물리적 공격과 소셜 엔지니어링 벡터, LLM 모델 안전성 공격은 범위 밖입니다. 마지막 영역은 Strix가 아니라 Garak과 PyRIT의 영역입니다 . Strix는 실행 중인 앱을 위한 자율 침투 테스터로 봐야 하며, 인프라 테스트나 모델 안전성 테스트를 대체하는 도구로 보면 안 됩니다.

v1.1.0에서 추가된 SARIF 2.1.0 출력은 findings를 GitHub code-scanning과 ASPM 파이프라인으로 흘려보낼 수 있게 합니다 . 하지만 검증된 finding이 곧 triage까지 끝난 finding은 아닙니다. PoC 검증은 오탐을 줄여주지만, 심각도, 영향 범위, 비즈니스 맥락에 대한 사람의 검토 필요성까지 없애지는 않습니다.

여기서는 범위 관리가 특히 중요합니다. 도구 구성이 강력하기 때문입니다. 각 에이전트는 Caido 기반 HTTP 인터셉션 프록시, 브라우저 자동화, 인터랙티브 셸, Python 익스플로잇 샌드박스, OSINT 정찰 기능을 갖고 있습니다 . 프로젝트가 밝히듯 “only test systems you own or are authorized to test”해야 합니다 . 대상 설정이 잘못됐거나 권한 확인이 빠지면, 승인된 침투 테스트가 무단 침입으로 바뀝니다.

Garak·PyRIT와 Strix는 무엇이 다른가

Garak, PyRIT, Strix는 흔히 “AI 레드팀” 도구로 함께 묶이지만, 실제로 공격하는 계층은 다릅니다. Garak과 PyRIT는 프롬프트 인젝션, jailbreak, 유해 콘텐츠 유도처럼 모델을 시험합니다. 반면 Strix는 웹 엔드포인트, 인증 흐름, 인젝션 싱크처럼 실행 중인 애플리케이션을 공격하고, 각 finding을 동작하는 익스플로잇 코드로 검증합니다 . 공격 표면도, 산출물도, 운영자에게 필요한 역량도 다릅니다.

Garak(NVIDIA, Apache 라이선스)은 정적 프로브 스캐너입니다. 37개 이상으로 보고된 적대적 프로브 모듈 라이브러리를 제공합니다 . 고정 입력을 대상 LLM에 보내고, pass/fail detector로 응답을 평가합니다. 모델 출력에 대해 넓고 반복 가능하며 구조화된 커버리지를 확보하는 데 적합하지, 애플리케이션 익스플로잇을 위한 도구는 아닙니다. PyRIT(Microsoft, MIT 라이선스)은 이와 달리 orchestrator LLM을 공격자로 사용해 프롬프트를 동적으로 생성하고 다듬습니다. crescendo와 TAP 같은 멀티턴 대화형 공격에 특화되어 있으며, 내장 scoring pipeline도 제공합니다 . 저장소 이동도 유의해야 합니다. Azure/PyRIT는 2026년 3월 27일에 아카이브되었고, 현재 개발은 microsoft/PyRIT에서 진행됩니다. 이 저장소는 Microsoft Foundry의 AI Red Teaming Agent에도 사용됩니다 .

도구대상 계층방식라이선스 / 저장소
GarakLLM 출력정적 프로브 라이브러리, pass/fail detectorApache, NVIDIA/garak
PyRITLLM 동작Orchestrator LLM, 멀티턴(crescendo, TAP)MIT, microsoft/PyRIT
Strix실행 중인 앱자율 에이전트, PoC로 검증된 익스플로잇Apache-2.0, usestrix/strix

Help Net Security는 Strix를 “behave like human attackers”하는 에이전트라고 설명했습니다. 코드를 실행하고, 애플리케이션을 탐색하며, proof-of-concept 시연을 생성한다는 의미입니다 . 이 설명은 세 도구가 경쟁 관계가 아니라 함께 쓰이는 이유를 잘 보여줍니다. LLM 안전성 레드팀에는 Garak과 PyRIT를 쓰고, 애플리케이션 익스플로잇 검증에는 Strix를 쓰면 됩니다. Strix v1.1.0은 자체 LLM 프롬프트 인젝션 스킬도 추가했습니다 . 일부 영역이 겹치기 시작했지만, Strix의 중심은 여전히 앱 보안입니다.

핵심은 라벨이 아니라 계층을 보고 고르는 것입니다. 모델이 무엇을 말하는지 테스트한다면 Garak과 PyRIT가 맞습니다. 엔드포인트가 실제로 깨지는지 테스트한다면 Strix가 앱 보안 중심의 선택지입니다. 그리고 XBEN 및 비용 수치는 독립 감사가 나오기 전까지는 벤더가 보고한 수치로 취급해야 합니다.

자주 묻는 질문

XBEN 벤치마크 96% 점수는 독립적으로 검증되었나요?

아니요. 2026년 8월 기준 XBEN 수치, 즉 Strix가 웹 챌린지 104개 중 100개를 각 약 3.37달러에 해결했다는 결과 는 벤더와 커뮤니티가 보고한 것이며, 인용된 독립 재현 사례는 없습니다. XBEN은 범용 침투 테스트 벤치마크가 아니라 웹 애플리케이션 챌린지 세트이므로, 높은 통과율은 폭넓은 역량보다는 해당 코퍼스에서의 앱 보안 강점을 보여주는 신호에 가깝습니다. 독립 감사가 나오기 전까지는 방향성을 보여주는 지표로 보는 것이 좋습니다.

Strix와 Garak은 무엇이 다른가요?

겨냥하는 계층이 다릅니다. Strix는 웹 엔드포인트, 인증, 인젝션 같은 애플리케이션 계층을 공격하고, 발견 사항을 보고하기 전에 실제로 동작하는 개념 증명으로 악용 가능성을 입증합니다 . NVIDIA의 오픈소스 LLM 취약점 스캐너인 Garak은 모델 계층을 공격합니다. 정적 프로브 라이브러리의 적대적 프롬프트(37개 이상의 프로브 모듈)를 LLM에 보내고, 응답을 통과/실패 탐지기로 평가합니다 . 공격 표면이 다르고, 활용 사례는 서로 보완적입니다.

Strix 점검에는 실제로 LLM 비용이 얼마나 드나요?

벤더 보고에 따르면 GPT-5.4를 사용할 때 XBEN 챌린지당 약 3.37달러가 든다고 합니다 . 실제 비용은 고정되어 있지 않습니다. 대상의 복잡도, LiteLLM을 통해 라우팅하는 모델 티어, 캠페인 깊이에 따라 달라집니다. Strix는 경로를 검증하거나 소진할 때까지 반복하는 자율 에이전트를 구동하므로, 더 깊은 평가는 비용이 더 많이 듭니다. 실행 전에 v1.1.0에서 추가된 --max-budget-usd 플래그로 비용 상한을 반드시 설정하세요 .

Strix를 CI/CD 파이프라인에서 무인 실행할 수 있나요?

예. -n/--non-interactive 플래그를 사용하면 Strix가 헤드리스로 실행되고, 발견 사항을 실시간으로 출력하며, 취약점을 발견하면 0이 아닌 종료 코드로 종료됩니다 . 이 0이 아닌 종료 코드는 풀 리퀘스트 게이트로 활용할 수 있게 해 줍니다. 실행이 실패하면 병합을 막는 방식입니다. v1.1.0에서는 GitHub 코드 스캐닝과 ASPM 수집을 위한 SARIF 2.1.0 출력 기능도 추가되어, 발견 사항이 다른 스캐너와 같은 도구 안에 표시됩니다 .

Strix는 로컬 또는 자체 호스팅 LLM을 지원하나요?

예. Strix는 LiteLLM 라우팅을 통해 LLM에 종속되지 않으므로, LLM_API_BASE를 로컬 Ollama 엔드포인트로 설정하면 호스팅 제공업체 대신 자체 호스팅 모델을 사용하게 됩니다 . 제공업체 추상화는 LiteLLM이 처리하며, Strix는 로컬 모델과 함께 OpenAI GPT-5.4, Anthropic Claude Sonnet 4.6, Google Gemini 3 Pro Preview를 공식 지원합니다. 복잡한 익스플로잇 생성에서는 로컬 모델의 정확도가 호스팅 프런티어 모델보다 낮을 수 있습니다.

이 글이 도움이 되셨다면, 새 글이 올라올 때마다 이메일로 받아보세요.

구독하기