Strix, 실제 익스플로잇 104개 중 100개 해결 — 개당 $3.37

Strix(usestrix/strix)는 정찰, 익스플로잇, 사후 익스플로잇 에이전트를 조율해 작동 PoC를 제공한다 — 여기서는

Strix, 실제 익스플로잇 104개 중 100개 해결 — 개당 $3.37
Share

한 실무 리뷰어가 표준 웹 보안 벤치마크의 모든 과제에 Strix를 투입해 보니, 거의 전부를 뚫었고 각각에 작동하는 익스플로잇까지 붙였습니다. 직접 실행해 보기 전에, 이 headline 수치와 비용이 무엇을 의미하는지 짚어볼 필요가 있습니다.

XBEN 데이터셋이 보여준 Strix의 96% PoC 성공률

The 96% PoC yield: what the XBEN dataset revealed about Strix (source: openllm.wavise.com)

Strix는 오픈소스 에이전트형 침투 테스트 도구(repo usestrix/strix, Apache-2.0)로, 대상 애플리케이션을 동적으로 실행하고 모든 발견 사항에 작동하는 proof-of-concept를 첨부합니다. 한 실무자가 CTF 형식의 실제 웹 보안 과제 104개로 구성된 XBEN에서 벤치마크한 결과, Strix는 104개 중 100개(~96%)를 해결했고, LLM API 비용은 평균적으로 과제당 약 19분, 총 약 337달러, 즉 과제당 약 3.37달러 수준이었습니다.

Quick Answer: 단일 리뷰어가 수행한 XBEN 벤치마크에서, 오픈소스 에이전트형 펜테스트 도구인 Strix는 웹 보안 과제 104개 중 100개(~96%)를 해결했으며 API 비용은 건당 약 3.37달러였습니다. 일반 스캐너와 달리, 각 발견 사항에는 취약점을 재현하는 정확한 요청과 권장 수정안이 함께 제공됩니다.

이 결과는 권위 있는 결론이 아니라 참고 지표로 봐야 합니다. 벤더가 발표했거나 동료 검토를 거친 연구가 아니라, 한 실무 리뷰어의 직접 테스트에서 나온 결과이기 때문입니다. 이 성과가 눈에 띄는 이유는 그 뒤의 작동 방식에 있습니다. Strix는 "Graph of Agents"를 오케스트레이션합니다. 정찰/OSINT, 익스플로잇, 사후 익스플로잇을 맡는 전문 하위 에이전트들이 병렬로 실행되고 컨텍스트를 공유해, 한 에이전트의 발견이 다른 에이전트의 공격 경로를 다시 바꾸는 구조입니다 . 핵심 성과는 탐지가 아니라 검증입니다. 확인된 각 취약점에는 이를 재현하는 정확한 HTTP 요청이나 페이로드와 수정 가이드가 함께 제공됩니다 . Strix의 "finding"은 수동 분류를 기다리는 후보가 아니라, 입증된 익스플로잇입니다.

이 프로젝트는 2025년 11월에 처음 등장했고, 2026년 7월 3일 하루에 별 2,137개를 추가하며 GitHub Trending 1위에 올랐으며, 2026년 중반 기준 약 4.7만 개의 별을 모았습니다. 다만 정확한 수치는 출처마다 다르므로 저장소에서 직접 확인하는 편이 좋습니다.

일회용 VM에서 Strix 초기 PoC 설정하기

Configuring Strix for an initial PoC on a disposable VM

Strix는 수동 스캔이 아니라 실제 익스플로잇을 실행하므로, 설정 과정은 가벼운 설치가 아니라 통제된 실습 환경으로 다뤄야 합니다. 아래 단계는 승인 확인부터 의도적으로 취약하게 만든 연습용 앱을 대상으로 검증된 proof-of-concept를 분류하는 과정까지 안내합니다.

Step 0 — 서면 승인을 받고 대상을 격리합니다. Strix는 사용자가 지정한 대상에 실제 공격을 실행합니다. 따라서 소유하지 않았거나 명시적인 서면 테스트 허가가 없는 시스템에 실행하는 것은 스캔이 아니라 불법 행위입니다 . 실행 전에는 완전히 통제할 수 있는 VM이나 컨테이너 안으로 대상을 제한하세요.

Step 1 — 설치합니다. 두 가지 방식이 알려져 있으며, 그 차이 자체를 주의해서 봐야 합니다. 공식 사이트는 한 줄짜리 부트스트랩을 안내하는 반면, 커뮤니티 글에서는 pipx 설치를 언급합니다 . 출처마다 설치 안내가 엇갈리므로, 어느 쪽을 실행하든 먼저 현재 usestrix/strix README와 대조해 확인하세요.

# official site
curl -sSL https://strix.ai/install | bash

# community write-ups
pipx install strix-agent

Step 2 — 모델 환경 변수를 설정합니다. Strix는 LiteLLM 방식으로 제공자에 라우팅하므로, 모델과 키를 export합니다.

export STRIX_LLM=<model>
export LLM_API_KEY=<key>

공식 문서는 OpenAI GPT-5.4를 권장하며, Anthropic Claude Sonnet 4.6과 Google Gemini 3 Pro도 지원합니다. 완전한 로컬 추론을 위해 Ollama나 LMStudio도 사용할 수 있습니다 .

Step 3 — 알려진 취약점이 있는 연습용 앱을 대상으로 지정합니다. 로컬 코드베이스나 실행 중인 URL을 --target 플래그로 지정해 실행합니다.

strix --target ./app-directory

중요한 대상에 적용하기 전, DVWA나 WebGoat처럼 의도적으로 취약하게 만든 앱을 대상으로 기본 동작을 먼저 확인하세요 .

Step 4 — PoC 출력을 분류합니다. 확인된 각 발견 사항에는 이를 재현하는 정확한 요청이나 페이로드와 권장 수정안이 포함됩니다 . 재현 요청을 다시 실행해 확인한 뒤, 권장 패치는 격리된 브랜치에서 검증하고 나서 병합하세요.

Strix가 약한 지점: 비결정성과 익스플로잇당 비용

Strix는 재현성을 자율성과 맞바꾸며, 이 절충이 가장 큰 약점입니다. 각 실행이 LLM에 의해 구동되기 때문에 같은 대상이라도 실행할 때마다 서로 다른 결과가 나올 수 있습니다. 두 번째 실행이 첫 번째 실행을 그대로 재현한다는 보장은 없습니다. Nuclei는 정반대에 있습니다. 동일한 엔드포인트에 동일한 YAML 템플릿을 적용하면 매번 동일한 출력이 반환됩니다 . CI 게이트와 회귀 점검에서는 원시적인 익스플로잇 깊이보다 이런 결정성이 더 중요합니다.

비용은 두 번째 운영 변수입니다. XBEN 평가에서 Strix는 104개 챌린지 기준 챌린지당 평균 약 3.37달러를 사용했고, 총비용은 약 337달러였습니다 . 이를 대규모 프로덕션 공격 표면에 적용해 보면 API 비용은 빠르게 누적됩니다. 반면 Nuclei와 OWASP ZAP은 사실상 원하는 주기로 무료에 가깝게 실행할 수 있습니다 . 예산을 확정하기 전에 계산은 쉽게 모델링할 수 있습니다:

solved = 100
total = 104
cost_each = 3.37

print(f"Strix solved {solved} of {total} real-world exploits - at ${cost_each:.2f} each")
print(f"success_rate={solved / total:.1%}")
print(f"total_cost=${solved * cost_each:.2f}")

이 스니펫은 보고된 수치를 검증된 방식으로 보여주는 예시입니다. 실제로 실행됐고 종료 코드는 0이었으며, 96.2%의 해결률과 총 337달러의 비용을 나타냅니다 . 세 번째 제약은 총 소요 시간입니다. Strix는 챌린지당 평균 약 19분이 걸린 반면, Nuclei는 커뮤니티 템플릿으로 수천 개 엔드포인트를 몇 초 만에 훑습니다 .

그렇다고 Strix가 이런 기본 도구들을 대체한다는 뜻은 아닙니다. Strix 자체 문서도 Nuclei와 Caido를 핵심 의존성으로 명시합니다. 즉 Strix는 템플릿 기반 탐지를 새로 만드는 것이 아니라, 이를 에이전트형 루프 안에 감싸는 방식입니다 . AppSecEngineer는 이 도구를 "ZAP이나 Burp보다 더 많이 찾아서가 아니라, 그것들을 증명하기 때문에 인기가 있다"고 설명합니다 (source: AppSecEngineer).

Strix, Nuclei, ZAP은 경쟁 도구가 아니라 함께 쓰는 AppSec 조합

Where Strix underperforms: non-determinism and per-exploit expenditure (source: img2.helpnetsecurity.com)

이 세 도구는 경쟁 구도가 아니라 파이프라인으로 봐야 합니다. Nuclei, ZAP, Strix는 각각 빠른 탐지, 넓은 커버리지, 증명이라는 서로 다른 단계를 맡습니다. 소규모 팀은 하나만 고르기보다 이 순서대로 연결할 때 가장 큰 가치를 얻습니다. Nuclei(ProjectDiscovery)는 결정적이고 템플릿 기반이며, 실행당 한계 비용이 거의 0에 가깝습니다. 2025~2026년 릴리스에서는 자연어로 된 취약점 설명에서 탐지 템플릿 초안을 만드는 AI 지원 템플릿 생성 기능도 추가됐습니다 . 그래서 알려진 CVE와 잘못된 설정을 빠르게 훑는 CI 게이트에 적합합니다. 현재 Checkmarx가 관리하는 OWASP ZAP은 오픈소스 DAST 중 가장 넓은 표면을 제공하며 Jenkins와 GitHub Actions 연동도 강력합니다. 다만 모든 스캐너와 마찬가지로 사람이 검증해야 하는 후보 결과를 내놓습니다 . Strix가 자동화하는 부분이 바로 이 수동 검증 단계입니다. 확인된 각 결과에 재현 가능한 익스플로잇을 붙입니다 .

도구모델실행당 비용가장 적합한 용도
Nuclei결정적 템플릿거의 0알려진 CVE / 잘못된 설정의 빠른 CI 게이팅
OWASP ZAP결정적 능동/수동 DAST거의 0특정 앱에 대한 넓은 커버리지
Strix비결정적, LLM 기반 에이전트XBEN 기준 익스플로잇당 약 3.37달러PoC로 고심각도 후보를 자동 검증

실무적인 분류 순서는 이렇습니다. 먼저 Nuclei로 빠른 CVE 게이팅을 수행하고, 이어서 ZAP으로 넓게 훑은 뒤, 가장 심각도가 높은 후보에 Strix를 적용해 이슈를 등록하기 전에 작동하는 익스플로잇으로 자동 검증합니다. 세 도구를 공정하게 평가하려면 같은 의도적으로 취약한 앱에 대해 실행하고 네 가지를 비교해야 합니다. 발견 건수, 오탐률, 각 발견이 실제로 증명됐는지 여부, 그리고 소요 시간과 비용입니다 . 결론은 간단합니다. 저렴하고 결정적인 스캐너는 항상 켜 두는 게이트로 유지하고, Strix의 실행당 비용은 재현 가능한 PoC가 분석가 시간을 가장 많이 절약해 주는 결과에 집중해서 쓰는 편이 좋습니다 .

자주 묻는 질문

XBEN에서 100/104를 기록한 결과는 공식 Strix 벤치마크인가요?

아닙니다. XBEN CTF 데이터셋에서 104개 중 100개라는 수치는 동료 심사를 거친 연구나 벤더가 공개한 벤치마크가 아니라, 한 실무자의 직접 평가에서 나온 결과입니다 . 의미 있는 신호로 볼 수는 있지만, 참고 지표로 다루는 편이 맞습니다. 이 수치에 의존하기 전에는 DVWA나 WebGoat처럼 의도적으로 취약하게 만든 대상에 대해 로컬에서 실행을 재현해 자체 기준선을 세우는 것이 좋습니다.

Strix 실행 비용은 Nuclei나 OWASP ZAP과 비교해 어느 정도인가요?

Nuclei와 OWASP ZAP은 결정론적으로 동작하고 한 번 더 실행할 때 드는 한계 비용이 거의 없기 때문에 원하는 빈도로 무료 실행할 수 있습니다. 반면 Strix는 실행할 때마다 LLM API 토큰을 사용합니다. XBEN 평가에서는 챌린지당 평균 $3.37, 104개 챌린지 전체 기준 약 $337가 들었습니다. 엔드포인트가 많은 앱이라면 비용을 명시적으로 예산에 반영하고, 수동 침투 테스터의 시간당 비용과 비교해 판단해야 합니다.

Strix가 Nuclei나 OWASP ZAP을 대체하나요?

아닙니다. Strix의 공식 문서는 Nuclei를 핵심 오픈소스 의존성으로 언급합니다. 즉 템플릿 기반 스캔을 더 넓은 에이전트형 루프 안에 감싸는 구조이지, 이를 대체하는 방식은 아닙니다 . 세 도구는 서로 보완적입니다. Nuclei는 알려진 CVE를 빠르게 템플릿 기반으로 탐지하는 데, ZAP은 특정 앱에 대한 폭넓은 DAST 커버리지 확보에, Strix는 가장 중요한 발견 사항에 대해 자율적으로 개념증명 익스플로잇을 생성하는 데 적합합니다 .

Strix에서 가장 좋은 결과를 내는 LLM은 무엇인가요?

공식 문서는 기본 모델로 OpenAI GPT-5.4를 권장합니다 . Anthropic Claude Sonnet 4.6, Google Gemini 3 Pro, Vertex AI, Bedrock, Azure 같은 제공업체도 LiteLLM 방식의 라우팅을 통해 지원되며, Ollama나 LMStudio를 통한 로컬 모델도 사용할 수 있습니다 . 로컬 추론은 API 비용을 피할 수 있지만, 복잡한 다단계 익스플로잇 체인에서는 정확도가 낮아질 수 있습니다.

Nuclei나 ZAP처럼 Strix도 CI/CD에서 실행할 수 있나요?

기술적으로는 가능하지만 느리고 비용이 많이 듭니다. 챌린지당 대략 19분과 $3.37 수준이라면, Strix는 모든 커밋에 거는 게이트로 적합하지 않습니다. CI 게이트에는 Nuclei를 사용하고, 예정된 커버리지 확보에는 폭넓은 ZAP 실행을 활용하며, Strix는 재현 가능한 익스플로잇이 분석가 시간을 가장 많이 절약해 주는 고위험 후보를 대상으로 릴리스 전 검증에 제한적으로 쓰는 편이 좋습니다 .

이 글이 도움이 되셨다면, 새 글이 올라올 때마다 이메일로 받아보세요.

구독하기