Subquadratic의 핵심 주장은 1,200만 토큰을 처리하면서도 실제로 비교하는 토큰 쌍은 거의 없다는 것입니다. 그 근거로 제시된 메커니즘인 SSA는 SubQ가 가장 적게 공개한 부분이기도 해서, 어떤 기준으로 위치를 선택하는지 이해하는 것이 가장 먼저 따져봐야 할 지점입니다.
SSA의 처리 위치 선택 방식
SSA(Subquadratic Sparse Attention)는 콘텐츠 의존적 어텐션 메커니즘입니다. 각 쿼리 토큰마다 관련성이 높다고 판단되는 소수의 위치를 선별해 해당 부분에 대해서만 정확한 어텐션을 계산하며, 고정 스트라이드나 슬라이딩 윈도우 방식은 사용하지 않습니다 . 조밀한 트랜스포머 어텐션의 O(n²) 비용처럼 모든 토큰 쌍을 비교하는 대신, SubQ는 포워드 패스당 연산과 메모리 모두 대략 선형인 O(n) 스케일링을 달성한다고 주장합니다. 비교하는 쌍의 수가 시퀀스 길이에 비례해 늘어날 뿐, 그 제곱으로 늘지 않기 때문입니다 .
대표 수치를 보면 프루닝이 얼마나 공격적인지 알 수 있습니다. SubQ의 모델 카드에 따르면 1,200만 토큰에서 모델이 어텐션을 계산하는 토큰 쌍은 전체의 0.13%에 불과해 조밀한 어텐션 대비 약 1,000배 감소하며, 이 길이는 훈련 시 최대 컨텍스트인 200만 토큰의 무려 여섯 배에 달합니다 . 원본 모델은 2026년 5월 5일 SubQ 1M-Preview로 출시됐고, 이 동작을 설명하는 1.1 Small 모델 카드는 2026년 6월 16일 공개됐습니다 .
SSA가 기존 희소 어텐션 방식과 구별되는 점은 희소성이 어디서 비롯되는가입니다:
- 고정 패턴 희소 어텐션(Longformer, BigBird)은 미리 정해진 윈도우와 전역 토큰을 사용하며, 콘텐츠와 무관하게 패턴이 동일합니다 .
- 상태 공간 모델(Mamba, RWKV)은 어텐션을 순환/압축 상태로 대체해 정확성을 포기하는 대신 고정 크기 메모리를 확보합니다 .
- SSA는 콘텐츠 인식 라우팅(쿼리마다 선택되는 위치가 달라짐)을 구현하면서도, 전체 시퀀스를 근사하는 방식이 아닌 선별된 부분에 대해 정확한 어텐션을 보존한다고 주장합니다 .
바로 이 지점에 아직 검증되지 않은 의문이 숨어 있습니다. 선택된 부분집합에 대한 정확한 어텐션은 결국 그 선택의 질에 달려 있습니다. 라우터가 다양한 태스크 유형(멀티홉 추적, 집계, 코드 탐색, 장기 에이전트 상태)에서 올바른 위치를 안정적으로 찾아낸다면, 선형 비용으로 프런티어 수준의 추론이 가능하다는 주장이 설득력을 얻습니다. 반면 성능 향상이 특정 스팬을 찾는 needle-in-a-haystack처럼 검색 형태의 태스크에 집중된다면, 이 아키텍처는 알려진 스팬 위치 찾기에 최적화된 벤치마크에서는 우수하지만 관련성이 분산된 태스크에서는 약점을 드러낼 수 있습니다. VentureBeat는 연구자들의 중론을 정확히 이렇게 정리했습니다. 효율성이 이해력 손실 없이 유지된다는 독립적 증거를 요구하는 것이죠 . 이후 섹션에서는 이 질문을 단계별로 검증합니다.
SubQ가 공개하지 않은 원본 모델

SubQ 1.1 Small은 처음부터 학습한 모델이 아닙니다. 모델 카드에 따르면 팀은 기존 오픈웨이트 프런티어 모델의 조밀한 어텐션을 SSA로 교체하는 방식으로 변환한 뒤, 단계적 컨텍스트 확장과 추가 사전학습을 적용했습니다 . 이 사실은 평가 전체의 틀을 바꿉니다. 테스트 중인 아키텍처는 클린룸 설계가 아니라 기존 모델에 이식된 구조이기 때문입니다. 원본 모델의 시작 컨텍스트 윈도우는 262K 토큰이었으며, Subquadratic은 수백만 토큰 규모의 주장이 적용되기 전에 YaRN 위치 스케일링을 통해 이를 네 단계로 확장했습니다 .
스케일링 일정은 구체적입니다. YaRN은 262K → 512K → 1M → 2M 순으로 진행됐으며, 추가 사전학습 토큰 대부분은 1M 단계에 집중됐고 최종적으로 2M에서 확장 및 학습 단계가 이뤄졌습니다 . 학습 데이터는 자연스럽게 긴 자료(서적, 장문 문서, 리포지토리 규모의 코드)를 강조했으며, 사후 학습에서는 합성 검색, 장문 컨텍스트 추론, 코딩, 일반 지시 따르기를 혼합했습니다 . 회사는 이 레시피에 도달하기까지 여섯 개 모델 세대에 걸쳐 100회 이상의 장문 컨텍스트 실험을 수행했다고 밝힙니다 . 이 수치가 말해주는 것은 분명합니다. 2M이 모델이 실제로 학습한 최대 길이이지만, 헤드라인 검색 주장은 그 여섯 배인 12M까지 확장됩니다.
그러나 공개 자료에는 어떤 모델이 변환됐는지 나와 있지 않습니다. 원본 모델의 정체는 비공개이며, 독립 연구자들은 추측으로 빈자리를 채우고 있습니다. 한 연구자는 SubQ가 Kimi나 DeepSeek 같은 오픈 모델의 희소 어텐션 파인튜닝일 수 있다고 제안했는데 , 이는 262K 시작 컨텍스트와 모델 카드의 변환 공개 내용과 맥락이 맞는 추측입니다. Subquadratic은 어떤 후보도 확인해주지 않았습니다.
이 미공개는 일반적인 비공개보다 훨씬 중요한 문제입니다. 원본 모델을 알 수 없으면 공개 데이터만으로는 핵심 질문에 답할 수 없기 때문입니다. 원본을 모르는 상태에서는 SSA의 아키텍처적 기여분을, 원본 모델이 원래 갖고 있던 장문 컨텍스트 능력이나 그 위에 쌓인 추가 사전학습 레시피의 효과와 분리할 방법이 없습니다. 모델 카드도 이 점을 직접 인정합니다. 팀은 동일한 추가 사전학습 레시피를 아키텍처가 다른 백본과 짝지어 통제된 절제 실험을 수행하지 않았기 때문에, 아키텍처 특이적 효과를 배제할 수 없다는 것입니다 . VentureBeat도 같은 우려를 포착했습니다. 서브쿼드라틱 아키텍처가 소·중 규모에서는 조밀한 어텐션과 대등하지만 프런티어 규모에서는 성능이 떨어지는 역사적 패턴을 언급하며, 연구자들이 효율성 이득의 독립적 증거를 요구하고 있다고 전했습니다 . 원본 모델이 공개되거나 백본 통제 절제 실험이 등장하기 전까지, 이후에 나오는 모든 벤치마크는 이식체와 숙주를 합쳐 측정하는 것이며, 어느 쪽의 공헌인지 가릴 방법이 없습니다.
128K에서의 RULER, 12M에서의 NIAH: 단계별 요약
SubQ 1.1 Small의 검색 점수는 가장 강력한 근거이며, 단일 니들 테스트를 넘어서도 일관되게 유지됩니다. 모델 카드에 따르면 128K 컨텍스트에서 RULER 점수는 99.12%이며, 1M·2M 토큰에서는 니들 인 어 헤이스택(NIAH) 완전 일치율 100%를 기록했고, 6M·12M에서는 98%로 소폭 하락합니다 . RULER는 13개 태스크(NIAH 변형 + 멀티홉 추적·집계)를 망라하기 때문에 단순 니들 테스트보다 더 의미 있으며, 단순 니들 검색이 장문 컨텍스트 이해 능력을 과대평가할 수 있다는 문제의식에서 설계된 벤치마크입니다 . 높은 RULER 점수는 모델이 단순히 하나의 사실을 찾는 것이 아니라 여러 사실을 추적하고 결합하고 있음을 나타냅니다.
Subquadratic이 의뢰한 Appen이 RULER의 niah_single_1 태스크를 독립적으로 재현한 결과, 동일한 패턴이 확인됐습니다: 1M·2M에서 100% 완전 일치, 6M·12M에서 98%, 단계별 샘플 50개, 온도 0, 실행 오류 0건 . 모델 카드와 의뢰 보고서 간의 일치는 재현성 측면에서 안심이 되지만, 두 결과 모두 공개 리더보드가 아닌 Subquadratic이 비용을 지불한 작업에 기반합니다.
| 컨텍스트 단계 | NIAH 완전 일치율 | 2M 훈련 최대치 대비 | 출처 |
|---|---|---|---|
| 128K (RULER, 13개 태스크) | 99.12% | 훈련 분포 내 | 모델 카드 |
| 1M | 100% | 훈련 분포 내 | 카드 + Appen [1][5] |
| 2M | 100% | 훈련 최대치 | 카드 + Appen [1][5] |
| 6M | 98% | 훈련 최대치 3배 초과 | 카드 + Appen [1][5] |
| 12M | 98% | 훈련 최대치 6배 초과 | 카드 + Appen [1][5] |
가장 중요하게 살펴봐야 할 구분은 내삽(interpolation)과 외삽(extrapolation)의 차이입니다. 모델의 최장 지속 사전훈련 단계는 2M 토큰에서 끝났으므로, 12M은 훈련 중 한 번도 본 적 없는 길이의 6배에 달합니다 . 6M·12M 점수는 훈련 분포 내 내삽이 아닌, 그 바깥을 향한 외삽입니다. 그럼에도 곡선이 단 2포인트만 하락한다는 점은 진정으로 주목할 만한 결과이자, 가장 면밀한 검토가 필요한 부분이기도 합니다. 12M에서 모델이 주목하는 토큰 쌍은 전체의 약 0.13%로, 약 1,000배 감소한 수준입니다 . 따라서 핵심 질문은, 헤이스택이 훈련에서 본 것보다 6배 더 클 때도 희소 라우팅이 올바른 니들을 찾아낼 수 있는가입니다.
단계별 50개 샘플 설계가 실질적인 주의점입니다. 50개의 UUID 조회 홀드아웃은 매우 좁은 슬라이스로, 치명적 실패를 감지하기엔 충분하지만 최장 길이 또는 다양한 태스크 유형에 걸친 강건한 통과율을 추정하기엔 부족합니다. 50개 샘플에서의 98%는 2건의 실패를 의미하며, 신뢰 구간은 넓습니다. 6M·12M 수치는 더 큰 샘플 크기와 niah_single_1뿐 아니라 전체 13개 태스크 RULER 스위트에서 재현될 때까지 잠정적인 것으로 간주해야 합니다.
Appen 보고서가 담은 것과 빠진 것

Appen의 데이터는 SubQ가 보유한 제3자 검증 자료 중 가장 신뢰에 가깝지만, 독립적 감사가 아닌 의뢰 형식으로 작성됐습니다. Appen은 Subquadratic의 요청을 받아 모델을 벤치마크했으며, 보고서는 독립적 감사가 아닌 회사의 설정을 검증하는 데 그칩니다 . 표제 수치는 명시된 조건 하에서 실제로 재현 가능하지만, 마케팅 프레이밍이 암시하는 것보다 훨씬 좁은 범위입니다. 보고서를 읽을 때는 실제로 측정한 대상에 집중해야 합니다. 프로덕션 파이프라인이 아닌 단일 어텐션 레이어입니다.
핵심 요약: Subquadratic이 비용을 지불한 Appen은 B200에서 1M 토큰 기준 SSA를 381ms, FlashAttention-2를 21.4초로 측정해 56.2배 속도 향상을 기록했습니다 . 단, 이는 단일 어텐션 레이어 커널 측정치이며, 전체 프리필·배치·엔드투엔드 프로덕션 지연 시간이 아닙니다.
서로 다른 하드웨어를 대상으로 한 두 개의 별도 보고서가 존재합니다. 하나는 H100(CUDA 12.x) 환경을 다루고, 나머지 하나는 CUDA 13.0, PyTorch 2.11.0, bfloat16으로 구동되는 B200을 대상으로 3회 워밍업 후 5회 타이밍 측정을 수행합니다 . B200에서 1M 토큰 패스는 SSA가 381ms, FlashAttention-2가 21.4초로 측정됐으며, 이 56.2배의 실제 경과 시간이 SubQ 효율성 주장의 핵심 수치입니다 . FLOP 감소율은 시퀀스 길이에 따라 선형적으로 증가합니다. 128K에서 7.9배였던 것이 1M에서는 62.8배로 올라가며, 이 시점에서 SSA는 144.9 TFLOP을 연산하는 반면 밀집 어텐션은 9,095.2 TFLOP을 소비합니다 . 이 기울기가 중요한 이유가 여기 있습니다. 짧은 컨텍스트에서는 이점이 미미하고, SubQ가 겨냥한 수백만 토큰 이상의 길이에서만 극적인 차이가 나타납니다.
| 컨텍스트 길이 | FLOP 감소율 (SSA vs FA2) | 비고 |
|---|---|---|
| 128K | 7.9× | 짧은 컨텍스트에서는 미미함 |
| 1M | 62.8× | 144.9 vs 9,095.2 TFLOP |
| 1M (실제 경과 시간) | 56.2× | 381 ms vs 21.4 s, B200 |
보고서가 담지 못한 내용은 다음과 같습니다. 비교 대상은 단일 어텐션 레이어 또는 격리된 커널 측정치입니다. 전체 레이어에 걸친 완전한 프리필도, 배치 병렬 요청도, 현실적인 혼합 길이 입력의 엔드투엔드 지연 시간도 아닙니다 . 실제 서빙 스택에서 어텐션은 여러 비용 중 하나에 불과합니다. MLP 블록, KV 캐시 이동, 메모리 대역폭, 배치 스케줄링 등이 레이어 수준의 속도 향상을 희석시킵니다. 모델 카드에 기재된 H100 수치(966ms vs 54,164ms, 56배 단일 레이어 속도 향상)는 Appen의 B200 결과와 방향성이 일치하며, 이는 스케일링 주장을 뒷받침하지만 부하 상황에서의 처리량에 대해서는 아무것도 말해주지 않습니다 .
보도 자체가 이 간극을 지적합니다. 정확한 속도 향상 수치는 "하드웨어, 구현 범위, 그리고 비교 대상이 전체 프리필인지 격리된 레이어/커널 측정인지에 따라 달라진다"는 것입니다 . VentureBeat는 더 넓은 반응을 솔직하게 전했습니다. 독립 연구자들은 공급업체 및 의뢰 수치를 액면 그대로 받아들이는 대신 "효율성 향상에 대한 독립적 증명"을 요구하고 있다고 합니다 . 56배라는 수치는 커널 측면에서의 상한선 주장으로, SSA의 점근적 특성이 실제로 유효하다는 명확한 신호로 받아들이되, 프로덕션 처리량 보장으로 오해해서는 안 됩니다. 개발자가 실제로 관심 갖는 수치, 즉 부하 상태의 서버에서 달러당 초당 토큰 수는 어느 보고서에도 없습니다.
AutomationBench Finance: 13% vs. Opus 4.8 및 GPT-5.5
에이전틱 및 추론 과제에서 SubQ 1.1 Small은 혼재되어 있지만 의미 있는 수치를 기록했습니다: GPQA Diamond pass@1 85.4%, LiveCodeBench v6 pass@4 89.7%, AutomationBench Finance 13% . 앞의 두 수치는 표준 능력 검증 항목이고, 세 번째 수치는 Subquadratic이 모델이 단순 검색을 넘어서는 역량을 보유한다고 주장하는 근거입니다. AutomationBench Finance는 애플리케이션 간 워크플로 오케스트레이션을 측정합니다: 여러 도구에 걸쳐 REST API 호출을 연결하고, 채팅 대화 내용이 아닌 프로그래밍 방식의 최종 상태를 채점합니다 . 이 13%가 면밀히 검토해야 할 수치입니다. 동일한 조건에서 제출한 적 없는 경쟁사를 상대로 비교한 수치이기 때문입니다.
세 수치 중 LiveCodeBench 결과가 가장 신뢰할 만합니다. pass@4 89.7%는 1,055개 문제와 4,220개 풀이를 포함하며, 이 벤치마크는 설계상 오염에 강합니다: LeetCode, AtCoder, Codeforces에서 지속적으로 문제를 수집하고, 날짜 필터링을 통해 모델 훈련 컷오프 이전 항목을 제외합니다 . 오염 통제를 통과한 코딩 점수는 단편적인 테스트보다 더 강한 신호입니다.
AutomationBench Finance에서 논거가 공격적으로 전개됩니다. Subquadratic은 자사의 13%를 최전선 에이전틱 모델과 근접하고 중간 단계 모델보다 훨씬 앞선 수치로 포지셔닝합니다:
| 모델 | AutomationBench Finance |
|---|---|
| GPT-5.5 | 18% |
| Opus 4.8 | 16% |
| SubQ 1.1 Small | 13% |
| Sonnet 4.6 | 8% |
이 단일 과제에서 13%는 SubQ를 Sonnet 4.6보다 Opus 4.8에 더 가깝게 위치시킵니다 . 문제는 출처입니다: 표의 모든 경쟁사 수치는 Opus, GPT-5.5, Sonnet이 자체 벤더에 의해 공개된 조건하에 실행된 공개 리더보드가 아닌 Subquadratic과 Appen 자료에서 나온 것입니다 . 벤더가 자체 통제하는 테스트 환경에서 경쟁사를 벤치마킹할 때, 상대적 순위는 결과가 아닌 주장에 불과합니다.
두 가지 주의사항이 따릅니다. 첫째, AutomationBench Finance는 단일 워크플로 도메인입니다. 금융 오케스트레이션에서의 13%는 다양한 멀티 애플리케이션 과제에 대해 아무것도 말해주지 않으며, 다양한 워크플로에서 SubQ와 실제 최전선 선두 모델(o3, GPT-5.5) 간의 격차는 아직 파악되지 않았습니다. 둘째, 세 점수 모두 절대적 수치로는 낮습니다: 18%의 상한선은 가장 강력한 모델조차 대부분의 금융 오케스트레이션 실행에서 실패함을 의미하므로, 5점 차이로 구분되는 모델들은 모두 어려움을 겪고 있습니다. 개발자 입장에서 시사점은 표가 암시하는 것보다 좁습니다: SubQ는 자체 의뢰한 테스트 환경에서 채점될 때 어려운 에이전틱 영역에서 경쟁력이 있으며, 이는 확정된 순위가 아닌 독립적 리더보드 확인을 기다리는 가설입니다.
SubQ가 공개하지 않는 것들

2026년 6월 현재, SubQ는 비공개 미리보기, 디자인 파트너 전용 시스템으로 유지되고 있으며, 헤드라인 수치의 근거 자료들은 외부 엔지니어가 재현하거나 스트레스 테스트하는 데 필요한 대부분의 정보를 공개하지 않습니다. 공개 사이트와 SubQ 1.1 Small 모델 카드는 파라미터 수, 도너 모델 신원, 전체 SSA 메커니즘, 총 지속 사전훈련 토큰 예산, 정확한 데이터셋 구성을 공개하지 않습니다 . 모델 카드는 SSA 메커니즘을 명시적으로 범위 밖에 두고 있어, 전체 효율성 스토리가 의존하는 콘텐츠 인식 라우팅은 원칙적으로만 설명되고 세부사항은 공개되지 않습니다 .
운영상의 공백은 아키텍처적 공백만큼 중요합니다. 공개된 안전성 평가, 가격 정보, 속도 제한, 다운로드 가능한 가중치, 일반 공개 날짜가 없습니다 . 개발자 입장에서는 배포 예산을 책정하거나 거부 동작을 감사하거나 자체 호스팅을 할 수 없습니다: OpenAI 호환 엔드포인트는 이론적으로 전환 비용을 낮추지만, 실제로는 디자인 파트너만 사용할 수 있습니다.
특히 주목해야 할 두 가지 공개 공백이 있습니다. 첫째, Subquadratic은 2026년 5월 14일 표준화된 공개 벤치마크 생성을 위한 LayerLens/Stratix 평가 파트너십을 발표했지만, 2026년 6월 16일 모델 카드 출시 시점까지 결과가 발표되지 않았습니다 . 벤더 보고 수치의 위험을 줄여줄 수 있는 독립적 제3자는 아직 보고하지 않았습니다. 둘째, 모델 카드는 SSA 논거에 직접적으로 관련된 방법론적 한계를 인정합니다:
"팀은 동일한 지속 사전훈련 방식을 아키텍처적으로 구별되는 백본과 결합한 통제 ablation을 실행하지 않았으므로, 아키텍처 특정 효과를 배제할 수 없습니다," — SubQ 1.1 Small 모델 카드, Subquadratic Inc. (source: subq.ai).
이것이 핵심적인 방법론적 공백입니다. 동일한 방식 하에서 SSA를 밀집 어텐션 백본으로 교체하는 ablation 없이는, 보고된 성능 향상을 도너 모델이나 지속 사전훈련 데이터가 아닌 희소 어텐션 설계에 명확히 귀속시킬 수 없습니다. 이는 연구자들의 광범위한 회의론과 일치합니다: VentureBeat는 효율성 주장에 대한 독립적 증거를 요구하는 것이 공통된 의견이라고 표현했습니다 . 실용적 시사점: SubQ를 오늘 채택할 수 있는 벤치마킹된 제품이 아닌, 검증된 후원자들을 보유한 흥미로운 아키텍처 가설로 취급하세요.
외부 감사가 다뤄야 할 사항
SubQ에 대한 독립 검증은 기업 및 벤더 발표 수치가 남겨둔 네 가지 구체적인 공백을 겨냥해야 한다. 공개된 결과는 격리된 커널 측정과 검색형 태스크에 크게 의존하고 있어, 외부 감사는 전체 프리필 타이밍, 태스크 유형별 라우팅 품질, 통제된 아키텍처 절제 실험, 그리고 공개 리더보드 제출을 확보해야 헤드라인 주장을 방향성 증거가 아닌 실제 제품 동작으로 인정할 수 있다.
- 실제 운영 배치 크기에서의 전체 프리필. 모델 카드에 기재된 H100에서 1M 토큰 처리 시 FlashAttention-2 대비 56× 속도 향상(966 ms vs 54,164 ms) 과 Appen의 B200 기준 56.2× 결과(381 ms vs 21.4 s) 는 단일 어텐션 레이어 테스트다. 감사는 하나의 커널 대 FA2 비교가 아니라, 대표적인 워크로드에서 현실적인 배치 크기로 측정한 엔드투엔드 프리필 및 디코드 레이턴시를 보고해야 한다.
- 검색 이상의 라우팅 품질. SubQ의 가장 강한 점수는 RULER 128K(99.12%)와 Needle-in-a-Haystack 1M–2M(100%)이다 . 아직 열린 질문은, 검색 성능이 이미 98%로 떨어지는 6M–12M 구간에서 콘텐츠 의존형 SSA 선택이 단일 바늘 검색뿐 아니라 멀티홉 추적·집계·지시 이행에서도 올바른 위치를 찾아내는지 여부다.
- 통제된 절제 실험. 모델 카드 자체도 팀이 지속적 사전훈련 레시피를 아키텍처적으로 다른 백본과 짝지어 실험하지 않았음을 인정한다 . 동일 레시피를 밀집 어텐션 백본과 SSA 백본에 각각 적용해야만 아키텍처 기여분을 도너 모델·학습 데이터 기여분과 분리할 수 있다.
- 공개 리더보드 제출. GPQA Diamond 85.4%, LiveCodeBench v6 pass@4 89.7%, AutomationBench Finance에서 Opus 4.8(16%)·GPT-5.5(18%) 대비 13%라는 경쟁사 비교 수치는 독립 리더보드가 아닌 Subquadratic/Appen 자료에서 등장한다 . 표준 조건으로 리더보드에 제출해야 커뮤니티가 이를 검증할 수 있다.
2026년 5월 14일 발표된 LayerLens/Stratix의 표준화된 공개 벤치마크 파트너십은 이 중 상당수를 검증하기에 적합한 장이지만, 검토된 정적 페이지에서는 아직 결과가 확인되지 않는다 . 그 결과가 나오기 전까지 핵심 결론은 유효하다. SubQ는 신뢰할 만한 지원을 받은 아키텍처 가설이지만 검증 부채가 남아 있으며, 연구자들이 독립적 증거를 요구해야 한다는 VentureBeat의 시각 은 올바른 자세다. LayerLens 결과를 주목하라. 56×가 감사 가능한 수치가 되는지 여부는 바로 거기서 판가름 난다.
자주 묻는 질문
SSA(Subquadratic Sparse Attention)란 무엇인가요?
SSA는 SubQ의 핵심인 콘텐츠 의존형 희소 어텐션(sparse attention) 메커니즘입니다. 각 쿼리에 대해 관련성이 높다고 판단되는 소수의 토큰 위치를 선별하고, 해당 위치에 대해서만 정확한 어텐션을 계산합니다. Subquadratic에 따르면 이 방식은 밀집 Transformer 어텐션처럼 이차적(O(n²))이 아닌, 연산량과 메모리 모두 대략 선형(O(n))으로 확장됩니다 . 회사는 선택된 위치에서 정확한 어텐션을 유지하면서 콘텐츠 인식 라우팅을 강조함으로써, 고정 패턴 희소 어텐션(Longformer, BigBird)이나 상태 공간 모델(Mamba, RWKV)과 차별화합니다 . 전체 메커니즘은 공개적으로 설명되지 않았으며, 모델 카드에서도 명시적으로 범위 밖으로 규정하고 있습니다 .
SubQ 평가 시 익명의 기증 모델이 왜 중요한가요?
SubQ 1.1 Small은 처음부터 학습된 모델이 아니기 때문에 중요합니다. 모델 카드에 따르면, 팀은 기존 오픈 웨이트 프론티어 모델을 가져와 밀집 어텐션을 SSA로 교체하는 방식으로 변환하고, 262K 토큰 기반에서 2M까지 단계적 컨텍스트 확장과 사전학습을 이어갔습니다 . 기증 모델의 정체를 모르면, 벤치마크 결과가 SSA 자체의 성능인지 기증 모델의 기존 역량과 학습 레시피 덕분인지 구분할 수 없습니다. 팀 또한 동일한 레시피를 구조적으로 다른 백본과 대조하는 제어 절제 실험(controlled ablation)을 수행하지 않았음을 인정하며, 따라서 아키텍처 특유의 효과를 배제할 수 없습니다 . 독립 연구자들은 이를 핵심 공개 누락으로 지적했으며, 한 연구자는 기반 모델이 Kimi나 DeepSeek 같은 모델일 수 있다고 추정했습니다 .
12M 토큰에서 99% NIAH 결과는 의미 있는 수치인가요?
긍정적인 신호이지만, 그 범위는 제한적입니다. Subquadratic에 따르면 1M 및 2M 토큰에서 Needle-in-a-Haystack(NIAH) 검색 정확도는 100%이며, 별도 보류 세트인 50개 샘플 UUID 테스트에서는 6M과 12M 토큰 시 98%로 떨어집니다 . 핵심적인 주의 사항은 외삽(extrapolation)입니다. 12M은 최대 학습 길이인 2M의 6배이며, 각 구간마다 온도 0에서 겨우 50개 샘플만 사용해 통계적 근거가 빈약합니다 . 128K에서의 RULER 점수 99.12%는 더 강력한 다중 과제 지표인데, RULER는 단순 바늘 검색이 아닌 멀티홉 추적과 집계를 포함한 13개 과제로 구성되어 있기 때문입니다 . 다만 이 역시 Appen이 계약에 따라 측정한 결과입니다 .
지금 당장 SubQ를 프로덕션에서 사용할 수 있나요?
아니요. 2026년 6월 현재, SubQ 1.1 Small은 비공개 프리뷰 및 디자인 파트너 단계에 머물러 있습니다. 회사 측에 따르면 2026년 후반 2M~12M 라인업을 폭넓게 출시하기에 앞서 선별된 파트너와 먼저 배포하고 있는 상황입니다 . OpenAI 호환 엔드포인트는 원칙적으로 존재하며 전환 비용을 낮춰줍니다 . 그러나 공개 자료에는 퍼블릭 API, 공식 가격 정책, 속도 제한, 다운로드 가능한 가중치, 일반 공개 일정 등이 명시되어 있지 않습니다 . 배포 가능한 의존성이 아닌, 평가 단계의 기술로 취급해야 합니다.
56× 속도 향상 주장은 얼마나 신뢰할 수 있나요?
커널 수준의 상한선 주장으로 받아들여야 합니다. 56× 수치는 1M 토큰에서 단일 어텐션 레이어만 따로 측정한 결과입니다. 모델 카드에 따르면 H100에서 SSA는 966ms, FlashAttention-2는 54,164ms로 나타났으며 , Appen의 별도 B200 보고서는 381ms 대 21.4초, 즉 벽시계(wall-clock) 기준 56.2× 속도 향상을 보고합니다 . 두 측정 모두 Subquadratic의 의뢰로 Appen이 수행한 것이며, 전체 프리필(prefill), 배치 처리, 또는 엔드투엔드 프로덕션 지연 시간은 포함되지 않습니다 . 확장 방향성은 타당하지만, 실제 성능 향상은 하드웨어, 구현 범위, 그리고 테스트가 단일 레이어인지 전체 패스인지에 따라 달라집니다. 발표된 LayerLens 파트너십을 통한 독립적인 감사가 이루어져야 비로소 검증 가능해질 것입니다 .