α-entmax 타일 스킵, softmax 한계 넘다; 354M 미확인

AdaSplash-2: α-entmax 정확한 0, Triton 타일 스킵, BSD-3 라이선스. 354M 체크포인트 공개 여부 미확인.

α-entmax 타일 스킵, softmax 한계 넘다; 354M 미확인
Share

"커스텀 Triton tile-skip 커널을 갖춘 354M 소프트맥스 없는 오픈 웨이트 모델"이라는 이야기가 돌고 있습니다. 하지만 파라미터 수는 실제로 다운로드할 수 있는 어떤 모델과도 맞지 않고, 실제로 공개된 부분도 체크포인트가 아닙니다.

AdaSplash-2의 소프트맥스 없는 tile-skip은 실제로 통할까?

이 이야기의 바탕에 있는 연구는 AdaSplash-2입니다. 이 방식은 dense softmax attention을 α-entmax로 바꿉니다. α-entmax는 점수가 낮은 토큰에 정확히 0의 확률을 부여하는 정규화 방식이라, Triton 커널이 전체 score matrix를 훑는 대신 전부 0인 attention tile block을 통째로 건너뛸 수 있습니다. 이는 근사 pruning이 아니라 정확한 sparsity입니다. 블록은 정말 비어 있기 때문에 건너뜁니다. 논문(arXiv:2604.15180, 2026년 4월 제출, BSD-3-Clause)은 이 아이디어를 스케일에서 검증하기 위해 350M 및 1B LLaMA-3 스타일 causal LM을 학습했습니다 .

요약 답변: AdaSplash-2는 softmax를 α-entmax로 바꿔 attention weight에 정확한 0을 만들고, Triton 커널이 빈 tile block을 건너뛰게 합니다. 32K context의 1B 스케일에서 α-entmax+NAPE는 RULER의 모든 길이에서 softmax+NAPE를 앞섭니다(4K에서 54.7 대 48.1). 하지만 공개된 350M/354M 체크포인트는 없습니다. 공개된 것은 커널뿐입니다.

품질 신호는 실제입니다. 32K context extension을 적용한 1B 스케일 RULER에서 α-entmax+NAPE는 테스트된 모든 길이에서 softmax+NAPE를 앞섰습니다. 4K에서 54.7 대 48.1, 32K에서 39.4 대 36.8입니다 . 따라서 중요한 지점, 즉 long-context retrieval에서는 메커니즘이 통합니다.

문제는 "354M open-weights" 주장입니다. 1차 출처를 보면 350M 또는 354M causal-LM 체크포인트는 없습니다. SARDINE Lab의 Hugging Face 조직에는 논문의 scaled model이 아니라 SparseModernBERT-alpha2.0(약 0.1B, MIT 라이선스)이 올라와 있습니다 . 오늘 실제로 사용할 수 있는 것은 커널입니다. pip로 설치 가능하고 BSD-3 라이선스이며, 위치는 github.com/deep-spin/adasplash입니다. 이를 바로 불러다 쓰는 완성 모델이 아니라, 자신의 학습 실행에 넣을 수 있는 연구용 인프라로 보는 것이 맞습니다.

소프트맥스가 정확한 sparsity를 막는 이유

α-entmax tile-skips what softmax can't; 354M unconfirmed

Softmax는 진짜 0을 만들 수 없습니다. 지수 정규화가 각 score의 exponent를 모든 exponent의 합으로 나누기 때문에, 어떤 key든 점수가 아무리 낮아도 확률 질량의 0이 아닌 몫을 유지합니다. 이것이 tile-skip 커널이 softmax matrix를 신뢰할 수 없는 구조적 이유입니다. "이 블록은 전부 0이다"라고 안전하게 검사할 조건이 없고, 나중에 작은 값을 pruning하면 남은 weight의 합이 더 이상 1이 아니게 되어 수치적 차이가 생깁니다. α-entmax는 의도적으로 이 보장을 깹니다. α > 1일 때 이 정규화 방식은 row별 최적화를 풀어, 학습 시점에 점수가 낮은 토큰을 정확히 0으로 매핑합니다. 그 결과 반올림으로 작아진 softmax가 아니라 hard sparse distribution이 나옵니다 .

수학보다 중요한 것은 그 downstream 효과입니다. score matrix가 실제로 sparse하기 때문에 AdaSplash-2의 Triton 커널은 bit-packed block mask를 만들고, forward와 backward pass 모두에서 0이 아닌 query/key tile만 방문할 수 있습니다 . 정확한 0은 skip의 전제조건입니다. 작지만 양수인 softmax weight가 남아 있다면 커널은 결국 모든 tile을 훑어야 합니다.

정확한 sparsity는 익숙한 softmax 부산물도 없앱니다. attention sink, 즉 softmax가 어디에도 0 질량을 할당하지 못하게 하기 때문에 모델이 계속 기대는 지속적 고점 토큰은 패치되는 것이 아니라 구조적으로 제거됩니다. α-entmax는 증상을 억누르는 대신 그것을 만드는 메커니즘 자체를 제거합니다.

"차별점은 backward pass까지 포함해 커널 전반에서 end-to-end로 활용되는 동적이고 정확한 sparsity입니다." — AdaSplash-2 저자들, SARDINE Lab (source: arXiv:2604.15180).

α-entmax만이 이 속성에 이르는 유일한 길은 아닙니다. Snap Research가 Oxford 및 CMU 협력자들과 함께 제안하고 ACL 2026에 채택된 Threshold Differential Attention(TDA) 은 다른 경로, 즉 differential attention score에 threshold를 적용하는 방식으로 정확한 0에 도달하며, fused Triton tile-skip 커널도 함께 제공합니다 . 두 작업은 독립적이고 같은 시기에 나왔습니다. 정규화 설계 공간의 반대쪽 끝에서 출발했지만, 커널 수준에서 같은 이득으로 수렴합니다.

히스토그램 임계값 솔버: 1~2회 반복

AdaSplash-2의 핵심 시스템 기여는 각 행의 α-entmax 임계값을 저렴하게 찾는 방식에 있습니다. α-entmax는 각 행의 컷오프 아래에 정확히 0의 질량을 할당하기 때문에, 모든 커널 패스는 먼저 그 컷오프를 풀어야 합니다. 기존 AdaSplash(arXiv:2502.12082, 2025)는 원시 어텐션 점수를 여러 번 스트리밍 패스하며 이를 처리했습니다 . 긴 컨텍스트에서는 이 반복 순회가 병목입니다. 임계값을 찾는 비용이, 희소성이 줄여 주어야 할 바로 그 시퀀스 길이에 따라 커지기 때문입니다.

AdaSplash-2는 이 작업을 단일 패스로 압축합니다. 어텐션 점수를 온칩 SRAM에 저장된 8개 bin 히스토그램으로 스트리밍하고, 그 히스토그램에서 곧바로 임계값의 경계가 있는 하한 추정치를 도출한 뒤, 보호 장치가 있는 하이브리드 솔버에 넘겨 이를 정제합니다 . 순진한 초기 추정 대신 히스토그램에서 나온 경계값으로 솔버를 시작하는 것이 보통 1~2회의 정제 반복만으로 수렴하게 만드는 핵심입니다 . 2025년 버전에서 필요했던 다중 패스 스캔을 대체하는 방식입니다.

같은 커널 패스는 타일 건너뛰기를 가능하게 하는 구조도 함께 만듭니다. 점수가 스트리밍되는 동안 AdaSplash-2는 쿼리/키 타일 위에 비트 패킹된 이진 블록 마스크를 구성합니다. 기본 설정은 히스토그램 bin 8개, 64비트 패킹, 64토큰 키 블록이며, 커널이 flush되기 전까지 쿼리 블록당 16,320개 키를 수용할 수 있다고 설명합니다 . 이 마스크는 GPU 네이티브 find-next-set 및 population-count 연산으로 순회되므로, 커널은 0으로 채워진 타일을 반복하지 않고 다음 nonzero 블록으로 바로 점프합니다.

양방향 패스 모두 이 마스크를 재사용합니다. 순전파와 역전파는 비트 패킹 레이아웃에 기록된 nonzero 블록만 방문하며, 저자들은 dense attention 대비 실제 시간 차이가 가장 크게 벌어지는 지점이 역전파라고 명확히 말합니다. 조밀한 점수 행렬 위의 그래디언트 계산이 학습에서 비용이 큰 절반이기 때문에, 0 타일을 끝까지 건너뛰는 것이 학습 시간 절감의 대부분을 만들어냅니다 . 구현은 BSD-3-Clause 라이선스로 github.com/deep-spin/adasplash에 공개되어 있으며, 커널 실행에는 PyTorch, Triton, CUDA가 필요합니다.

Snap Research의 TDA: ACL 2026에 함께 등장한 접근법

α-entmax tile-skips what softmax can't; 354M unconfirmed

AdaSplash-2만 올해 나온 softmax 없는 tile-skip 커널은 아닙니다. Snap Inc.가 Oxford, CMU 협력자들과 함께 만든 Threshold Differential Attention(TDA)도 큰 흐름은 같습니다. softmax를 제거하고, 정확한 0을 만들고, 그 결과를 0 타일을 건너뛰는 Triton 커널에 fuse합니다. 다만 도달 방식은 다릅니다. TDA는 differential attention 점수에 학습된 hard threshold를 적용해, α-entmax의 행별 정규화 값을 푸는 대신 컷오프 아래의 모든 값을 0으로 만듭니다. 이 논문은 2026년 1월 arXiv에 제출되었고, 2026년 4월 v2로 개정되었으며, ACL 2026에 채택되었습니다 . 코드는 github.com/snap-research/TDA에 MIT 라이선스로 공개되어 있습니다 .

"354M" 수치를 추적하는 사람에게 중요한 세부사항은 이것입니다. TDA가 공개 벤치마크한 체크포인트는 약 162M 파라미터 규모의 GPT-2 변형입니다 . 이는 354M과 맞지 않으며, 확인된 TDA 릴리스 중에도 354M에 해당하는 것은 없습니다. TDA의 보고 결과도 이 162M 모델에서 나온 것이므로, 그 수치를 AdaSplash-2의 350M/1B LLaMA-3 스타일 실행을 설명하는 데 가져다 쓰면 안 됩니다.

두 프로젝트는 하나의 조율된 공개가 아니라, 같은 시기에 독립적으로 나온 작업으로 보아야 합니다. 별도로 제출되었고, 구조도 다릅니다. 한쪽은 differential 점수에 학습된 임계값을 적용하고, 다른 한쪽은 히스토그램으로 초기화한 α-entmax 솔버를 사용합니다. 보고한 모델과 규모도 서로 다릅니다. 파라미터 수나 벤치마크 표를 뒤섞으면 어느 논문도 뒷받침하지 않는 주장이 됩니다. 공통된 단서는 이 점을 더 분명히 합니다. 논문 제출일 기준으로 두 프로젝트 모두 Hugging Face에 350M 이상 규모의 확인된 causal-LM 체크포인트를 공개하지 않았고, TDA의 GitHub에는 커널과 학습 코드는 보이지만 1차 출처에서 눈에 띄는 체크포인트 링크는 없습니다 . 두 경우 모두 실제로 공개된 것은 가중치가 아니라 커널입니다.

32K RULER 평가: α-entmax와 softmax 정면 비교

1B 규모의 RULER 긴 컨텍스트 평가에서 NAPE 위치 인코딩을 적용한 α-entmax는 측정된 모든 컨텍스트 길이에서 softmax+NAPE 기준선을 앞섰다. 4K에서는 54.7 대 48.1, 8K에서는 49.9 대 46.4, 16K에서는 45.4 대 43.3, 32K에서는 39.4 대 36.8이었다 . 차이는 극단적인 길이에서만 나타난 것이 아니라 전 구간에서 유지된다. 이 점이 더 깔끔한 신호다. 정확한 희소성이 가장 도움이 되어야 하는 길이에서도 품질을 희생하지 않는다는 뜻이기 때문이다.

컨텍스트 길이α-entmax + NAPESoftmax + NAPE격차
4K54.748.1+6.6
8K49.946.4+3.5
16K45.443.3+2.1
32K39.436.8+2.6

이 수치를 재현하려는 사람에게는 학습 방식도 중요하다. 350M과 1B LLaMA-3 스타일 모델은 모두 NVIDIA H100 4대에서 50B DCLM-Edu 토큰으로 학습됐고, 기본 컨텍스트는 4096토큰, 유효 배치는 약 524k토큰, 전체 100k 스텝에 걸친 WSD 스케줄을 사용했다 . 32K 결과는 마지막 20% 스텝에 적용한 ProLong 스타일 컨텍스트 확장 단계에서 나온 것이다. 즉 RULER 점수는 기본 4K 실행이 아니라 확장된 모델을 반영한다.

효율은 블록 희소성을 그대로 따라간다. bf16에서 헤드 차원이 64일 때 AdaSplash-2는 낮은 블록 희소성에서는 FlashAttention-2와 비슷하고, 중간에서 높은 희소성 구간에서는 앞서 나간다. 교차점은 대략 60% 블록 희소성으로 제시되며, 높은 희소성 한계에서는 2배를 넘는 속도 향상이 주장된다 . 그 교차점 아래에서는 임계값을 푸는 오버헤드를 치르면서도 건너뛴 타일이 충분하지 않아 이득을 내지 못한다. 그래서 짧은 컨텍스트에서 공짜로 바꿔 끼울 수 있는 선택지는 아니다.

저자들이 직접 제기한 단서도 하나 있다. α-entmax 모델은 LAMBADA perplexity에서 softmax보다 뒤처지며, 논문은 이를 해결된 문제가 아니라 열린 문제로 표시한다 . RULER 표는 긴 컨텍스트에서 동급이거나 더 낫다는 증거로 읽어야지, 모든 벤치마크에서 전반적인 품질 동등성을 보장하는 근거로 읽으면 안 된다. 참조 커널은 BSD-3-Clause로 공개되어 있으므로 , 희소성과 속도의 교차점은 논문 주장만 믿지 말고 자신의 워크로드에서 직접 측정할 수 있다.

BSD-3 라이선스는 공개됐다. 그런데 350M 체크포인트는 어디에 있나?

α-entmax tile-skips what softmax can't; 354M unconfirmed

커널 설치는 쉽다. pip install 'adasplash>=0.2.0'를 실행하면 지원되는 기본 어텐션 호출이 자동으로 AdaSplash-2 Triton 경로로 라우팅된다 . PyTorch와 Triton에 의존하고, 실행에는 CUDA가 필요하다. 논문의 실험은 NVIDIA H100에서 수행됐다 . 그래서 오늘 당장 커널을 학습 루프에 연결할 수는 있다. 아직 할 수 없는 것은 대표 모델을 다운로드하는 일이다.

SARDINE Lab의 Hugging Face 조직에는 실제로 쓸 수 있는 아티팩트가 올라와 있다. SparseModernBERT-alpha1.5alpha2.0은 MIT 라이선스의 약 0.1B masked-LM으로, Triton을 통해 softmax를 AdaSplash로 바꾼 모델이다 . 이 모델들은 공개되어 있고 실행도 가능하지만, 주제와는 어긋나는 점을 봐야 한다. 350M이 아니라 약 0.1B이고, causal decoder가 아니라 masked encoder다. 이들은 메커니즘이 가중치 형태로 배포될 수 있음을 보여주지만, 논문이 50B DCLM-Edu 토큰으로 학습한 350M/1B causal-LM 체크포인트는 아니다 .

출간 시점 기준으로 350M 또는 "354M", 혹은 1B AdaSplash-2 causal 체크포인트는 조직 페이지나 deep-spin/adasplash 저장소에서 확인되지 않는다 . README나 의존성 목록에서 open-weights AdaSplash-2 모델을 인용하려 한다면 먼저 현재 공개 여부를 직접 확인해야 한다. 카드가 나타나기 전까지는 "354M open weights"라는 표현을 확인되지 않은 것으로 취급하라.

같은 단서는 동시기 연구에도 적용된다. TDA 저장소는 MIT 라이선스로 fused kernel을 공개하지만, 검토한 1차 출처에서는 Hugging Face 링크나 다운로드 가능한 체크포인트가 확인되지 않았다 . 두 프로젝트 모두 실제로 의존할 수 있는 산출물은 커널이며, 가중치는 아니다.

AdaSplash-2가 밀집 어텐션보다 빨라지는 조건

AdaSplash-2는 블록 희소성이 충분히 높아 장부 관리 비용을 회수할 수 있을 때에만 밀집 어텐션보다 빨라집니다. 논문에 따르면 블록 희소성이 중간에서 높은 수준에 이르면 FlashAttention-2 대비 스텝당 학습 시간이 비슷하거나 더 좋아지며, 약 60%를 예시 임계값으로 제시합니다. 또한 bf16, 헤드 차원 64의 고희소성 한계에서는 2배가 넘는 속도 향상에 도달합니다 . 그보다 낮은 구간에서는 히스토그램 임계값 풀이와 마스크 구성이 밀집 커널에는 없는 오버헤드가 되어, 둘은 대체로 손익분기점에 머뭅니다.

희소성은 다시 컨텍스트 길이에 좌우됩니다. 1B 컨텍스트 스케일링 실험은 1B Transformer가 학습한 블록 희소성 비율을 사용했고, 최대 128K 길이까지 평가했으며, 저자들은 시퀀스가 길어질수록 희소성이 커진다고 설명합니다 . 실무적으로는 32K 이상 장문 컨텍스트 학습에서 효율성의 근거가 가장 강하고, 건너뛸 수 있는 완전 0 타일이 거의 없는 짧은 컨텍스트 파인튜닝에서는 가장 약합니다.

실제로 격차가 벌어지는 곳은 역전파입니다. 저자들은 학습 시간 이득의 상당 부분을 역전파 타일 스킵에서 온다고 설명합니다. 즉 짧은 컨텍스트의 순수 추론처럼 forward-only이고 희소성이 낮은 환경에서는 이점이 제한적입니다. 제약이 하나 더 있습니다. 커널 실행에는 PyTorch와 Triton, CUDA가 필요하며, 벤치마크는 4× NVIDIA H100에서 수행되었습니다 . AdaSplash-2와 동시기 TDA 커널 모두 CPU나 AMD 백엔드에서는 검증되지 않았으므로 , 비CUDA 스택에서는 이식성이 입증되지 않은 것으로 봐야 합니다.

조건밀집 어텐션 대비 판단
블록 희소성 < 약 60%대체로 손익분기점 수준이며, 히스토그램 오버헤드가 비용으로 작용
블록 희소성 > 약 60%FlashAttention-2와 비슷하거나 더 빠르며, 고희소성 한계에서는 최대 2배 이상
장문 컨텍스트 학습(32K+)가장 유리한 경우 — 시퀀스 길이가 길수록 희소성이 증가
짧은 컨텍스트 / 추론 전용이득 제한적 — 건너뛸 부분이 적고 역전파가 없음
CPU / AMD 백엔드범위 밖 — Triton + CUDA 전용, H100에서 테스트됨

요약하면 CUDA 하드웨어에서 장문 컨텍스트 모델을 학습하고 있고, 어텐션 행렬이 실제로 충분히 희소할 때 AdaSplash-2를 채택할 만합니다. 이 조건에서는 공개 BSD-3 커널이 신뢰할 만한 대체재가 됩니다. 그 밖의 환경, 즉 짧은 컨텍스트, 추론 중심 워크로드, 비CUDA 환경에서는 밀집 FlashAttention-2가 여전히 더 안전한 기본값이며, 공개되지 않은 350M 체크포인트도 결국 자신의 워크로드에서 직접 수치를 확인해야 하는 일을 대신해 주지는 않습니다.

자주 묻는 질문

α-entmax는 무엇이며 softmax와 어떻게 다른가요?

α-entmax는 희소 attention 정규화 방식입니다. α가 1보다 크면, 행마다 학습된 임계값보다 낮은 점수를 받은 key에 정확히 0의 확률을 부여합니다. 반면 softmax는 모든 key에 0이 아닌 질량을 주기 때문에 진짜 0을 만들지 않습니다 . 이 차이는 실제 운용에서 중요합니다. α-entmax는 조밀한 분포를 나중에 가지치기하는 것이 아니라, 학습 시점부터 진짜 희소 확률분포를 만듭니다. 이 0들이 정확한 값이기 때문에 Triton 커널은 모든 블록을 훑지 않고, 결과적으로 전부 0인 타일을 손실 없이 건너뛸 수 있습니다. 이것이 AdaSplash-2의 tile-skip 경로가 작동하는 방식입니다 .

AdaSplash-2 350M 또는 354M causal-LM 체크포인트를 공개 다운로드할 수 있나요?

2026년 4월 기준으로 확인된 1차 자료에서는 그렇지 않습니다. SARDINE Lab의 Hugging Face 조직에는 SparseModernBERT-alpha2.0가 올라와 있습니다. 이는 softmax를 Triton 기반 AdaSplash로 대체한 MIT 라이선스의 약 0.1B masked-LM이지만, 공개 조직 페이지에는 350M 또는 354M causal-LM 체크포인트가 보이지 않습니다 . 확인된 공개 대상은 커널 자체입니다. BSD-3-Clause 라이선스로 배포되는 pip 설치 가능 패키지 adasplash>=0.2.0이며, 저장소는 deep-spin/adasplash입니다 . 따라서 이 주제를 “354M 오픈 웨이트”로 설명하는 것은 근거가 확인되지 않았으며, 해당 수치는 미확인으로 봐야 합니다.

기존 학습 루프에 AdaSplash-2의 tile-skip 커널을 어떻게 넣나요?

pip install 'adasplash>=0.2.0'로 설치하면, 지원되는 기본 attention 호출이 자동으로 AdaSplash-2 Triton 경로로 라우팅됩니다 . 커널을 실행하려면 PyTorch, Triton, CUDA GPU가 필요합니다. 이 패키지는 CPU나 비 CUDA 백엔드에서는 실행되지 않습니다 . 표준 경로의 기본값인 8-bin 히스토그램 임계값 초기화와 64비트 패킹을 쓰는 64-token key block mask는 기본으로 켜져 있어 별도 설정이 필요 없습니다. 이 기본 블록 구조는 flush 전 query block당 16,320개 key를 수용할 수 있다고 제시됩니다 .

AdaSplash-2는 추론 처리량도 높이나요, 아니면 학습 속도만 개선하나요?

개선 효과는 학습, 그중에서도 backward pass에 집중됩니다. 저자들은 이 부분이 속도 향상의 상당 부분을 이끈다고 설명합니다 . 짧은 context에서 forward-only 추론은 이점이 제한적입니다. 이 방법이 강점을 보이는 32K 이상 context 길이에 비해 짧은 sequence에서는 block sparsity가 훨씬 낮기 때문입니다. 논문은 context 길이가 늘수록 sparsity가 증가한다고 보고하며, context scaling 실험은 최대 128K까지 평가했습니다 . 희소성이 매우 높은 한계에서는 FlashAttention-2 대비 2배 이상의 속도 향상을 언급하지만, 짧은 context에서는 히스토그램 오버헤드를 상쇄할 만큼 건너뛸 block이 많지 않습니다.

AdaSplash-2와 Snap Research의 TDA는 어떤 관계인가요? 같은 릴리스인가요?

아닙니다. 둘 다 2026년 초에 나온 softmax-free 논문이고 Triton tile-skip 커널을 제공한다는 공통점은 있지만, 메커니즘과 공개된 규모가 다릅니다. AdaSplash-2는 α-entmax를 사용하며 350M 및 1B 규모의 LLaMA-3 스타일 모델을 학습합니다 . 반면 ACL 2026에 채택된 Snap Research의 Threshold Differential Attention은 다른 threshold differential 메커니즘을 사용하고, 약 162M 규모의 GPT-2 변형을 snap-research/TDA에서 공개합니다 . 주제 줄의 “354M” 수치는 두 프로젝트 어느 쪽의 확인된 릴리스와도 맞지 않습니다. 그래서 실제 체크포인트라기보다 서로 다른 정보를 혼동했을 가능성이 가장 큰 지점으로 읽어야 합니다.