손잡이를 돌리고 말을 걸면 라즈베리 파이가 응답한다 — 배터리도, 콘센트도, 인터넷도 없이. 이것이 CrankGPT의 전제이며, 가장 흥미로운 점은 이 기기가 '되기를 거부하는 것'에 있다.
CrankGPT란 무엇인가 (그리고 무엇이 아닌가)
CrankGPT는 Squeez Labs가 만든 완전 오프라인 인력 구동 AI 음성 박스로, 컴퓨터 과학자 Katrin Tomanek과 Google ATAP(Advanced Technology and Projects) 그룹 전 기술 프로젝트 리드 Alex Kauffmann이 제작한 개념 증명 프로토타입이다 (The Outpost). 시중에서 구매한 라즈베리 파이 5(8GB)와 ~20W 급 비상용 손잡이 발전기를 조합해, 음성 인식·언어 모델링·음성 합성을 모두 로컬 CPU에서 구동한다. 첫 크랭크부터 대화 가능 상태까지 약 30초 만에 부팅된다 .
한눈에 보기: CrankGPT는 Squeez Labs가 만든 인력 구동 완전 오프라인 로컬 AI 음성 박스로, 8GB RAM을 탑재한 라즈베리 파이 5 기반으로 제작되었다. 배터리·전원 콘센트·인터넷 없이 CPU에서 ASR·LLM·TTS를 모두 실행하며, 첫 크랭크 후 약 30초면 대화 가능 상태에 도달한다.
판매 중인 제품이 아니다. 랜딩 페이지에는 가격·SKU·출시일 없이 데모 요청 경로만 있으며, 의도적으로 풍자적인 세 가지 전력 등급 — 20W "Synapse", 150W "Cortex", 2000W+ "Singularity" — 을 나열하고 있다 . 이 프로젝트는 2026년 6월 11일부터 Hacker News 1위에 오르고 Hackaday, The Register, TechRadar, Boing Boing, Gizmodo 등에 소개되었다 — 그러나 모든 내용은 Squeez의 자체 프로젝트 페이지로 소급되며, 독립적인 벤치마크 재현 사례는 아직 없다.
설계 목표는 처리량이 아닌 내구성이다. 제작자들은 이렇게 말한다:
"전자 부품을 건조하고 적정 온도로 유지하는 한, 이 기기가 100년 후에도 작동하지 않을 이유가 없다 — 단, SD 카드는 새것으로 교체해야 할 것이다." — Squeez Labs (source: Squeez Labs handcrank page).
크랭크 출력을 안정화하는 맞춤형 커패시터 보드

CrankGPT에서 가장 어려운 엔지니어링 과제는 모델이 아니었다 — 추론 중에 라즈베리 파이 5를 살려두는 것이었다. 시중에 판매되는 ~20W 가변 전압 비상용 손잡이 발전기는 자체적으로 깨끗한 전력을 공급하지 못한다. 파이는 평소 약 1.5A를 소비하지만 , 음성 인식·언어 모델·음성 합성을 동시에 실행하면 순간적으로 약 5A까지 급등하면서 공급 전압이 파이 요구 최솟값인 4.8V 아래로 떨어지고 과전류 차단기가 작동한다 . 크랭크를 보드에 직접 연결하면 문장 도중에 브라운아웃이 발생한다.
해결책은 발전기와 파이 사이에 놓인 맞춤형 커패시터 보드다. 이 보드는 출력을 평탄하게 하고 약 20초분의 예비 전하를 저장해, 토큰 생성 시 발생하는 급등을 흡수하고 운용자가 몇 초간 크랭크를 멈춰도 세션이 끊기지 않게 한다 . 이 예비 용량이 완전한 응답을 끝까지 버티는 데모와 모델이 디코딩을 시작할 때마다 초기화되는 데모의 차이를 만든다.
측정된 전력 프로파일은 버퍼가 왜 중요한지를 보여준다 — 유휴 상태와 활성 추론 간에 소비 전력이 두 배 이상 증가한다:
| 모드 | 전력 | 전류 @ 5V |
|---|---|---|
| 유휴 | ~4W | 0.8A |
| ASR (음성 인식) | ~8W | 1.6A |
| LLM 추론 + TTS | ~15W | 3A |
| 최대 급등 | — | ~5A |
이 수치는 Squeez의 자체 측정값이다 . 가장 인상적인 부분은 부하가 촉각으로 느껴진다는 점이다. 토큰 생성 중 크랭크의 기계적 저항이 증가한다고 하는데, 운용자는 모델이 디코딩하는 동안 연산 수요가 오르내리는 것을 손으로 직접 느낄 수 있다 . 인간 체력은 충분히 여유 있다 — Kauffmann은 숙련된 사이클리스트가 약 120W를 지속할 수 있다고 추정하는데 (The Outpost), 이는 최대 ~15W보다 한 자릿수 높은 수치다 — 그러나 커패시터 보드가 해결해야 할 병목은 운용자의 지구력이 아니라 발전기의 순간 공급 능력이다. The Register가 이 기기를 "기다리면서 하는 운동"으로 표현한 것은 노력 측면에서는 정확하지만, 더 어려운 문제 — 와트 생성이 아닌 전류 곡선 평탄화 — 를 과소평가한다.
DietPi와 3초 유저스페이스 부팅
전력 곡선이 안정되면 다음 병목은 시작 시간입니다. 손으로 크랭크를 돌리는 기기에서는 토큰 하나가 나오기 전까지 부팅에 걸리는 매 초가 고스란히 근육 에너지로 소모됩니다. Squeez는 CrankGPT를 DietPi 위에서 실행합니다. 사람이 직접 전기를 생산하는 환경에서는 콜드 스타트 시간이 중요하기 때문에, Raspberry Pi OS 대신 군더더기를 걷어낸 Debian 기반 OS를 선택한 것입니다. 불필요한 라디오 서비스를 비활성화한 뒤, 팀은 유저스페이스에 약 3초 만에 진입한다고 보고합니다 .
이 유저스페이스 수치는 대화 준비 완료까지의 전체 경로 중 일부에 불과합니다. 부팅부터 준비 완료까지는 Pi 펌웨어 및 콜드 부팅에 약 10~15초, DietPi Linux 초기화에 약 3초, 에이전트 시작 및 모델 로딩에 10~15초가 소요되어, 첫 크랭크부터 사용 가능한 어시스턴트까지 총 약 30초가 걸립니다 . OS 최적화는 비교적 쉽게 줄일 수 있는 시간을 단축하는 것이며, 모델 로딩 시간은 서비스를 삭제하는 방법으로는 최적화할 수 없는 구간입니다.
파이프라인 자체는 Squeez의 오픈소스 edge_voice_agent(ktomanek/edge_voice_agent, Apache 2.0) 위에서 동작하며, ASR + VAD, LLM, TTS 순서로 구성되고 각 단계를 교체할 수 있습니다 . 백엔드 선택지는 의도적으로 폭넓게 구성되어 있습니다. ASR은 Moonshine·FasterWhisper·Nemo FastConformer·Vosk, TTS는 Piper·Kokoro, 언어 모델은 llama.cpp로 호스팅된 모든 GGUF를 지원합니다 . 이 모듈성 덕분에 각 단계에서 가장 빠른 옵션을 선택할 수 있으며, 후보 간 성능 차이가 두드러진 TTS 계층에서 그 효과가 구체적으로 드러납니다.
Pi 5에서 Piper가 Kokoro보다 9배 빠른 이유

CPU만 사용하는 Pi 5에서 텍스트 음성 변환은 UX를 좌우하는 핵심 변수이며, Piper가 압도적인 우위를 보입니다. 20단어 테스트 문장을 약 0.5초 만에 합성하는 반면, Kokoro는 약 9배 느리고 PocketTTS는 실시간 배율이 1.0을 초과해 재생 속도보다 느리게 오디오를 생성하여 뚜렷한 끊김 현상이 발생합니다 . 손으로 전력을 생산하는 환경에서 이 지연은 직접적으로 체감되기 때문에, 느린 옵션은 처음부터 고려 대상이 아니었습니다.
Piper의 속도는 실행 경로에서 일부 기인합니다. CrankGPT는 Python 중심 스택 대신 ONNX Runtime을 통해 Piper를 실행해 오버헤드를 줄이고 메모리 사용량을 8GB 내에서 LLM과 공존할 수 있을 만큼 작게 유지합니다 . 같은 단계별 선택 논리가 음성 인식 계층에도 적용됩니다. Moonshine·FasterWhisper·Nemo FastConformer·Vosk 가운데 Squeez는 가속기 없는 Pi급 보드에서 가장 우수한 속도 대 정확도 비율을 이유로 ASR에 Moonshine을 선택했습니다 . 앞단에 Silero VAD를 배치해 묵음 구간을 감지함으로써, 아무 소리도 없는 구간을 전사하는 데 추론 사이클을 낭비하지 않습니다.
그 결과 의도적으로 경량화된 파이프라인이 완성됩니다. 청취에는 Moonshine + Silero VAD, 추론에는 llama.cpp로 호스팅된 소형 모델, 발화에는 ONNX Runtime 위의 Piper를 사용합니다 . 각 단계에서 해당 역할에 가장 빠른 실용적 옵션을 선택한 것이 인간의 동력으로 1초 미만 응답 루프를 가능하게 만드는 핵심입니다.
Q4_K_M으로 8GB에 담기는 모델: 350M부터 1.2B까지
여기에 맞는 모델은 작습니다 — 그게 핵심입니다. CrankGPT는 Pi 5의 CPU에서 Q4_K_M으로 양자화된 소형 언어 모델 세 가지를 실행하며, 기본 음성 에이전트로는 Liquid AI의 LFM2.5 350M을 사용합니다. 이 모델은 초당 48.86 토큰을 생성하고 222.65 tok/s의 프리필 속도를 제공하며 RAM은 354 MiB만 점유하고 첫 바이트를 약 0.8초 만에 반환합니다 . 8GB 메모리를 탑재한 환경에서 메모리가 병목이 되는 일은 없으며, 처리량과 첫 바이트 도달 시간이 실질적인 제약입니다. 모델이 클수록 크랭크를 돌리는 사람의 대기 시간이 길어집니다.
LFM2.5 1.2B로 올라가면 더 풍부한 응답을 얻을 수 있지만 실질적인 대가가 따릅니다. 생성 속도는 15.01 tok/s로, 프리필은 71.31 tok/s로 떨어지고 RAM은 762 MiB로 늘어나며 TTFB는 약 1.5초로 상승합니다 . Google의 Gemma 3 1B는 동일한 762 MiB를 점유하지만 전반적으로 느립니다. 생성 14.31 tok/s, 프리필 46.12 tok/s, 그리고 테스트 대상 중 가장 나쁜 TTFB인 약 2.9초를 기록합니다. 이 때문에 Squeez는 이 모델을 일반 대화 루프가 아닌 번역 용도로만 사용합니다 .
| 모델 (Q4_K_M) | 생성 (tok/s) | 프리필 (tok/s) | RAM (MiB) | TTFB | 역할 |
|---|---|---|---|---|---|
| LFM2.5 350M | 48.86 | 222.65 | 354.48 | ~0.8 s | 기본 음성 에이전트 |
| LFM2.5 1.2B | 15.01 | 71.31 | 762.49 | ~1.5 s | 풍부한 응답 |
| Gemma 3 1B | 14.31 | 46.12 | 762.49 | ~2.9 s | 번역 |
이 결과가 Pi 5에만 국한된 것은 아닙니다. Squeez가 동일한 워크로드를 Orange Pi 5 Pro에서 실행했을 때 생성 속도가 29~58% 빨라졌으며, 그 원인으로 Pi 5의 LPDDR4X 대비 DDR5 메모리 대역폭을 주로 꼽았습니다 . CPU 병목에 메모리 대역폭 제한이 더해진 추론 루프에서는 코어 수보다 보드의 RAM 유형이 더 중요합니다.
이 스택을 재현하기 전에 한 가지 라이선스 주의 사항을 짚어둘 필요가 있습니다. edge_voice_agent 코드는 Apache 2.0이지만, 모델 가중치는 그렇지 않습니다. Liquid AI의 LFM2 라이선스는 연 매출 1,000만 달러 미만 조직에 한해 무료 상업적 사용을 허가하며, Gemma 3은 Google 자체 약관 하에 배포됩니다 . 코드는 열려 있지만, 그 위에서 실행되는 두뇌는 조건이 붙습니다.
$300 BOM: 라즈베리 파이 5, HAT, 크랭크, 커패시터
현재 빌드 기준 하드웨어 자재명세서(BOM)는 약 300달러 수준으로, 이전 버전의 약 150달러에서 상승했습니다 . Squeez는 이 상승분의 대부분을 RAM 가격 급등 탓으로 돌립니다 — 이 메모리 비용 압박은 엣지 AI 경제성 논쟁에서 이 기기를 화제의 중심으로 만든 요인이기도 합니다 . 특별한 부품은 없으며, 가치는 부품 자체가 아닌 통합 방식에 있습니다.
핵심 스택은 의도적으로 표준 구성을 따릅니다. 8GB RAM을 탑재한 라즈베리 파이 5에 쿨링 팬 HAT을 장착하고, 오디오 I/O는 스테레오 MEMS 마이크 어레이와 WM8960 코덱 기반의 KEYESTUDIO ReSpeaker 2-Mic Pi HAT으로 처리합니다 . HAT 사용을 원하지 않는 빌더는 외부 마이크와 스피커를 갖춘 USB 사운드 카드로 대체할 수 있으며, Squeez도 이를 작동하는 대안으로 검증했습니다 .
전원 경로는 시중에서 구할 수 있는 전압 전환 가능 약 20W 비상용 손잡이 발전기와, 추론 부하로 인한 파이 전압 강하를 방지하는 맞춤 커패시터 스무딩 보드의 조합으로 구성됩니다 . 모든 구성 요소는 3D 프린팅 케이스 안에 담기며 — 투명 버전도 있습니다 — 모드 선택을 위한 노브, 버튼, 스위치가 달려 있습니다 .
파이 5로 Q&A는 된다. 그 이상은 어렵다.

솔직히 말하면, 이 전력·파라미터 예산에서 라즈베리 파이 5가 소화할 수 있는 것은 범위가 한정된 대화형 작업뿐입니다. Squeez는 복잡한 추론, 긴 컨텍스트 작업, 멀티모달 입력, 고품질 코드 생성은 이 하드웨어의 한계를 벗어난다고 명시합니다 . 가속기 없이 CPU에서 양자화된 2B 미만 모델을 구동하는 8GB 보드라는 사실이 그 한계를 결정합니다 — 실용적이지만 범용은 아닙니다.
실제로 적합한 엣지 애플리케이션 영역은 좁지만 분명히 존재합니다:
- LFM2.5 350M 같은 소형 범용 모델을 이용한 간단한 질의응답, 첫 바이트 수신까지 1초 미만 .
- 번역 — Squeez는 이 용도에 Google의 Gemma 3 1B를 사용합니다 .
- 음성 명령 라우팅 및 짧고 한정된 컨텍스트를 다루는 기타 작업.
Squeez의 주장은, 실제 엣지 사용 사례의 상당수가 그 범위를 초과하지 않고 그 안에 들어맞는다는 것입니다 . 복원력과 프라이버시 측면의 논거는 면밀히 따져봐도 타당합니다. 이 장치는 외부 서비스, API, 전력망에 전혀 의존하지 않아, 클라우드 추론이 선택지가 될 수 없는 오프그리드·재난 대응·에어갭 환경에서 유효합니다 .
풍자적인 티어 목록조차 실제 제약을 정확하게 반영합니다. 20W "Synapse" 티어는 질의응답, 150W "Cortex"는 에이전트 코딩과 영상 생성, 2000W 이상의 "Singularity"는 스웜·학습·파인튜닝을 담당합니다 . 농담 같은 표현이지만 전력 대 성능 매핑은 정직합니다. 손 크랭크 박스는 완전히 20W 밴드에 머물며, 더 열심히 크랭크를 돌린다고 해서 티어가 올라가지는 않습니다.
CrankGPT 재현하기: 레포는 공개, 회로도는 미공개
오늘 당장 CrankGPT 클로닝을 시작할 수는 있지만, 아직 완전한 재현은 불가능합니다. 소프트웨어 절반은 공개 상태입니다. Squeez의 edge_voice_agent 레포지토리는 Apache 2.0으로 공개되어 있으며 파이급 보드에서 구동됩니다 . 파이프라인은 ASR+VAD → LLM → TTS 순이며 백엔드를 교체할 수 있습니다 — ASR은 Moonshine·FasterWhisper·Nemo FastConformer·Vosk, TTS는 Piper·Kokoro, LLM은 llama.cpp로 서빙되는 모든 모델을 지원합니다 . 하드웨어 절반은 아직입니다. 2026년 6월 중순 기준으로 전체 회로도와 3D 프린팅 파일은 "며칠 내로 공개 예정"이라고 밝혀진 상태였으므로, 커패시터 보드와 케이스를 직접 재현할 수 있다고 가정하기 전에 레포와 squeezlabs.github.io를 먼저 확인하세요 .
이를 기반으로 무언가를 출시하기 전에 두 가지를 주의해야 합니다. 첫째, 라이선스 함정입니다. Apache 2.0은 코드에만 적용되며 웨이트에는 해당하지 않습니다. LFM2/LFM2.5는 연간 매출 1,000만 달러 미만의 조직에 한해 상업적 이용이 무료이며, Gemma 3는 Google의 별도 맞춤 모델 약관을 따릅니다 . 둘째, 여기에 나오는 모든 지연 시간 및 초당 토큰 수치 — LFM2.5 350M의 첫 바이트 수신까지 약 0.8초, 생성 속도 48.86 tok/s — 는 독립적인 검증 없이 Squeez 자신의 llama-bench 실행 결과입니다 .
이 수치들은 방향성 참고용으로만 신뢰하되, 검증된 데이터로 취급하지 마세요. 실용적인 결론은 이렇습니다. 레포를 클론하고, 이미 보유한 파이 5에서 음성 에이전트를 직접 실행해보고, 오프그리드 제품에 실제로 활용하기 전에 직접 벤치마크하세요.
자주 묻는 질문
손 크랭크를 USB 보조배터리로 대체할 수 있나요?
네. 크랭크는 디자인적 선택이지 필수 요건이 아닙니다 — CrankGPT의 핵심은 외부 전원 없이도 로컬 음성 추론이 가능하다는 것을 증명하는 데 있지만, Pi 5에 보조배터리를 연결하는 것을 막는 건 아무것도 없습니다. LLM 추론과 TTS 부하가 겹칠 때 보드는 최대 약 5A까지 소비하므로 , 25W 이상 USB-C PD 보조배터리라면 여유 있게 감당합니다. 보조배터리에 과전류 차단 기능이 공격적으로 설정되어 있다면 커패시터 보드를 회로에 유지하세요: 약 20초치 예비 전력을 보유하고 있어 토큰 생성 중 배터리가 꺼지게 만드는 순간 스파이크를 흡수합니다.
edge_voice_agent 코드에 적용되는 라이선스는 무엇인가요?
Apache 2.0입니다. Squeez의 오픈소스 엣지 음성 에이전트(GitHub: ktomanek/edge_voice_agent)는 Apache 2.0 라이선스로 배포되며, 상업적 이용이 허용됩니다 . 모델 가중치는 별개의 문제입니다: LFM2/LFM2.5는 연간 매출 1,000만 달러 미만 기업에 한해 상업적 무료 이용이 가능하며, Gemma 3는 Google의 별도 모델 약관이 적용됩니다 . 코드 라이선스와 모델 라이선스는 독립적입니다 — 상업용으로 출시하기 전에 반드시 둘 다 확인하세요. Apache 2.0 저장소라고 해서 로드하는 가중치까지 같은 라이선스가 적용되지는 않습니다.
시작 모델로 LFM2.5 350M과 1.2B 중 어느 것이 적합한가요?
지연 시간을 최소화하려면 LFM2.5 350M으로 시작하고, 출력 품질이 그 비용을 정당화할 때만 1.2B로 올리세요. Pi 5에서 350M 모델은 354.48 MiB를 사용하며 약 48.86 토큰/초로 첫 번째 바이트까지 약 0.8초가 걸리는 반면, 1.2B 모델은 762.49 MiB를 사용하며 15.01 토큰/초로 TTFB가 약 1.5초입니다 . 두 모델 모두 DietPi와 에이전트 스택을 포함해도 8GB 안에 충분히 들어가므로 , 선택 기준은 메모리 한계가 아니라 순전히 지연 시간 대 응답 품질의 트레이드오프입니다.
Orange Pi 5 Pro가 Pi 5 대신 쓸 만한가요?
순수 속도만 보면 그렇습니다 — 하지만 하드웨어 생태계 지원을 희생해야 합니다. Squeez의 측정 결과 Orange Pi 5 Pro는 주로 DDR5 메모리 대역폭 덕분에 생성 속도가 29~58% 빠른 것으로 나타났습니다 . 문제는 HAT 호환성, 커뮤니티 툴링, GPIO 생태계의 폭입니다: Raspberry Pi 5는 CrankGPT가 필요로 하는 ReSpeaker 2-Mic Pi HAT 같은 하드웨어 애드온에 대해 훨씬 넓은 지원을 갖추고 있습니다 . HAT을 쌓아 올리고 문서화된 GPIO 배선을 활용하는 빌드라면 Pi 5를 유지하세요; 순수 헤드리스 추론 박스라면 Orange Pi의 대역폭 이점은 실질적입니다.
전체 회로도와 3D 프린트 파일은 언제 공개되나요?
발행 시점 기준으로 확정된 날짜는 없습니다. Squeez는 2026년 6월 중순 기준으로 전체 설계도와 회로도를 "수일 내" 공개할 예정이라고 밝혔으나 , 음성 에이전트 코드는 이미 공개된 반면 하드웨어 파일은 아직 게시되지 않은 상태였습니다. 최신 현황은 GitHub의 ktomanek/edge_voice_agent와 Squeez 프로젝트 페이지에서 확인하고, 완전한 재현 가능성을 기정사실로 받아들이기 전에 회로도가 실제로 게시되었는지 반드시 검증하세요 .