13개 챗봇이 당신의 이력을 알고 있다. F1이 그 신뢰도를 밝히다

In the Weights가 챗봇 13개의 인물 정보 재현 능력을 검증한다 — F1 상한선, LMP2 맥락, GDPR 함의.

13개 챗봇이 당신의 이력을 알고 있다. F1이 그 신뢰도를 밝히다
Share

2026년 6월 중순, 무료 웹 도구 하나가 조용히 등장해 "AI가 나를 알고 있을까?"라는 질문을 직접 조회할 수 있는 숫자로 바꿔놓았다. 발상은 단순하지만 그 작동 방식은 그렇지 않다. 13개 이상의 모델에 동일한 질문을 던지고, 얼마나 일관되게 같은 인물 정보를 내놓는지 측정하는 것이다.

하나의 이름을 13개 챗봇에 던지는 전기적 탐침 방식

"In the Weights"는 단일 표준화 프롬프트 — 대략 "<이름>은 누구인가? 최대 10개의 결과를 각각 짧은 설명과 신뢰도와 함께 제시하라" — 를 동시에 여러 모델에 전송하되 웹 검색이나 검색 증강 없이 작동하는 폐쇄형 탐침이다. 그런 다음 동일 인물을 얼마나 일관되게 떠올리는지 채점한다. xAI의 Grok, Google의 Gemini, 다양한 GPT 버전, Anthropic의 Claude, Meta의 Llama, 그리고 여러 소규모 변형 모델을 병렬로 조회한다 . 어떤 도구도 허용되지 않으므로, 일관된 답변이 나온다면 그것은 순전히 사전 학습에서 비롯된 것이다.

파이프라인은 반환된 텍스트를 세 가지 방식으로 처리한다. 모델 간 의미적으로 유사한 설명을 클러스터링하고, 환각으로 보이는 주장에 플래그를 달고, 어떤 모델이 어떤 답을 냈는지 보여준 뒤, 이 모든 것을 하나의 복합 "강도 점수"로 압축한다 — 점수가 높을수록 챗봇 간 일관성 있는 회상을 의미한다 . The Decoder에 따르면 실질적인 상한선은 996에 가깝고, 이는 사실상 모차르트, 셰익스피어, 테일러 스위프트 같은 정전적 인물들에게만 허용된 수치다 .

유명인 티어 아래로의 낙차는 가파르며, 이것이 리더보드가 개발자에게 가장 명확하게 보내는 신호다:

대상강도 점수맥락
모차르트 / 셰익스피어 / 테일러 스위프트~996실질적 상한선, 정전적 인물
맥컬리 컬킨988리더보드 예시
앤서니 하 (저널리스트)641상위 약 6%
The Decoder 동료262유명인 티어 미만
The Decoder 필자175유명인 티어 미만

이 도구는 무료이며, API 키나 유료 플랜은 공개되지 않았다. 제작자는 Thomas Dimson과 Joey Flynn으로, 두 사람은 2023년 OpenAI에 인수된 디자인 스타트업 Global Illumination 출신이며 현재는 모두 퇴사한 상태다 . 반응은 두 사람의 예상을 뛰어넘었다. Dimson은 TechCrunch에 "반응이 지금까지 미칠 듯이 뜨겁다 — 우리는 그저 가벼운 호기심 정도로 그칠 줄 알았다"고 말했다.

복합 회상 점수가 측정하는 것

Thirteen chatbots know your biography. F1 reveals how reliably

복합 "강도 점수"는 단 하나를 측정한다. 웹 검색이나 검색 증강 없이 폐쇄형 환경에서, 다수의 챗봇이 특정 이름에 대해 동일한 전기적 주장을 얼마나 일관되게 생성하는가. 이 점수는 학습 데이터셋에 당신에 관한 특정 문서가 포함되었다는 증명이 아니다. The Decoder는 실질적인 상한선이 996 근방이라고 전하며, 이는 모차르트, 셰익스피어, 테일러 스위프트 같은 정전적 인물에게만 허용된다. TechCrunch는 맥컬리 컬킨이 988점, 저널리스트 앤서니 하가 641점으로 상위 약 6%에 해당한다고 전한다.

이 구분은 중요하다. 사이트 자체의 표현이 그 경계를 흐리고 있기 때문이다. 제작자들은 "웨이트 안에 존재한다는 것은, 초인적 인공지능을 만드는 과정에서 당신의 존재가 중요하다고 판단되었음을 의미한다"고 밝히고 있다 (source: TechCrunch, 2026-06). 높은 점수는 일관된 생성을 반영할 뿐, 특정 출처의 기억이 검증된 것은 아니다.

"이건 말 그대로 13개 챗봇에 당신 자신에 대해 물어보는 것과 같다" — 비평가 Anthony Moser (source: TechCrunch, 2026-06).

Moser의 말은 기술적으로 옳다. 그럼에도 이 규모에서의 챗봇 간 체계적 일치는 여전히 유의미한 웹 존재감 대리 지표로 기능한다. 위키피디아, 뉴스 아카이브, 전문 디렉터리 등에 반복적으로 등장하는 이름은 모델 전반에 걸쳐 일관되게 표면화되는 경향이 있으므로, 이 복합 점수는 학습 데이터셋 포함 여부를 증명하지 못하더라도 공개 발자국을 추적하는 역할을 한다.

신호는 정밀도가 가장 필요한 곳에서 오히려 흐려진다. 흔하거나 모호한 이름, 오탈자, 그리고 소규모 챗봇 — 예를 들어 약 1B개 파라미터의 Llama 변형 모델 — 은 복합 점수를 낮추고 노이즈를 더한다. 바로 개인의 노출이 가장 분산되고 감사하기 어려운 영역에서. 두 가지 요인이 신뢰성을 더욱 떨어뜨린다:

  • 버전 정보 및 타임스탬프 없음. 리더보드는 모델 버전이나 수집 날짜를 공개하지 않아, 점수 변동이 회상 능력의 변화가 아닌 백엔드의 조용한 교체를 반영하는 것일 수 있다.
  • 엄밀함보다 레트로 표현 우선. 닌텐도에서 영감을 받은 인터페이스와 인터랙티브 리더보드는 순위 비교를 유도하지만, 기저 방법론은 시간에 따른 그러한 비교를 뒷받침하지 않는다.

WikiMem, LMP2, MemHunter: 이 탐색 도구의 학문적 전신

"In the Weights"는 보다 엄밀한 연구 체계의 소비자 지향 첨단에 해당합니다. 세 가지 학문적 프레임워크가 이 도구가 암시하는 것, 즉 모델이 가중치만으로 특정 인물에 관한 사실을 얼마나 신뢰성 있게 재현하는지를 측정하는 방법을 이미 공식화하고 있습니다. 가장 초기작인 WikiMem은 구조화된 데이터셋을 제공하고, MemHunter는 대규모 추출 공격 연구를 목표로 하며, LMP2는 이 방법론을 브라우저 기반 자가 감사로 전환합니다. 각각은 접근성과 엄밀성을 서로 다른 비율로 교환합니다.

WikiMem(arXiv 2507.11128)은 243개의 인물 관련 위키데이터 속성을 아우르는 5,650개의 자연어 "카나리" 템플릿 데이터셋을 구축하고, 인물-사실 연관성을 위한 모델 독립적 지표를 제공합니다 . 핵심 발견은 소비자 도구가 암묵적으로 전제하는 것과 같습니다. 기억화는 대상 인물의 웹 노출도 및 모델 규모와 상관관계가 있다는 것입니다 . 이로써 WikiMem은 구조화된 회상 평가의 기반 벤치마크가 됩니다. 고정된 속성 분류 체계와 재현 가능한 카나리를 갖추고 있으며, "In the Weights"는 이 두 가지를 모두 갖추지 못하고 있습니다.

MemHunter(arXiv 2412.07261)는 사용성 스펙트럼의 반대편에 위치합니다. 개인적 호기심이 아닌 추출 공격 연구를 위해 구축되었으며, 데이터셋 규모에서 자동화된 가설 검증 기반 기억화 탐지를 수행합니다 . 리더보드도, 이름 입력란도, 소비자용 인터페이스도 없습니다. 특정 학습 콘텐츠가 복원 가능한지 탐구하는 연구자들을 위한 인프라입니다.

LMP2(언어 모델 프라이버시 프로브)는 2026년 2월 19일 Dimitri Staufer와 Kirsten Morehouse가 발표한 것으로, 허영 검색 형식에 가장 가까운 직접적 유사 도구입니다 . 사용자가 전체 이름을 입력하고 50개의 개인 특성 중 3개를 선택하면 신뢰도 점수와 함께 최상위 추측값을 받습니다. WikiMem을 기반으로 구축되었으며, 짧은 단편 완성 프롬프트, 두 글자 접두사, 속성당 5개의 카나리 패러프레이즈, 20개의 반사실적 접두사를 통해 블랙박스 채팅 API에 적용되고, 토큰 로그 확률 또는 상위 완성 투표를 집계합니다 .

이들과 비교할 때, "In the Weights"는 경량화된 소비자용 유사 도구입니다. 단일 개방형 프롬프트("<name>은 누구입니까?"), 속성 분류 체계 없음, 토큰 로그 확률 추출 없음. LMP2가 안정적 연관성과 단순 추측을 구분할 수 있게 해주는 방법론적 통제 장치를, 마찰 없는 무료 인터페이스와 교환한 셈입니다. 이것이 이 분석 전체가 의존하는 트레이드오프입니다. 접근성은 훨씬 높지만, 엄밀성은 실질적으로 낮습니다.

LMP2의 속성별·챗봇 규모별 F1 점수

Thirteen chatbots know your biography. F1 reveals how reliably

LMP2의 핵심 발견은 회상 정확도가 챗봇 규모와 거의 선형적으로 비례한다는 것입니다. 100명의 유명인, 100개의 합성 대조군 이름, 50개의 개인 특성을 대상으로 8개 모델을 감사한 결과, 대형 API 모델은 평균 F1 0.48을 기록한 반면 소형 오픈 웨이트 모델은 0.22에 그쳤습니다 . Grok-3이 0.54로 선두를 달렸고 GPT-5가 0.47로 뒤를 이었으며, Ministral 8B Instruct(0.16)와 Qwen3 4B Instruct(0.19)는 최하위에 머물렀습니다 . 더 큰 모델은 단순히 가중치에 더 많은 인물-사실 연관성을 담고 있습니다. WikiMem이 문서화한 것과 동일한 규모 상관관계가 이제 속성별로 측정된 것입니다.

챗봇분류평균 F1
Grok-3대형 API0.54
GPT-5대형 API0.47
대형 모델 평균0.48
Qwen3 4B Instruct소형 오픈0.19
Ministral 8B Instruct소형 오픈0.16
소형 모델 평균0.22

속성 유형은 모델 크기만큼 중요하며, 신뢰도 점수는 어느 쪽인지 가늠하는 데 좋은 지표가 아닙니다. 비용 문제로 GPT-4o를 사용해 19개국 303명을 대상으로 실시한 별도의 EU 연구에서, 조밀한 인구통계학적 특성은 높은 정밀도로 회상되었습니다. 성별 94.39%, 성적 지향 83.61%, 모국어 76.79%, 눈 색깔 72.22%, 머리 색깔 72.09%였습니다 . 희소 속성은 완전히 무너졌습니다. 키, 의학적 상태, 전화번호, 순자산은 해당 표본에서 모두 0%를 기록했습니다 . 신뢰도 수치를 읽는 사람이 주의해야 할 점은, 상위 특성 그룹의 전체 평균 정밀도는 0.90을 넘지만 순자산, 웹사이트 계정, 의붓부모 관계 같은 그룹은 0.1 근처 또는 그 이하로 떨어진다는 것입니다. 따라서 희소 필드에서 높게 보고된 신뢰도는 정확성에 대해 거의 아무것도 말해주지 않습니다 .

전체 적중률은 여전히 낮은 편입니다. EU 코호트 전체에서 최상위 추측이 정확한 경우는 45%였으며, 전체 추측의 49%가 정확한 것으로 판정되었습니다 . 응답자의 태도는 이 수치와 엇갈렸습니다. 결과물의 4%만이 프라이버시 침해로 간주되었고(87%는 아님, 9%는 불확실), 그럼에도 72%는 인기 챗봇이 자신에 대해 생성한 개인 데이터를 삭제하거나 수정하기를 원했습니다 . 개발자 관점에서 실질적 시사점은, 속성별 감사가 모델이 자신 있게 틀리는 지점, 즉 신뢰도와 정밀도가 갈라지는 셀을 정확히 드러낸다는 것이며, 이는 소비자용 프로브의 단일 종합 수치로는 찾아낼 수 없는 정보입니다.

일관된 생성은 기억의 증거가 아니다: 해석의 갈림길

두 도구 모두 이 간극을 해소하지 못한다. 모델이 클로즈드북 프롬프트에서 특정 인물을 출력한다는 것은 사전 학습 시 해당 데이터에 노출됐음을 시사하지만, 특정 문서가 학습 세트에 포함됐다는 증거는 아니다. 챗봇의 가중치는 소스 파일의 인덱스가 아니라 학습된 통계 패턴을 인코딩한 수십억 개의 수치 파라미터다. 이름이 반복적으로 등장하는 경우 — 주로 위키피디아 스크래핑 항목, 뉴스 아카이브, 직업 디렉터리, 공개 소셜 프로필 등 여러 곳에 걸쳐 반복됐기 때문인데 — 이 관계는 룩업이 아닌 확률적인 것이다 .

이 구분이 중요한 이유는 서로 다른 두 메커니즘이 동일한 전기적 출력을 만들어낼 수 있기 때문이다. 별도의 연구에 따르면 대형 언어 모델은 텍스트에서 위치, 소득, 성별 같은 속성을 높은 정확도로 직접 추론할 수 있으며, 이는 '모델이 드러내는 개인정보'가 특정 소스를 기억한 결과만큼이나 추론에서 비롯될 수 있음을 의미한다 . 출력만 봐서는 기억과 추론을 구별할 수 없다. 누군가에 대한 자신 있는 답변은 위키피디아 문장을 기억한 것일 수도, 이름에 연결된 상관관계 단서들을 모아 조합한 추측일 수도 있다.

'In the Weights'도 LMP2도 이 간극을 메우지 못한다. 2026년 2월에 공개된 Language Model Privacy Probe인 LMP2는 안정적 연관성과 추측을 분리하려 상당한 노력을 기울였다 — 유명인 100명과 함께 합성 이름 100개를 테스트하고, 모델이 이름 단서에 단순히 패턴 매칭하는 시점을 감지하기 위해 20개의 반사실적 접두사를 사용한다 — 그럼에도 저자들은 이름 단서 과대추정을 완전히 배제할 수 없음을 인정한다 . 소비자용 프로브는 잡음에 더 가깝다: 비평가 Anthony Moser는 이를 "13개의 챗봇에게 자신에 대해 물어보는 것과 문자 그대로 같다"고 일축하며, 검증된 학습 세트 포함 여부가 아닌 일관된 생성의 척도일 뿐이라고 지적했다 .

개발자에게 실용적인 시사점은 좁지만 유용하다. 복합 강도 점수는 대략적인 인기도 지표이자 환각 진단 도구로 읽어야 한다 — 어떤 모델이 전기적 세부 정보를 자신 있게 지어내는지, 그리고 답변이 어디에서 갈라지는지를 보여준다 — 그러나 특정 텍스트가 학습 코퍼스에 포함됐다는 컴플라이언스 자료나 법적 증거로 삼아서는 안 된다 . 생성 신호를 포함 증거로 취급하는 것은 이 프로브가 증명할 수 있는 범위를 과장하는 것이다.

GDPR의 불확실성: 전기적 기억이 삭제 의무로 이어질 때

Thirteen chatbots know your biography. F1 reveals how reliably

유럽 규제 당국은 챗봇이 특정인의 이름을 클로즈드북 방식으로 기억하는 것 — 또는 이를 가능하게 하는 가중치 — 이 개인정보에 해당하는지 아직 결론을 내리지 않았다. 유럽 데이터 보호 위원회의 AI 모델 의견서, 2024년 12월 발표본은 개인정보로 학습된 모델이 모든 경우에 익명이라는 포괄적 가정을 거부하지만, 그 논리가 동적이고 확률적인 이름 조건부 출력에 어떻게 적용되는지는 열어두고 있다 . 'In the Weights' 같은 프로브의 법적 쟁점이 실제로 놓인 곳이 바로 이 간극이다.

GDPR 제15~17조는 개인에게 개인정보에 대한 접근·정정·삭제 권리를 부여한다. 모델이 생성한 전기적 답변이 이 권리를 발동시키는지 — 그리고 그 대상이 출력인지 파라미터인지 — 는 어떤 규제 당국도 아직 해결하지 못한 열린 질문이다 . 메커니즘이 중요하다: 별도의 연구에 따르면 대형 모델은 텍스트에서 위치, 소득, 성별 같은 속성을 직접 추론할 수 있어, 'LLM이 드러내는 개인정보'는 저장된 기억보다 추론에서 비롯될 수 있으며, 이는 삭제 가능한 기록이 존재한다고 가정하는 모든 삭제 요청을 복잡하게 만든다.

동의는 근본적인 갈등 지점이다. 상업용 사전 학습 코퍼스에 인코딩된 대부분의 개인은 이에 동의한 적이 없으며, 옵트아웃 수요는 이미 법률보다 앞서 있다. 19개국 303명을 대상으로 한 LMP2 EU 연구에서 72%가 자신에 대해 생성된 개인정보를 인기 챗봇이 삭제하거나 수정해주길 원했다 — 출력의 87%가 개인정보 침해로 여겨지지 않았음에도 불구하고 . 이 도구들이 노출하는 개인별, 속성별 수준에서 그 수요를 충족할 수 있는 확립된 메커니즘은 없다.

이 프로브는 누가 인코딩되고 누가 누락됐는지를 드러낼 수도 있다. 'In the Weights'의 공동 제작자인 Thomas Dimson은 모델 편향을 연구하고 위키피디아 문서가 없는 저명인사를 파악할 계획이라고 밝혔다 . 기억이 웹 존재와 상관관계가 있기 때문에, 강도 점수는 표현 불균형의 지도로도 기능한다 — 낮은 수치는 개인정보 보호의 혜택만큼이나 희박한 디지털 발자국을 의미할 수 있다. 개발자에게 이는 삭제 의무가 확립되기 전에 크로스 모델 감사를 실질적인 선제 조치로 삼아야 함을 뜻한다.

환각·동명이인·프로브가 놓치는 것들

"In the Weights"는 환각 가능성이 있는 항목을 표시하지만 종합 점수에서 차감하지 않습니다. 따라서 높은 강도 점수가 사실적으로는 틀린, 그럴듯하게 들리는 전기적 세부 정보에 일부 기대고 있을 수 있습니다. 이 도구에는 실제 사실 검증 레이어가 없으며, 모델이 생성하는 내용을 클러스터링하고 점수를 매길 뿐 사실 여부는 확인하지 않습니다. 개발자들도 모델이 전기적 세부 정보를 환각한다는 점과, 오타·흔하거나 모호한 이름·약 10억 개 파라미터 규모의 Llama 변형 같은 소형 모델이 점수를 낮춘다는 점을 인정합니다 .

동명이인 문제는 구조적입니다. 하나의 이름이 여러 실존 인물에 매핑될 때 회상이 그들 사이에서 분산되어, 모델들이 집합적으로 충분한 정보를 "알고" 있더라도 특정 개인에 대한 종합 점수는 억제됩니다. 따라서 이 프로브는 재식별 위험이 가장 분산되는 지점—공유되고 모호한 정체성—에서 가장 취약하고, 프라이버시 감사가 가장 덜 필요한 대표적 인물들—모차르트, 셰익스피어, 테일러 스위프트를 996 부근의 실질적 상한선에 올려놓는 구도—에서 가장 강력합니다 .

추출 메커니즘도 없습니다. MemHunter의 데이터셋 규모 가설 검증 탐지 나 멤버십 추론 공격과 달리, "In the Weights"와 LMP2 모두 특정 문서가 학습 코퍼스에 포함되었는지를 판단할 수 없으며, 일관된 전기적 출력이 나타난다는 사실만 확인할 수 있습니다. LMP2 저자들은 합성 이름과 신뢰도 분리를 활용해 안정적 연관성과 추측을 구분하려 하지만, 이름 단서 과대평가 가능성을 완전히 배제하지는 못합니다 . 비평가 Anthony Moser는 직설적으로 표현했습니다: 이 도구는 "말 그대로 13개의 챗봇에 자신에 대해 물어보는 것과 같다"고 .

재현성이 마지막 공백입니다. 2026년 6월 현재 API, 버전 번호, 유료 티어가 공개되지 않았으며, 종합 가중치 산정 방식에 대한 문서화된 방법론도 없습니다 . Grok, Gemini, GPT 버전이 프롬프트 뒤에서 조용히 변경된다면 점수 비교는 공지 없이 표류합니다. 핵심 시사점: 강도 점수를 대략적인 회상·인지도 지표로 취급하고, 단일 수치를 신뢰하기보다 시간에 걸쳐 반복적인 교차 모델 감사를 실행하며, 실제 프라이버시나 삭제 결정은 속성별 신뢰도를 보고하는 LMP2·WikiMem 같은 계측된 프로브에 맡기십시오.

자주 묻는 질문

'In the Weights'의 종합 회상 점수는 어떻게 계산되나요?

이 도구는 표준화된 프롬프트 하나—대략 "<name>은 누구인가요? 각각 설명과 신뢰도를 포함해 최대 10개의 결과를 제시하라"—를 Grok, Gemini, 다양한 GPT 버전, Claude, Llama 등 13개 이상의 챗봇에 동시에 전송합니다. 모델 전반에서 의미적으로 유사한 설명을 클러스터링하고 환각 가능성이 있는 항목을 표시한 뒤, 결과를 단일 가중 강도 점수로 압축합니다(높을수록 교차 모델 회상이 일관된다는 의미). 사이트에서는 실질적 상한선을 996 부근으로 보고하지만, 정확한 가중치 산정 공식은 공개되지 않았습니다.

높은 종합 점수는 내 개인 데이터가 챗봇 학습 코퍼스에 있었다는 것을 확인해 주나요?

아닙니다. 이 점수는 생성 일관성을 측정하는 것이지 코퍼스 포함 여부를 측정하지 않습니다. 자신감 있는 전기적 출력은 일반화, 문맥적 단서로부터의 추론, 또는 노골적인 환각에서 비롯될 수 있으며—특정 문서의 축자적 암기에서만 오는 것이 아닙니다. 비평가 Anthony Moser는 이 도구를 "말 그대로 13개의 챗봇에 자신에 대해 물어보는 것과 같다"고 일축했습니다 . 이 도구도 학술적 LMP2 프로브도 특정 문서가 학습 데이터셋에 포함되었음을 증명할 수 없으며, 둘 다 학습 데이터셋 포함 여부를 검증하지 않고 안정적 연관성만 드러냅니다.

LMP2는 'In the Weights'와 어떻게 다른가요?

LMP2(언어 모델 프라이버시 프로브)는 Dimitri Staufer와 Kirsten Morehouse가 2026년 2월 19일 arXiv 논문에서 소개한 체계적 속성별 감사 도구입니다. 사용자가 전체 이름을 입력하고 50가지 개인 특성 중 세 가지를 선택하면, 프래그먼트 완성 프롬프트, 토큰 로그 확률, 속성당 5개의 카나리아 패러프레이즈, 20개의 반사실적 접두사에서 도출된 신뢰도 점수와 함께 후보 값을 제공받습니다 . 'In the Weights'는 속성 스키마 없이 단일 개방형 프롬프트를 사용하며, 구조적 측정보다 소비자 자기 조회를 목표로 합니다.

챗봇이 개인 전기적 사실을 회상할 때 GDPR은 무엇을 요구하나요?

현재 미해결 상태입니다. 2024년 12월 AI 모델에 관한 EDPB 의견은 개인 데이터로 학습된 모델이 모든 경우에 익명이라는 일괄적 가정을 거부합니다 . 그러나 확률적이고 이름 조건부인 출력이 제15조~17조의 열람·정정·삭제 권리의 적용을 받는 개인 데이터를 구성하는지 여부는 아직 판결이 나지 않았습니다 . 개발자들은 이 문제를 해결된 것이 아닌 열린 문제로 취급해야 합니다.

전기적 회상 프로빙을 사용해 내 애플리케이션의 환각을 감사할 수 있나요?

네, 저비용으로 가능합니다. 'In the Weights'는 모델들이 의견이 불일치하거나 전기적 세부 정보를 날조하는 곳을 드러내는 빠른 다중 챗봇 일관성 검사를 제공하며, LMP2의 50가지 속성 스키마는 보고된 신뢰도와 함께 더 엄격한 인물별·속성별 감사에 적합합니다. LMP2의 8개 모델 테스트에서 대형 API 모델은 Grok-3의 경우 0.54, GPT-5의 경우 0.47의 평균 F1에 도달한 반면, 소형 오픈 모델은 0.16~0.19였으므로, 감사 깊이에 맞는 도구를 선택하십시오. 둘 다 코퍼스 포함 여부를 증명하지 못합니다.