SKT A.X K2, 중국산 오픈 모델과 숫자로 맞춰보기
2026년 7월 공개된 SKT A.X K2(688B MoE)의 Hugging Face 벤치표를 Qwen3.5·DeepSeek-V4 Flash·GLM-5.1·Kimi-K2.6과 나란히 읽고, 어디에 쓰고 어디에 안 쓸지 정리합니다.

뉴스 헤드라인만 보면 “한국 모델이 중국산을 이겼다”로 끝나기 쉽다. 카드는 더 구체적이다. SK텔레콤이 Hugging Face에 올린 A.X K2는 총 파라미터 688B, 토큰당 활성 33B인 MoE이고, 표에는 Alibaba Qwen3.5 (397B-A17B), DeepSeek-V4 Flash, GLM-5.1, Moonshot Kimi-K2.6, MiniMax M2.7이 같은 thinking 모드 조건으로 나란히 있다. 아래 숫자는 그 카드의 Evaluation Results(Thinking Mode)를 옮긴 것이다. 내가 GPU 위에서 다시 돌린 값이 아니다.
왜 굳이 중국산과 붙이나. 국내 주권 AI 담론이 상대를 중국·미국 오픈 가중치로 잡기 때문이고, 실무에서도 OpenRouter·자체 호스팅 후보가 그 라인업과 겹친다. 서민혁닷컴에 예전에 적어 둔 프론티어 모델 비교가 서구 상용 API 쪽이었다면, 이번은 오픈 가중치·벤치 표 쪽에 가깝다.
한 줄로 먼저
수학·한국어 벤치에서는 A.X K2가 표 안에서 자주 1등이다. 코딩·웹 브라우징·일부 지식 벤치에서는 DeepSeek·Kimi·GLM이 앞선다. “전부 이김”이 아니라 한국어·통신 도메인·장문 쪽 주권 모델을 키운 결과로 읽는 편이 맞다.
표에서 눈에 띄는 줄
| 벤치 | A.X K2 | Qwen3.5 | DeepSeek-V4 Flash | GLM-5.1 | Kimi-K2.6 |
|---|---|---|---|---|---|
| AIME26 (수학) | 97.1 | 92.5 | 96.7 | 95.4 | 95.4 |
| Apex (수학) | 45.8 | 13.5 | 28.1 | 10.4 | 20.8 |
| KMMLU-Pro (한국어) | 80.5 | 78.4 | 78.8 | 76.5 | 73.4 |
| CLIcK (한국어) | 91.6 | 88.4 | 89.6 | 88.8 | 80.9 |
| KoBALT (한국어) | 73.0 | 69.9 | 75.3 | 72.0 | 66.0 |
| LiveCodeBench v6 | 84.0 | 82.6 | 89.4 | 86.4 | 86.5 |
| SciCode | 41.0 | 42.0 | 44.9 | 43.8 | 53.5 |
| GPQA Diamond | 85.6 | 89.3 | 89.4 | 86.8 | 91.1 |
| Humanity’s Last Exam | 27.8 | 27.3 | 32.1 | 28.0 | 35.9 |
| IFBench | 75.9 | 79.0 | 81.2 | 78.6 | 74.0 |
| τ²-Bench Telecom* | 98.0 | 95.6 | 95.0 | 97.7 | 95.9 |
| BrowseComp (≤10 searches) | 9.3 | 26.9 | 16.8 | 29.1 | 21.5 |
* Artificial Analysis 평가라고 카드에 표기. 출처: skt/A.X-K2 모델 카드 (열람 기준 2026-07).
사실만 보면 Apex 격차가 이상할 정도로 크다(45.8 vs Qwen 13.5). 이유는 카드가 “thinking mode 통일 평가”라고 밝힌 점과, Apex가 최종 답만이 아닌 난이도 높은 수학 축으로 보이기 때문이다. 평가는 “수학 하드코어에서는 SKT가 공격적으로 맞춘 티가 난다” 정도다. 부연하면, 같은 표의 KMO26 1라운드는 DeepSeek-V4 Flash(94.4)가 A.X K2(92.5)보다 높다. 수학 안에서도 벤치마다 1등이 바뀐다.
한국어는 KMMLU-Pro·CLIcK에서 K2가 앞서고, KoBALT만 DeepSeek가 75.3으로 더 높다. “한국어=무조건 K2”로 단순화하면 이 한 줄에서 걸린다.
중국산 네 모델, 각자 이기는 판
Qwen3.5는 범용 지시·지식 쪽에서 구멍이 적다. IFBench 79.0, GPQA 89.3. 한국어만 보면 K2에 밀리지만, BrowseComp 26.9로 검색형 에이전트 과제에서 K2(9.3)를 크게 앞선다. 웹을 뒤지며 답을 모으는 파이프라인에는 Qwen·GLM 쪽이 표상 유리하다.
DeepSeek-V4 Flash는 LiveCodeBench 89.4로 코딩 실측 성격 벤치에서 제일 높다. AIME26도 96.7로 K2(97.1)와 초접전이다. 에이전트 루프·패치 양산에 중국산 DeepSeek를 쓰는 팀 입장에선, “한국 모델이 수학에서 이겼다”는 뉴스보다 이 줄이 더 아프다.
GLM-5.1은 BrowseComp 29.1로 표 안 최고, τ² Telecom도 97.7로 K2(98.0) 바로 아래다. 도구·브라우징 비중이 큰 제품이면 벤치만 놓고는 GLM을 후보에서 빼기 어렵다.
Kimi-K2.6은 SciCode 53.5, HLE 35.9, GPQA 91.1처럼 과학·난이도 높은 지식 축에서 강하다. 한국어 CLIcK은 80.9로 상대적으로 낮다. “만능 1등”이 아니라 도메인 특화가 갈린다.
MiniMax M2.7은 표에 있으나 대체로 중하위. 비교 축을 흐리지 않기 위해 위 표에서는 생략했다. 원표는 HF 카드에 있다.
벤치 바깥에서 카드가 강조하는 것
A.X K2는 Think / Non-Think를 한 모델에서 고를 수 있다고 한다(enable_thinking). 긴 추론이 필요할 때만 비용을 쓰는 식이다. 컨텍스트는 네이티브 128K, YaRN으로 256K까지 확장, RULER 평균 94.6, NIAH는 카드 기준 전 구간 만점에 가깝게 적혀 있다. 기업 문서·규정처럼 긴 한국어 컨텍스트를 넣는 시나리오와 맞물린다.
동시에 배포 현실은 무겁다. FP8 체크포인트만 디스크 약 647GiB, 풀 서빙에 GPU 메모리를 수백 GiB~TB 급으로 잡으라고 카드가 안내한다. Transformers 경로와 vLLM 포크가 나뉘어 있다. 노트북 한 대로 “받아 돌려 보자” 급이 아니다. OpenRouter에 올라온 중국산 API를 쓰는 것과 운영 계층이 다르다. 비용 감각은 OpenRouter 코딩 비용 글 쪽 이야기고, 여기선 “가중치를 직접 띄울 팀”과 “API만 쓸 팀”을 섞어 읽으면 안 된다는 점만 강조한다.
언론은 K1 대비 14개 벤치 평균 +32.2%p, 장문·에이전트 축 +83.9%p 같은 상대 개선을 크게 적었다(이데일리 영문, 아주경제 영문). 절대 점수표(HF)와 상대 개선률(보도)은 층위가 다르다. 둘을 같은 문장에 섞지 않는 게 안전하다.
그래서 어디에 쓰나 / 어디에 안 쓰나
쓰기에 설득력 있는 쪽: 한국어 업무 지식(KMMLU·CLIcK 경향), 통신·산업 FAQ(τ² Telecom 1등), 장문 규정·보고서, 수학·논리 풀이(AIME·Apex·IMO 관련 서술). 정부 주권 AI 평가·국내 데이터 거버넌스를 이유로 가중치 국산이 필요한 조달.
당장 안 맞거나 재검증이 필요한 쪽: LiveCodeBench·SciCode 최상위가 필요한 코딩 에이전트(DeepSeek·Kimi가 표상 우위), 검색 횟수 제한 BrowseComp형 웹 에이전트(GLM·Qwen 우위), HLE·GPQA처럼 최신 고난도 지식 퀴즈(Kimi 등). 그리고 로컬 한 장 GPU로 돌리려는 개인 블로그 운영자—나 포함—에게는 아직 그림의 떡에 가깝다.
벤치 자체도 제작사 카드다. 프롬프트, 도구 허용, 검색 예산, 채점 스크립트가 조금만 달라도 순위가 흔들린다. Artificial Analysis 표기 줄(*)과 자체 측정 줄을 같은 “절대 진리”로 취급하면 안 된다. 도입 전에는 사내 한국어 티켓·코드 리뷰·규정 QA 샘플로 다시 재는 게 맞다.
짧은 결론
A.X K2는 “중국산을 전 종목에서 꺾은 만능기”가 아니라, 688B/33B MoE로 한국어·수학·통신 벤치에 힘을 실은 SKT 주권 모델이다. 같은 표의 Qwen·DeepSeek·GLM·Kimi는 코딩·브라우징·과학 지식에서 각각 이긴다. 뉴스의 승자 프레임보다, 업무 축을 고른 뒤 표의 해당 행만 보는 쪽이 실무에 가깝다. 가중치를 직접 운영할 여력이 없다면, 이 글의 숫자는 “나중에 국산 엔드포인트가 열렸을 때 무엇을 기대할지”의 사전 노트 정도로 남겨 두면 된다.
출처
- skt/A.X-K2 · Hugging Face — 아키텍처(688B/33B), Think-Fusion, Evaluation Results 표( Thinking Mode ), RULER/NIAH, 서빙 메모리 안내 (열람: 2026-07-30)
- SKT’s A.X K2 Outperforms Chinese Models… - EDAILY — 공개 시점·K1 대비 서사, AIME26/KMMLU/CLIcK·τ² 보도 (2026-07)
- SK Telecom Unveils 688B AI Model ‘A.X K2’ - Aju Press — K1 대비 +32.2%p·장문/에이전트 +83.9%p 등 보도 수치 (2026-07)
- SK Telecom unveils 688-billion-parameter AI model - The Herald Business — 정부 평가·비교 대상 모델명 보도 (2026-07)