AI 모델 대백과

도키피디아 v1.1

관측 기준일 2026-08-23 비교 모델 28종 지표 출처 Artificial Analysis v4.1.1 외

종합 점수 하나는
백색광이다

비용 대비 지능 차트는 모든 모델을 한 줄로 세운다. 유용하지만, 실제로 일을 맡길 때 필요한 정보는 거기 없다. 같은 62점이라도 어떤 모델은 터미널에서 강하고, 어떤 모델은 한국어 문서에서 강하다. 이 백과는 그 하나의 점수를 여섯 개 대역으로 분광한다.

사용 설명

이 문서를 읽기 전에

숫자를 그대로 믿기보다, 숫자가 어떻게 만들어졌는지를 먼저 보는 게 이 분야에서는 훨씬 안전합니다. 아래 다섯 가지는 이 문서 전체에 걸쳐 적용되는 전제입니다.

유통기한이 짧습니다

7월 31일 이후 3주 동안 Grok 4.6, GLM-5.3, Gemini 3.7 Flash, Solar Pro 4가 새로 나왔습니다. 요즘 프런티어 모델 교체 주기는 3~5주입니다. 이 문서도 한 달 뒤엔 절반쯤 어긋납니다.

AAII도 결국 합성 점수입니다

Artificial Analysis 지능 지수는 GDPval-AA, τ³-Banking, Terminal-Bench, SciCode, HLE, GPQA Diamond 등 9개 평가를 평균낸 값입니다. 평균은 강세와 약세를 동시에 지웁니다.

추론 강도에 따라 점수가 달라집니다

같은 모델도 low·medium·high·xhigh·max 설정에 따라 몇 점씩 움직입니다. "Opus 5 = 63점"은 max 설정 기준이고, 비용과 응답 시간은 그만큼 올라갑니다.

비교군을 반드시 확인하세요

업스테이지 Solar Open 2의 공식 차트는 범례에 open models (Under 320B)fast-tier closed models로 조건을 밝혀 뒀습니다. 즉 최상위 상용 모델은 비교군에 없습니다. "1위"는 언제나 "무엇들 사이에서 1위"인지 확인해야 합니다.

강세 막대는 편집자의 판단입니다

모델 카드 아래 여섯 칸 막대는 공표된 합성 지표가 아니라, 아래 인용한 벤치마크·가격·스펙을 근거로 제가 5단계로 정리한 정성 평가입니다. 근거는 각 카드와 대역 항목에 함께 적어 뒀으니, 판단이 다르면 근거 쪽을 보고 다시 매겨 주세요.

기준선 갱신

8월의 좌표

먼저 첨부하신 7월 31일 차트를 현재 시점으로 갱신한 표입니다. 여기까지가 "하나의 축"이고, 다음 절부터가 이 문서의 본론입니다.

AAII = Artificial Analysis Intelligence Index v4.1.1 기준. 가격은 100만 토큰당 입력/출력. 점수는 대체로 max 또는 high 설정 기준이며, 재채점으로 수시로 바뀝니다.
모델AAII입력 / 출력맥락
Claude Opus 5 Anthropic · 07-2463$5 / $25현재 지수 1위. Fable 5의 절반 가격
Claude Fable 5 Anthropic · 06-0962$10 / $50최상위 플래그십. 30일 데이터 보존 조건
GPT-5.6 Sol OpenAI · 07-0961$4 / $20Coding Agent Index 1위(80). 8/21 인하 — 11/21까지 프로모션가(표준 $5 / $30)
Grok 4.6 SpaceXAI · 08-1261$2 / $6같은 점수를 60% 싸게. 작업당 $0.84
GLM-5.3 Z.ai · 08-14 오픈 예정60$1.40 / $4.40프런티어 중 작업당 비용 최저($0.68)
Kimi K3 Moonshot · 07-16 오픈웨이트57$3 / $15오픈웨이트 최고 점수. 2.8T MoE
Gemini 3.7 Flash Google · 08-1356$0.75 / $3.75출력 속도 1위(340 t/s). 12/31까지 프로모션가
DeepSeek V4 Flash 0731 DeepSeek MIT52$0.14 / $0.28가격 대비 지능의 기준점
Gemini 3.6 Flash Google · 07-2152$0.75 / $3.753.7과 동일 요금으로 조정됨
GLM-5.2 Z.ai MIT51$1.10 / $4.108×H100급이면 자체 구동 가능
GPT-5.6 Luna OpenAI50$0.20 / $1.207/30에 80% 인하. 대량 처리용
Motif 3 모티프테크놀로지스 국내 오픈웨이트47미·중 제외 국가 중 최고. 314B
MiniMax-M3 MiniMax45$0.30 / $1.20Solar Pro 4와 동일 가격대
Solar Pro 4 업스테이지 · 08-06 국내42$0.30 / $1.20Solar Pro 3(14) 대비 +27점
Solar Open 2 업스테이지 · 07-22 국내 오픈웨이트37250B / 활성 15B, 1M 컨텍스트
A.X-K2 SK텔레콤 국내 오픈웨이트35688B
K-EXAONE 2.0 LG AI연구원 국내 Apache 2.031국내 최대 750B, 10개 언어

→ 표가 잘리면 좌우로 밀어 보세요

이 표에서 읽을 것. 상위 다섯 모델이 63~60점, 3점 안에 몰려 있습니다. 반면 가격은 $10에서 $1.40까지 7배 차이가 납니다. 8/21 GPT-5.6 Sol 인하($5→$4)까지 더하면 상위권 안에서도 값이 계속 내려가는 중입니다. 즉 8월의 경쟁은 지능이 아니라 같은 지능을 얼마에 파는가로 옮겨 갔습니다. 그리고 그 안에서 각자 잘하는 일이 다릅니다.

대역 안내

여섯 개의 강세 대역

아래 여섯 대역은 실제 벤치마크가 나뉘는 방식과 사람들이 모델에 실제로 맡기는 일을 겹쳐서 나눈 것입니다. 색은 파장 순서를 따르며, 문서 전체에서 같은 의미로 씁니다.

코딩·에이전트

Terminal-Bench · SWE-bench · τ³ · AutomationBench

코드를 고치고, 터미널을 돌리고, 도구를 여러 번 호출하며 끝까지 일을 마치는 능력. 시뮬레이터·웹앱을 만드는 바이브코딩이 정확히 이 대역에 걸립니다. 여기서 갈리는 건 첫 답의 품질이 아니라 스스로 결과를 검증하고 다시 고치는가입니다.

최우선Claude Opus 5

계획 → 실행 → 검증 → 수정의 긴 흐름을 사람이 중간에 붙잡아 주지 않아도 유지합니다. 여러 파일에 걸친 리팩터링과 버그 추적이 특히 강합니다.

AA Agentic Index 55.3 · Claude Code 내 Terminal-Bench 86.7% · SWE-bench Pro 79.2%
동급 경쟁GPT-5.6 Sol

코딩 에이전트 지수에서는 오히려 1위. ultra 모드는 서브에이전트를 병렬로 굴립니다. 사이버보안·과학 코드 쪽 강세가 뚜렷합니다.

Coding Agent Index 80(1위) · Terminal-Bench 2.1 Ultra 91.9%
가성비Grok 4.6

정확도보다 턴 효율이 무기입니다. 같은 장기 과제를 Opus 5의 절반 턴으로 끝냅니다. 대량으로 굴릴 때 총비용이 크게 벌어집니다.

평균 53턴 / 입력 0.5B (Opus 5 max는 103턴 / 2.0B) · $2·$6
오픈웨이트Kimi K3 · DeepSeek V4 Pro

K3는 프런트엔드 코드 아레나 1위로 Fable 5보다 앞섰습니다. V4 Pro는 다운로드 가능한 가중치 중 SWE-bench 최고.

K3: Frontend Code Arena 1,679 Elo · Terminal-Bench 88.3% / V4 Pro: SWE-bench Verified 80.6%(벤더)

추론·과학

GPQA Diamond · HLE · ARC-AGI · CritPt · AIME

답을 아는 것과 답을 유도해 내는 것은 다릅니다. 대학원 수준 과학 문제, 처음 보는 규칙의 퍼즐, 여러 단계의 논증이 필요한 문제가 이 대역입니다. 과학 교과 자료를 만들 때 오개념이 섞이는지가 여기서 갈립니다.

최우선Gemini 3.1 Pro

순수 추론 벤치마크의 선두. 큰 컨텍스트와 결합해 긴 자료를 통째로 넣고 따져 묻는 작업에 가장 잘 맞습니다.

GPQA Diamond 94.3% · 1M 컨텍스트
낯선 문제Claude Opus 5

규칙을 처음부터 추론해야 하는 과제에서 격차가 큽니다. 문제 정의 자체가 모호할 때 강합니다.

ARC-AGI 3에서 차순위 모델의 약 3배 · Frontier-Bench SOTA
지식 노동Grok 4.6

지식 업무와 법률 추론 계열에서 상대적으로 강합니다. 다만 터미널 작업은 약한 편이라 용도를 나눠 쓰는 게 낫습니다.

AA-Briefcase Elo 1577(Fable 5 급)
참고 사례Claude Fable 5

2026년 7월 20일, 수학자 Levent Alpöge가 Fable 5를 이용해 야코비 추측의 복소 3변수 다항식 반례를 찾아냈습니다. 반례는 검증이 쉬워 빠르게 인정받았습니다.

난제형 탐색에서 모델을 도구로 쓴 실제 사례

장문맥·문서

AA-LCR · 컨텍스트 윈도 · 최대 출력

수백 쪽짜리 매뉴얼, 긴 회의록, 대형 코드베이스를 한 번에 넣고 다루는 능력. 중요한 건 "몇 토큰까지 들어가는가"가 아니라 그 안에서 필요한 걸 정확히 찾아내는가입니다. 광고된 컨텍스트 크기와 실제 정확도는 별개입니다.

최우선Claude Opus 5 · Sonnet 5

둘 다 1M 컨텍스트가 기본값이고 최대 출력 128K. Opus 5는 1M이 기본이자 최대로, 작은 변형이 따로 없습니다.

1M in / 128K out · Opus 5 지식 기준 2026-05, Sonnet 5는 2026-01
저비용 대안Gemini 3.7 Flash

1M 입력에 요금이 프런티어의 몇 분의 일. 다만 출력은 64K로 묶여 있어 긴 산출물에는 나눠 쓰는 설계가 필요합니다.

1M in / 64K out · $0.75·$3.75 (2026-12-31까지)
주의Grok 4.6

500K 컨텍스트지만 200K를 넘는 순간 요청 전체가 2배 요금으로 재계산됩니다. 긴 문서 작업에서는 이 절벽을 먼저 계산해야 합니다.

500K · 200K 초과 시 $4·$12
국내Solar Pro 4

이번 세대에서 가장 크게 오른 영역이 바로 장문맥입니다. 384K 컨텍스트에 최대 출력 256K로, 긴 산출물 쪽은 오히려 여유가 있습니다.

AA-LCR 31% → 71% · 384K in / 256K out

멀티모달

이미지 · 영상 · 오디오 · PDF 입력

학생 활동지 사진, 실험 영상, 스캔한 유인물처럼 텍스트가 아닌 자료를 그대로 넣을 수 있는가. 의외로 여기서 모델이 가장 뚜렷하게 갈립니다 — 아예 안 되는 모델이 많습니다.

최우선Gemini 3.7 Flash

텍스트·이미지·영상·오디오·PDF를 모두 입력으로 받습니다. 유튜브 URL을 그대로 넘겨 썸네일이나 요약 인포그래픽을 만드는 경로도 열려 있습니다.

5종 입력 · 검색 그라운딩 · 컴퓨터 사용(프리뷰)
오픈웨이트Kimi K3

네이티브 비전을 갖춘 오픈웨이트 모델. 다만 가중치가 1.5TB대라 "공개"와 "직접 돌릴 수 있음"은 별개입니다.

4개 모달리티 · 2.8T / 활성 104B · 권장 가속기 64장 이상
GUI 작업Qwen 3.8 Max

비전과 영상에 더해 화면을 보고 조작하는 GUI 에이전트 쪽을 내세웁니다. 다만 벤치마크가 대부분 자체 발표라 독립 검증은 아직입니다.

2.4T / 활성 95B · 1M 컨텍스트
확인 필요텍스트 전용 모델들

Solar Pro 4는 텍스트 입출력만 지원합니다. Grok 4.6은 텍스트·이미지·PDF까지. 자료 형태부터 확인하고 모델을 고르세요.

모달리티는 가격표보다 먼저 봐야 하는 항목

속도·비용

토큰 단가 · 출력 속도 · 작업당 비용

토큰 단가는 함정이 있습니다. 진짜 지표는 승인 가능한 결과 한 건당 총비용이고, 여기엔 재시도와 사람이 손보는 시간이 포함됩니다. 싼 모델이 세 번 실패하면 비싼 모델보다 비쌉니다.

최고 속도Gemini 3.7 Flash

186개 모델 중 출력 속도 1위. 응답을 기다리는 게 병목인 대화형·실시간 용도에서 체감 차이가 큽니다.

340.1 tokens/s · 지능 대비 소요시간 파레토 프런티어
최저 단가DeepSeek V4 Flash 0731

50점대 지능을 프런티어 대비 수십 분의 일 가격에. 분류·요약·태깅처럼 대량 반복 작업의 기준점입니다.

$0.14 / $0.28 · AAII 52 · 284B / 활성 13B
대형 벤더GPT-5.6 Luna

7월 30일 80% 인하로 위치가 완전히 바뀌었습니다. 다만 아주 긴 문맥에서의 정확도는 상위 티어에 못 미치니 긴 문서엔 쓰지 마세요.

$0.20 / $1.20 · 같은 세대 Sol 대비 25배 저렴
작업당 비용GLM-5.3 · Grok 4.6

단가가 아니라 한 과제를 끝내는 데 드는 실제 비용 기준의 선두. 프런티어 급 지능을 유지하면서 이 값이 가장 낮습니다.

GLM-5.3 $0.68/task · Grok 4.6 $0.84/task

한국어·창작

CLIcK · Ko-GDPval · 토큰 효율 · 문체

한국어를 이해하는가와 한국어로 쓸 만한 문장을 만드는가는 다른 문제입니다. 여기에 한국 문화·제도 맥락과 토큰 효율까지 더하면, 국내 모델이 유일하게 우위를 갖는 대역이 나옵니다.

글쓰기Claude Fable 5

창작·문체 쪽 추천이 가장 많이 몰리는 모델. Sol이 바로 뒤를 따릅니다. 다만 한국어 이해도는 높은데 번역체가 섞이는 경향이 지적됩니다.

$10 / $50 · 30일 데이터 보존 정책 적용
한국어 지표Solar Open 2

한국 문화·상식(CLIcK)과 한국어 실무 산출물(Ko-GDPval) 항목에서 비교군 내 1위. 표·보고서를 함께 만들어 내는 형태의 작업이 이 지표가 재는 것입니다.

CLIcK 90.7 · Ko-GDPval 86.8 · 비교군은 320B 미만 오픈모델
토큰 효율국내 모델 전반

같은 한국어 문장을 더 적은 토큰으로 처리합니다. 한국어 문서를 대량으로 다룬다면 단가가 같아도 실제 비용이 내려갑니다. 영어에서는 차이가 거의 없습니다.

토큰당 바이트 기준 · A.X-K1, K-EXAONE이 특히 높음
주의벤치마크와 체감의 간극

Solar 계열은 벤치마크 점수 대비 실사용 문장 품질에 대한 지적이 커뮤니티에서 반복해 나옵니다. 도입 전 자기 업무 데이터로 직접 확인하는 절차를 꼭 넣으세요.

Solar Pro 4 환각률 24% · 질문의 41%만 시도(나머지는 답변 보류)

모델 카드

모델별 강세 스펙트럼

카드 하단의 여섯 칸 막대가 그 모델의 강세 분포입니다. 높이는 5단계이고, 색은 위 대역과 같습니다. 절대 성능이 아니라 그 모델 안에서 무엇이 상대적으로 강한가를 봅니다.

코딩·에이전트 추론·과학 장문맥·문서 멀티모달 속도·비용 한국어·창작

Anthropic

Claude 5 세대 · 1M 컨텍스트 · 사고 기본 활성

Claude Opus 5

63
$5 / $25
복잡한 에이전트 코딩과 기업 업무

모호한 요구에서 스스로 빈칸을 메우고, 결과를 검증한 뒤 될 때까지 고칩니다. Fable 5에 근접한 성능을 절반 가격에 낸다는 게 이 모델의 자리입니다. 오작동 행동 점수가 최근 Claude 중 가장 낮고, 안전 분류기 발동도 Fable 5의 약 15% 수준이라 정상 업무에서 막히는 일이 적습니다.

컨텍스트 1M in / 128K out지식 기준 2026-05출시 2026-07-24

Claude Fable 5

62
$10 / $50
장시간 구동 에이전트를 위한 최상위

여전히 라인업 최상단입니다. 글쓰기와 난제형 탐색에서 평이 가장 좋지만, 가격이 Opus 5의 2배고 30일 데이터 보존 정책이 붙습니다. 6월 12일 미 상무부 수출통제로 전 세계 접근이 중단됐다가 7월 1일 복구된 이력이 있어, 업무 파이프라인의 단일 의존 대상으로 삼기엔 위험이 있습니다.

컨텍스트 1M in / 128K out특이 분류기 차단 시 Opus 4.8로 자동 폴백출시 2026-06-09

Claude Sonnet 5


$3 / $15
일상 업무의 기본값

범위가 분명하고 자주 돌려야 하는 일의 기본값. 항목에 따라 Opus 5를 앞서기도 합니다. 다만 새 토크나이저 때문에 같은 글이 1.0~1.35배 토큰으로 계산돼, 표시 단가만으로 비교하면 실제보다 싸 보입니다.

컨텍스트 1M in / 128K out벤치 SWE-bench Verified 85.2% · Terminal-Bench 80.4%출시 2026-06-30

Claude Haiku 4.5


저비용
속도와 비용이 우선인 자리

컨텍스트가 200K로 다른 라인업보다 작지만 짧은 입력 작업엔 충분합니다. 5세대 모델의 보조 역할로, 분류·라우팅·간단한 변환처럼 판단이 거의 필요 없는 자리에 붙입니다.

컨텍스트 200K자리 Opus 대비 약 1/5 가격대

OpenAI

GPT-5.6 · 태양·지구·달 3단 티어 · 7/30 Terra·Luna 인하, 8/21 Sol 인하

GPT-5.6 Sol

61
$4 / $20
최고 난도 추론과 에이전트

가장 균형 잡힌 만능형입니다. 글쓰기·분석·멀티모달 어디든 무난하고 생태계가 두껍습니다. Sol Pro와 Sol Ultra는 별도 모델이 아니라 같은 모델의 고연산 모드로, ultra는 서브에이전트를 병렬로 돌립니다. 다만 max 설정에서는 첫 토큰까지 200초 이상 걸리기도 합니다.

주의 별칭 gpt-5.6은 Sol로 라우팅됨벤치 Coding Agent Index 80(1위)출시 2026-07-09요금 8/21부터 $4 / $20 (프로모, 최소 11/21까지)

GPT-5.6 Terra


$2 / $12
균형형 · 매일 쓰는 자리

이전 세대 GPT-5.5급 품질을 절반 이하 가격에 냅니다. 7월 30일 20% 인하로 위치가 한 번 더 좋아졌습니다. 고민되면 여기서 시작해 필요할 때만 Sol로 올리는 구성이 가장 무난합니다.

벤치 Terminal-Bench 2.1 80%+인하 2026-07-30, $2.50/$15 → $2/$12

GPT-5.6 Luna

50
$0.20 / $1.20
대량·저지연 처리

7월 30일 80% 인하로 Sol과 25배 격차가 벌어졌습니다. 분류, 요약, 제목 후보 대량 생성, 짧은 리라이트처럼 실패해도 손해가 적은 일에 붙입니다. 아주 긴 문맥에서는 정확도가 떨어지니 긴 문서 작업엔 쓰지 마세요.

인하 2026-07-30, $1/$6 → $0.20/$1.20주의 장문 정확도 낮음

Google

Gemini 3.x · Flash 계열이 사실상 주력

Gemini 3.1 Pro


Preview
어려운 추론과 알고리즘

순수 추론 벤치마크의 선두이고 1M 컨텍스트와 멀티모달 입력을 갖췄습니다. 다만 아직 Preview 상태이고, 코딩·실행 계열 벤치마크에서는 오히려 Flash 계열에 밀립니다. Gemini 3.5 Pro는 8월 22일 현재 미출시입니다.

벤치 GPQA Diamond 94.3%상태 Preview · file search는 AI Studio 한정

Gemini 3.7 Flash

56
$0.75 / $3.75
가장 똑똑한 일꾼 모델

두 달도 안 되는 사이 세 번째 Flash입니다. 코딩 벤치마크가 크게 올랐고(DeepSWE 49.0→65.3, AutomationBench 17.0→30.4) 출력 속도는 전체 1위. Antigravity와 Gemini Spark의 기본 모델 자리도 이어받는 흐름입니다.

속도 340.1 tokens/s (186종 중 1위)규격 컨텍스트 1M / 출력 64k · 지식 컷오프 2026-03주의 프로모션가는 2026-12-31 종료, 이후 2배출시 2026-08-13

Gemini 3.5 Flash-Lite


최저가
극단적 저지연·대량 처리

3.7에서 MINIMAL 사고 수준이 사라지면서, 지연에 극도로 민감한 용도는 이쪽으로 내려와야 합니다. 판단이 거의 필요 없는 반복 처리 전용입니다.

자리 3.7 Flash가 못 맡는 초저지연 구간

SpaceXAI

구 xAI · 2026-02 스페이스X와 합병

Grok 4.6

61
$2 / $6
에이전트 우선 · 턴 효율

Grok 4.5와 같은 1.5T 기반에 사후학습만 다시 돌린 모델입니다. 강점은 점수가 아니라 효율 — 같은 장기 과제를 Opus 5의 절반 턴, 4분의 1 입력 토큰으로 끝냅니다. 반면 첫 토큰까지 40~52초로 느리고, 터미널 작업은 약합니다. 4.7(2.1T)이 곧 나온다는 예고가 있어 교체 주기가 짧을 수 있습니다.

컨텍스트 500K · 200K 초과 시 요금 2배입력 텍스트·이미지·PDF지식 기준 2026-02

오픈웨이트

가중치 공개 ≠ 개인 장비로 구동 가능

Kimi K3

57
$3 / $15
오픈웨이트 최강 올라운더

2.8조 파라미터, 오픈웨이트 사상 최고 점수. 프런트엔드 코드 아레나에서는 Fable 5까지 제쳤습니다. 다만 가중치가 1.5TB대이고 가속기 64장 이상을 권장해, 실질적으로는 호스팅 API로 쓰는 모델입니다. 라이선스는 수정 MIT(월 활성 1억 명 초과 시 표기 의무).

규모 2.8T / 활성 104B · 1M 컨텍스트벤치 Frontend Arena 1위 · SWE-bench Verified 93.4%

DeepSeek V4

52
$0.14 / $0.28
가격 대비 지능의 기준점

Pro(1.6T/49B)와 Flash(284B/13B) 두 갈래, 둘 다 1M 컨텍스트에 MIT 라이선스. Flash 0731 체크포인트는 사후학습을 전면 재실행해 에이전트 성능이 크게 올랐습니다. 다만 8월 들어 API 가격을 최대 11배 인상하고 피크 할증을 도입해, 가격 안정성은 주의가 필요합니다.

라이선스 MIT · 상업 이용 자유Flash 자체 구동 활성 13B로 상대적으로 가벼움

GLM-5.2 / 5.3

51 / 60
$1.10~1.40
장기 코딩과 사이버

5.2는 MIT로 가중치가 공개돼 있고 8×H100급이면 자체 구동이 가능합니다. 8월 14일 나온 5.3은 60점으로 프런티어 근처에 진입했고 작업당 비용은 전체 최저($0.68)지만, 아직 벤더 자체 지표 중심이고 가중치는 공개 예정 상태입니다.

5.2 753B · MIT · 1M 컨텍스트5.3 CyberGym 84.5%(벤더 발표)

Qwen 3.8 Max


유료 프리뷰
멀티모달 · GUI 에이전트

2.4조 파라미터에 1M 컨텍스트. Max 급으로는 처음 오픈웨이트 계획을 밝혔습니다. 다만 공개된 성적이 대부분 알리바바 자체 발표이고 독립 검증이 없어, 강한 벤더 주장으로 두고 보는 게 안전합니다.

규모 2.4T / 활성 95B주의 제3자 검증 미완료

국내 모델

업스테이지와 독파모 4사

과기정통부 독자 AI 파운데이션 모델(독파모) 사업 2차 평가를 거치며, 국내 4사가 7~8월에 새 모델을 연달아 공개했습니다. 8월 18일 3차 진출사가 확정됐고, 최종 2개 팀은 내년 초에 가려집니다.

업스테이지

2주 간격으로 성격이 다른 두 모델을 냈습니다. 오픈웨이트 Solar Open 2(7/22)와 상용 API Solar Pro 4(8/6)입니다.

42
Solar Pro 4 · AAII
Solar Pro 3(14) 대비 +27
12→57%
Terminal-Bench v2.1
터미널 수행이 가장 크게 개선
31→71%
AA-LCR
장문맥 이해
498→1277
GDPval-AA v2 Elo
인간 기준선 1000을 넘김

Solar Pro 4 — 상용 API

김성훈 대표는 문서 작업·터미널 수행·멀티턴 도구 사용에서 Solar Open 2 대비 20~30% 개선됐다고 밝혔습니다. 벤치마크와 겹쳐 읽으면 방향이 맞습니다 — 오픈웨이트가 약했던 지점을 상용 모델이 보강한 구조입니다. 데스크톱 AI 에이전트 '룸(Loom)'의 기본 모델로도 탑재됐습니다.

항목비고
컨텍스트 / 최대 출력384K / 256K긴 산출물 생성에는 오히려 여유
모달리티텍스트 전용이미지·PDF 직접 입력 불가
요금$0.30 / $1.20 / $0.06입력·출력·캐시히트. Pro 3의 2배
환각률24%Pro 3의 88%에서 대폭 개선
질문 시도율41%Pro 3는 92% · 점수 개선의 상당 부분이 '답변 보류'에서 나옴
작업당 소요시간8.6분Pro 3는 6.0분 · 지능이 오른 만큼 느려짐

Solar Open 2 — 오픈웨이트

250B 중 토큰당 15B 활성, 1M 컨텍스트. 허깅페이스 모델 카드에 Claude Code 연동 방법이 공식으로 적혀 있습니다. vLLM 서버가 Anthropic 호환 /v1/messages 엔드포인트를 제공해 중간 프로그램 없이 바로 붙습니다.

공식 벤치마크 — 비교군은 320B 미만 오픈모델과 경량 상용모델
벤치마크재는 것Solar Open 2비교군 최고
MMLU-Pro전반적 지식·추론86.2 · 1위85.9
LiveCodeBench v6코딩 문제 해결92.4 · 1위92.3
APEX-Agents에이전트 종합16.6 · 1위13.4
CLIcK한국 문화·상식90.7 · 1위89.2
Ko-GDPval한국어 실무 산출물86.8 · 1위85.0
MCP-Atlas도구 호출 정확도58.2 · 공동 2위63.9
SWE-Bench Verified실제 저장소 수정70.4 · 3위73.8
Terminal Bench Hard터미널 작업28.3 · 4위41.7
구동 조건. 모델 카드 기준 최소 H200 4장, 권장 8장입니다. 노타에이아이의 공식 양자화 버전(INT4/NVFP4)을 쓰면 H200 2장까지 내려갑니다. 가중치가 공개됐다는 사실이 개인 장비에서 돌릴 수 있다는 뜻은 아닙니다. 라이선스는 Upstage Solar License로, 파생 모델 이름 앞에 Solar-를 붙이고 공개 자료에 Built with Solar 표기가 필요합니다.

독파모 4사 — 8월 현재

AAII 점수는 8월 13일 공개분 기준. 8월 18일 2차 평가 결과, LG·SKT·업스테이지 3사가 3차에 진출했고 점수 1위였던 모티프는 탈락했습니다. 평가는 벤치마크 40(AAII 25 + NIA 15) · 전문가 35 · 사용자 25로 구성됐습니다.
모델기업규모AAII1차 대비특징
Motif 3모티프테크놀로지스314B47+34미·중 제외 국가 중 세계 최고. 아키텍처 설계부터 독자 기술. 타사의 절반 규모로 효율 입증
Solar Open 2업스테이지250B37+22한국어·지식 항목 강세, 터미널·도구 호출 약세
A.X-K2SK텔레콤688B35VL 라이트, 오디오언어모델 등 파생 모델 동시 공개. 제조·국방·바이오 실증 중심
K-EXAONE 2.0LG AI연구원750B31+9국내 최대. 업사이클링으로 확장, Apache 2.0 전환, 지원 언어 10개

→ 표가 잘리면 좌우로 밀어 보세요

이 숫자를 어떻게 볼 것인가. 국내 모델은 1차 평가 대비 크게 올랐지만(업스테이지 15→37, 모티프 13→47), 프런티어는 60점대입니다. 즉 국내 모델의 자리는 "가장 똑똑한 모델"이 아니라 한국어 비용 효율, 가중치 통제권, 데이터가 밖으로 나가지 않는 구조입니다. 이 세 가지가 필요 없는 작업이라면 굳이 국내 모델을 고를 이유는 아직 없습니다.

선택 가이드

작업 유형별로 뒤집어 보기

대역에서 모델을 찾는 방향을 뒤집어, 하려는 일에서 대역을 찾는 표입니다. 대부분의 경우 모델 하나로 통일하는 것보다 두세 개를 나눠 쓰는 쪽이 싸고 정확합니다.

시뮬레이터·웹앱 만들기
→ Opus 5 · GPT-5.6 Sol

여러 파일을 오가며 고치고 실행해 보는 루프가 핵심이라 코딩·에이전트 대역 그대로입니다. 비용이 부담되면 Sonnet 5로 시작해 막히는 지점만 Opus 5로 올리세요.

긴 문서 요약·질의
→ Gemini 3.7 Flash · Claude 5 계열

수백 쪽 자료를 통째로 넣는 작업. 비용까지 보면 3.7 Flash가 유리하지만, 출력이 64K로 묶여 있으니 긴 산출물은 나눠 받아야 합니다.

대량 반복 처리
→ GPT-5.6 Luna · DeepSeek V4 Flash

분류, 태깅, 짧은 리라이트처럼 실패해도 손해가 적은 일. 여기서 프런티어 모델을 쓰면 그냥 낭비입니다.

과학 개념 검증·문항 검토
→ Gemini 3.1 Pro · Opus 5

오개념이 섞이면 안 되는 작업. 추론 대역 상위 모델을 쓰고, 그래도 최종 확인은 사람이 하세요. 모델 간 교차 검증도 유효합니다.

한국어 문서를 대량으로
→ Solar 계열 검토 대상

토큰 효율 덕에 같은 단가라도 실제 비용이 내려갑니다. 다만 문장 품질 체감평이 엇갈리니 자기 데이터로 먼저 확인하세요.

데이터를 밖에 못 보내는 경우
→ 오픈웨이트 + 자체 구동

DeepSeek V4 Flash(활성 13B)나 GLM-5.2(8×H100급)가 현실적입니다. Kimi K3는 가중치는 열려 있어도 사실상 API 전용입니다.

이미지·PDF를 그대로 넣어야
→ Gemini 3.7 Flash

모달리티부터 확인하세요. Solar Pro 4는 텍스트 전용이고, Grok 4.6은 이미지·PDF까지만 됩니다.

비용을 최대한 눌러야
→ 작업당 비용으로 계산

(모델 비용 + 재시도 + 검토 시간 + 수정 시간) ÷ 승인된 작업 수. 이 식으로 재면 비싼 모델이 이기는 경우가 자주 있습니다.

참고

텍스트 밖의 모달리티

이미지·영상·음성 쪽은 언어모델보다 평가 기준이 훨씬 불안정합니다. 아레나 Elo는 8초짜리 무작위 클립 투표라 제어 가능성이나 도구 생태계를 전혀 반영하지 못합니다. 아래는 방향만 잡는 용도로 봐 주세요.

영상Seedance 2.0 · Veo 3.1 · Kling 3.0

아레나 상위는 중국 모델이 차지했지만, 대사 립싱크가 필요하면 Veo 3.1, 캐릭터·음성 일관성이면 Kling 3.0처럼 용도로 갈립니다.

OpenAI Sora 2는 2026-04 서비스 종료, API도 2026-09-24 종료 예정 — 새 파이프라인 구축 금지
이미지Nano Banana Pro · FLUX · Midjourney

Nano Banana Pro는 텍스트 렌더링이 강해 도표·안내물 계열에 유리합니다. 가중치를 직접 다뤄야 하면 FLUX 쪽입니다.

Gemini API에서 gemini-3.1-flash-image는 영상 입력 → 이미지 생성도 지원
음성ElevenLabs · GPT-Live

TTS 품질은 여전히 ElevenLabs 계열이 기준선. OpenAI는 듣기와 말하기를 동시에 하는 GPT-Live를 GPT-5.6과 함께 냈습니다.

교실 활용은 저작권·초상권 확인이 텍스트보다 훨씬 중요합니다

근거

출처

아래 자료를 2026년 8월 22일에 확인해 작성하고, 8월 23일에 다시 점검했습니다. 벤더 자체 발표와 독립 평가를 구분해 표기했으니, 숫자를 인용하실 땐 원문을 한 번 더 확인해 주세요.