Claude Opus 5
$5 / $25
모호한 요구에서 스스로 빈칸을 메우고, 결과를 검증한 뒤 될 때까지 고칩니다. Fable 5에 근접한 성능을 절반 가격에 낸다는 게 이 모델의 자리입니다. 오작동 행동 점수가 최근 Claude 중 가장 낮고, 안전 분류기 발동도 Fable 5의 약 15% 수준이라 정상 업무에서 막히는 일이 적습니다.
도키피디아 v1.1
비용 대비 지능 차트는 모든 모델을 한 줄로 세운다. 유용하지만, 실제로 일을 맡길 때 필요한 정보는 거기 없다. 같은 62점이라도 어떤 모델은 터미널에서 강하고, 어떤 모델은 한국어 문서에서 강하다. 이 백과는 그 하나의 점수를 여섯 개 대역으로 분광한다.
사용 설명
숫자를 그대로 믿기보다, 숫자가 어떻게 만들어졌는지를 먼저 보는 게 이 분야에서는 훨씬 안전합니다. 아래 다섯 가지는 이 문서 전체에 걸쳐 적용되는 전제입니다.
7월 31일 이후 3주 동안 Grok 4.6, GLM-5.3, Gemini 3.7 Flash, Solar Pro 4가 새로 나왔습니다. 요즘 프런티어 모델 교체 주기는 3~5주입니다. 이 문서도 한 달 뒤엔 절반쯤 어긋납니다.
Artificial Analysis 지능 지수는 GDPval-AA, τ³-Banking, Terminal-Bench, SciCode, HLE, GPQA Diamond 등 9개 평가를 평균낸 값입니다. 평균은 강세와 약세를 동시에 지웁니다.
같은 모델도 low·medium·high·xhigh·max 설정에 따라 몇 점씩 움직입니다. "Opus 5 = 63점"은 max 설정 기준이고, 비용과 응답 시간은 그만큼 올라갑니다.
업스테이지 Solar Open 2의 공식 차트는 범례에 open models (Under 320B)와 fast-tier closed models로 조건을 밝혀 뒀습니다. 즉 최상위 상용 모델은 비교군에 없습니다. "1위"는 언제나 "무엇들 사이에서 1위"인지 확인해야 합니다.
모델 카드 아래 여섯 칸 막대는 공표된 합성 지표가 아니라, 아래 인용한 벤치마크·가격·스펙을 근거로 제가 5단계로 정리한 정성 평가입니다. 근거는 각 카드와 대역 항목에 함께 적어 뒀으니, 판단이 다르면 근거 쪽을 보고 다시 매겨 주세요.
기준선 갱신
먼저 첨부하신 7월 31일 차트를 현재 시점으로 갱신한 표입니다. 여기까지가 "하나의 축"이고, 다음 절부터가 이 문서의 본론입니다.
| 모델 | AAII | 입력 / 출력 | 맥락 |
|---|---|---|---|
| Claude Opus 5 Anthropic · 07-24 | 63 | $5 / $25 | 현재 지수 1위. Fable 5의 절반 가격 |
| Claude Fable 5 Anthropic · 06-09 | 62 | $10 / $50 | 최상위 플래그십. 30일 데이터 보존 조건 |
| GPT-5.6 Sol OpenAI · 07-09 | 61 | $4 / $20 | Coding Agent Index 1위(80). 8/21 인하 — 11/21까지 프로모션가(표준 $5 / $30) |
| Grok 4.6 SpaceXAI · 08-12 | 61 | $2 / $6 | 같은 점수를 60% 싸게. 작업당 $0.84 |
| GLM-5.3 Z.ai · 08-14 오픈 예정 | 60 | $1.40 / $4.40 | 프런티어 중 작업당 비용 최저($0.68) |
| Kimi K3 Moonshot · 07-16 오픈웨이트 | 57 | $3 / $15 | 오픈웨이트 최고 점수. 2.8T MoE |
| Gemini 3.7 Flash Google · 08-13 | 56 | $0.75 / $3.75 | 출력 속도 1위(340 t/s). 12/31까지 프로모션가 |
| DeepSeek V4 Flash 0731 DeepSeek MIT | 52 | $0.14 / $0.28 | 가격 대비 지능의 기준점 |
| Gemini 3.6 Flash Google · 07-21 | 52 | $0.75 / $3.75 | 3.7과 동일 요금으로 조정됨 |
| GLM-5.2 Z.ai MIT | 51 | $1.10 / $4.10 | 8×H100급이면 자체 구동 가능 |
| GPT-5.6 Luna OpenAI | 50 | $0.20 / $1.20 | 7/30에 80% 인하. 대량 처리용 |
| Motif 3 모티프테크놀로지스 국내 오픈웨이트 | 47 | — | 미·중 제외 국가 중 최고. 314B |
| MiniMax-M3 MiniMax | 45 | $0.30 / $1.20 | Solar Pro 4와 동일 가격대 |
| Solar Pro 4 업스테이지 · 08-06 국내 | 42 | $0.30 / $1.20 | Solar Pro 3(14) 대비 +27점 |
| Solar Open 2 업스테이지 · 07-22 국내 오픈웨이트 | 37 | — | 250B / 활성 15B, 1M 컨텍스트 |
| A.X-K2 SK텔레콤 국내 오픈웨이트 | 35 | — | 688B |
| K-EXAONE 2.0 LG AI연구원 국내 Apache 2.0 | 31 | — | 국내 최대 750B, 10개 언어 |
→ 표가 잘리면 좌우로 밀어 보세요
대역 안내
아래 여섯 대역은 실제 벤치마크가 나뉘는 방식과 사람들이 모델에 실제로 맡기는 일을 겹쳐서 나눈 것입니다. 색은 파장 순서를 따르며, 문서 전체에서 같은 의미로 씁니다.
코드를 고치고, 터미널을 돌리고, 도구를 여러 번 호출하며 끝까지 일을 마치는 능력. 시뮬레이터·웹앱을 만드는 바이브코딩이 정확히 이 대역에 걸립니다. 여기서 갈리는 건 첫 답의 품질이 아니라 스스로 결과를 검증하고 다시 고치는가입니다.
계획 → 실행 → 검증 → 수정의 긴 흐름을 사람이 중간에 붙잡아 주지 않아도 유지합니다. 여러 파일에 걸친 리팩터링과 버그 추적이 특히 강합니다.
코딩 에이전트 지수에서는 오히려 1위. ultra 모드는 서브에이전트를 병렬로 굴립니다. 사이버보안·과학 코드 쪽 강세가 뚜렷합니다.
정확도보다 턴 효율이 무기입니다. 같은 장기 과제를 Opus 5의 절반 턴으로 끝냅니다. 대량으로 굴릴 때 총비용이 크게 벌어집니다.
K3는 프런트엔드 코드 아레나 1위로 Fable 5보다 앞섰습니다. V4 Pro는 다운로드 가능한 가중치 중 SWE-bench 최고.
답을 아는 것과 답을 유도해 내는 것은 다릅니다. 대학원 수준 과학 문제, 처음 보는 규칙의 퍼즐, 여러 단계의 논증이 필요한 문제가 이 대역입니다. 과학 교과 자료를 만들 때 오개념이 섞이는지가 여기서 갈립니다.
순수 추론 벤치마크의 선두. 큰 컨텍스트와 결합해 긴 자료를 통째로 넣고 따져 묻는 작업에 가장 잘 맞습니다.
규칙을 처음부터 추론해야 하는 과제에서 격차가 큽니다. 문제 정의 자체가 모호할 때 강합니다.
지식 업무와 법률 추론 계열에서 상대적으로 강합니다. 다만 터미널 작업은 약한 편이라 용도를 나눠 쓰는 게 낫습니다.
2026년 7월 20일, 수학자 Levent Alpöge가 Fable 5를 이용해 야코비 추측의 복소 3변수 다항식 반례를 찾아냈습니다. 반례는 검증이 쉬워 빠르게 인정받았습니다.
수백 쪽짜리 매뉴얼, 긴 회의록, 대형 코드베이스를 한 번에 넣고 다루는 능력. 중요한 건 "몇 토큰까지 들어가는가"가 아니라 그 안에서 필요한 걸 정확히 찾아내는가입니다. 광고된 컨텍스트 크기와 실제 정확도는 별개입니다.
둘 다 1M 컨텍스트가 기본값이고 최대 출력 128K. Opus 5는 1M이 기본이자 최대로, 작은 변형이 따로 없습니다.
1M 입력에 요금이 프런티어의 몇 분의 일. 다만 출력은 64K로 묶여 있어 긴 산출물에는 나눠 쓰는 설계가 필요합니다.
500K 컨텍스트지만 200K를 넘는 순간 요청 전체가 2배 요금으로 재계산됩니다. 긴 문서 작업에서는 이 절벽을 먼저 계산해야 합니다.
이번 세대에서 가장 크게 오른 영역이 바로 장문맥입니다. 384K 컨텍스트에 최대 출력 256K로, 긴 산출물 쪽은 오히려 여유가 있습니다.
학생 활동지 사진, 실험 영상, 스캔한 유인물처럼 텍스트가 아닌 자료를 그대로 넣을 수 있는가. 의외로 여기서 모델이 가장 뚜렷하게 갈립니다 — 아예 안 되는 모델이 많습니다.
텍스트·이미지·영상·오디오·PDF를 모두 입력으로 받습니다. 유튜브 URL을 그대로 넘겨 썸네일이나 요약 인포그래픽을 만드는 경로도 열려 있습니다.
네이티브 비전을 갖춘 오픈웨이트 모델. 다만 가중치가 1.5TB대라 "공개"와 "직접 돌릴 수 있음"은 별개입니다.
비전과 영상에 더해 화면을 보고 조작하는 GUI 에이전트 쪽을 내세웁니다. 다만 벤치마크가 대부분 자체 발표라 독립 검증은 아직입니다.
Solar Pro 4는 텍스트 입출력만 지원합니다. Grok 4.6은 텍스트·이미지·PDF까지. 자료 형태부터 확인하고 모델을 고르세요.
토큰 단가는 함정이 있습니다. 진짜 지표는 승인 가능한 결과 한 건당 총비용이고, 여기엔 재시도와 사람이 손보는 시간이 포함됩니다. 싼 모델이 세 번 실패하면 비싼 모델보다 비쌉니다.
186개 모델 중 출력 속도 1위. 응답을 기다리는 게 병목인 대화형·실시간 용도에서 체감 차이가 큽니다.
50점대 지능을 프런티어 대비 수십 분의 일 가격에. 분류·요약·태깅처럼 대량 반복 작업의 기준점입니다.
7월 30일 80% 인하로 위치가 완전히 바뀌었습니다. 다만 아주 긴 문맥에서의 정확도는 상위 티어에 못 미치니 긴 문서엔 쓰지 마세요.
단가가 아니라 한 과제를 끝내는 데 드는 실제 비용 기준의 선두. 프런티어 급 지능을 유지하면서 이 값이 가장 낮습니다.
한국어를 이해하는가와 한국어로 쓸 만한 문장을 만드는가는 다른 문제입니다. 여기에 한국 문화·제도 맥락과 토큰 효율까지 더하면, 국내 모델이 유일하게 우위를 갖는 대역이 나옵니다.
창작·문체 쪽 추천이 가장 많이 몰리는 모델. Sol이 바로 뒤를 따릅니다. 다만 한국어 이해도는 높은데 번역체가 섞이는 경향이 지적됩니다.
한국 문화·상식(CLIcK)과 한국어 실무 산출물(Ko-GDPval) 항목에서 비교군 내 1위. 표·보고서를 함께 만들어 내는 형태의 작업이 이 지표가 재는 것입니다.
같은 한국어 문장을 더 적은 토큰으로 처리합니다. 한국어 문서를 대량으로 다룬다면 단가가 같아도 실제 비용이 내려갑니다. 영어에서는 차이가 거의 없습니다.
Solar 계열은 벤치마크 점수 대비 실사용 문장 품질에 대한 지적이 커뮤니티에서 반복해 나옵니다. 도입 전 자기 업무 데이터로 직접 확인하는 절차를 꼭 넣으세요.
모델 카드
카드 하단의 여섯 칸 막대가 그 모델의 강세 분포입니다. 높이는 5단계이고, 색은 위 대역과 같습니다. 절대 성능이 아니라 그 모델 안에서 무엇이 상대적으로 강한가를 봅니다.
모호한 요구에서 스스로 빈칸을 메우고, 결과를 검증한 뒤 될 때까지 고칩니다. Fable 5에 근접한 성능을 절반 가격에 낸다는 게 이 모델의 자리입니다. 오작동 행동 점수가 최근 Claude 중 가장 낮고, 안전 분류기 발동도 Fable 5의 약 15% 수준이라 정상 업무에서 막히는 일이 적습니다.
여전히 라인업 최상단입니다. 글쓰기와 난제형 탐색에서 평이 가장 좋지만, 가격이 Opus 5의 2배고 30일 데이터 보존 정책이 붙습니다. 6월 12일 미 상무부 수출통제로 전 세계 접근이 중단됐다가 7월 1일 복구된 이력이 있어, 업무 파이프라인의 단일 의존 대상으로 삼기엔 위험이 있습니다.
범위가 분명하고 자주 돌려야 하는 일의 기본값. 항목에 따라 Opus 5를 앞서기도 합니다. 다만 새 토크나이저 때문에 같은 글이 1.0~1.35배 토큰으로 계산돼, 표시 단가만으로 비교하면 실제보다 싸 보입니다.
컨텍스트가 200K로 다른 라인업보다 작지만 짧은 입력 작업엔 충분합니다. 5세대 모델의 보조 역할로, 분류·라우팅·간단한 변환처럼 판단이 거의 필요 없는 자리에 붙입니다.
가장 균형 잡힌 만능형입니다. 글쓰기·분석·멀티모달 어디든 무난하고 생태계가 두껍습니다. Sol Pro와 Sol Ultra는 별도 모델이 아니라 같은 모델의 고연산 모드로, ultra는 서브에이전트를 병렬로 돌립니다. 다만 max 설정에서는 첫 토큰까지 200초 이상 걸리기도 합니다.
gpt-5.6은 Sol로 라우팅됨벤치 Coding Agent Index 80(1위)출시 2026-07-09요금 8/21부터 $4 / $20 (프로모, 최소 11/21까지)이전 세대 GPT-5.5급 품질을 절반 이하 가격에 냅니다. 7월 30일 20% 인하로 위치가 한 번 더 좋아졌습니다. 고민되면 여기서 시작해 필요할 때만 Sol로 올리는 구성이 가장 무난합니다.
7월 30일 80% 인하로 Sol과 25배 격차가 벌어졌습니다. 분류, 요약, 제목 후보 대량 생성, 짧은 리라이트처럼 실패해도 손해가 적은 일에 붙입니다. 아주 긴 문맥에서는 정확도가 떨어지니 긴 문서 작업엔 쓰지 마세요.
순수 추론 벤치마크의 선두이고 1M 컨텍스트와 멀티모달 입력을 갖췄습니다. 다만 아직 Preview 상태이고, 코딩·실행 계열 벤치마크에서는 오히려 Flash 계열에 밀립니다. Gemini 3.5 Pro는 8월 22일 현재 미출시입니다.
두 달도 안 되는 사이 세 번째 Flash입니다. 코딩 벤치마크가 크게 올랐고(DeepSWE 49.0→65.3, AutomationBench 17.0→30.4) 출력 속도는 전체 1위. Antigravity와 Gemini Spark의 기본 모델 자리도 이어받는 흐름입니다.
3.7에서 MINIMAL 사고 수준이 사라지면서, 지연에 극도로 민감한 용도는 이쪽으로 내려와야 합니다. 판단이 거의 필요 없는 반복 처리 전용입니다.
Grok 4.5와 같은 1.5T 기반에 사후학습만 다시 돌린 모델입니다. 강점은 점수가 아니라 효율 — 같은 장기 과제를 Opus 5의 절반 턴, 4분의 1 입력 토큰으로 끝냅니다. 반면 첫 토큰까지 40~52초로 느리고, 터미널 작업은 약합니다. 4.7(2.1T)이 곧 나온다는 예고가 있어 교체 주기가 짧을 수 있습니다.
2.8조 파라미터, 오픈웨이트 사상 최고 점수. 프런트엔드 코드 아레나에서는 Fable 5까지 제쳤습니다. 다만 가중치가 1.5TB대이고 가속기 64장 이상을 권장해, 실질적으로는 호스팅 API로 쓰는 모델입니다. 라이선스는 수정 MIT(월 활성 1억 명 초과 시 표기 의무).
Pro(1.6T/49B)와 Flash(284B/13B) 두 갈래, 둘 다 1M 컨텍스트에 MIT 라이선스. Flash 0731 체크포인트는 사후학습을 전면 재실행해 에이전트 성능이 크게 올랐습니다. 다만 8월 들어 API 가격을 최대 11배 인상하고 피크 할증을 도입해, 가격 안정성은 주의가 필요합니다.
5.2는 MIT로 가중치가 공개돼 있고 8×H100급이면 자체 구동이 가능합니다. 8월 14일 나온 5.3은 60점으로 프런티어 근처에 진입했고 작업당 비용은 전체 최저($0.68)지만, 아직 벤더 자체 지표 중심이고 가중치는 공개 예정 상태입니다.
2.4조 파라미터에 1M 컨텍스트. Max 급으로는 처음 오픈웨이트 계획을 밝혔습니다. 다만 공개된 성적이 대부분 알리바바 자체 발표이고 독립 검증이 없어, 강한 벤더 주장으로 두고 보는 게 안전합니다.
국내 모델
과기정통부 독자 AI 파운데이션 모델(독파모) 사업 2차 평가를 거치며, 국내 4사가 7~8월에 새 모델을 연달아 공개했습니다. 8월 18일 3차 진출사가 확정됐고, 최종 2개 팀은 내년 초에 가려집니다.
2주 간격으로 성격이 다른 두 모델을 냈습니다. 오픈웨이트 Solar Open 2(7/22)와 상용 API Solar Pro 4(8/6)입니다.
김성훈 대표는 문서 작업·터미널 수행·멀티턴 도구 사용에서 Solar Open 2 대비 20~30% 개선됐다고 밝혔습니다. 벤치마크와 겹쳐 읽으면 방향이 맞습니다 — 오픈웨이트가 약했던 지점을 상용 모델이 보강한 구조입니다. 데스크톱 AI 에이전트 '룸(Loom)'의 기본 모델로도 탑재됐습니다.
| 항목 | 값 | 비고 |
|---|---|---|
| 컨텍스트 / 최대 출력 | 384K / 256K | 긴 산출물 생성에는 오히려 여유 |
| 모달리티 | 텍스트 전용 | 이미지·PDF 직접 입력 불가 |
| 요금 | $0.30 / $1.20 / $0.06 | 입력·출력·캐시히트. Pro 3의 2배 |
| 환각률 | 24% | Pro 3의 88%에서 대폭 개선 |
| 질문 시도율 | 41% | Pro 3는 92% · 점수 개선의 상당 부분이 '답변 보류'에서 나옴 |
| 작업당 소요시간 | 8.6분 | Pro 3는 6.0분 · 지능이 오른 만큼 느려짐 |
250B 중 토큰당 15B 활성, 1M 컨텍스트. 허깅페이스 모델 카드에 Claude Code 연동 방법이 공식으로 적혀 있습니다.
vLLM 서버가 Anthropic 호환 /v1/messages 엔드포인트를 제공해 중간 프로그램 없이 바로 붙습니다.
| 벤치마크 | 재는 것 | Solar Open 2 | 비교군 최고 |
|---|---|---|---|
| MMLU-Pro | 전반적 지식·추론 | 86.2 · 1위 | 85.9 |
| LiveCodeBench v6 | 코딩 문제 해결 | 92.4 · 1위 | 92.3 |
| APEX-Agents | 에이전트 종합 | 16.6 · 1위 | 13.4 |
| CLIcK | 한국 문화·상식 | 90.7 · 1위 | 89.2 |
| Ko-GDPval | 한국어 실무 산출물 | 86.8 · 1위 | 85.0 |
| MCP-Atlas | 도구 호출 정확도 | 58.2 · 공동 2위 | 63.9 |
| SWE-Bench Verified | 실제 저장소 수정 | 70.4 · 3위 | 73.8 |
| Terminal Bench Hard | 터미널 작업 | 28.3 · 4위 | 41.7 |
Solar-를 붙이고
공개 자료에 Built with Solar 표기가 필요합니다.
| 모델 | 기업 | 규모 | AAII | 1차 대비 | 특징 |
|---|---|---|---|---|---|
| Motif 3 | 모티프테크놀로지스 | 314B | 47 | +34 | 미·중 제외 국가 중 세계 최고. 아키텍처 설계부터 독자 기술. 타사의 절반 규모로 효율 입증 |
| Solar Open 2 | 업스테이지 | 250B | 37 | +22 | 한국어·지식 항목 강세, 터미널·도구 호출 약세 |
| A.X-K2 | SK텔레콤 | 688B | 35 | — | VL 라이트, 오디오언어모델 등 파생 모델 동시 공개. 제조·국방·바이오 실증 중심 |
| K-EXAONE 2.0 | LG AI연구원 | 750B | 31 | +9 | 국내 최대. 업사이클링으로 확장, Apache 2.0 전환, 지원 언어 10개 |
→ 표가 잘리면 좌우로 밀어 보세요
선택 가이드
대역에서 모델을 찾는 방향을 뒤집어, 하려는 일에서 대역을 찾는 표입니다. 대부분의 경우 모델 하나로 통일하는 것보다 두세 개를 나눠 쓰는 쪽이 싸고 정확합니다.
여러 파일을 오가며 고치고 실행해 보는 루프가 핵심이라 코딩·에이전트 대역 그대로입니다. 비용이 부담되면 Sonnet 5로 시작해 막히는 지점만 Opus 5로 올리세요.
수백 쪽 자료를 통째로 넣는 작업. 비용까지 보면 3.7 Flash가 유리하지만, 출력이 64K로 묶여 있으니 긴 산출물은 나눠 받아야 합니다.
분류, 태깅, 짧은 리라이트처럼 실패해도 손해가 적은 일. 여기서 프런티어 모델을 쓰면 그냥 낭비입니다.
오개념이 섞이면 안 되는 작업. 추론 대역 상위 모델을 쓰고, 그래도 최종 확인은 사람이 하세요. 모델 간 교차 검증도 유효합니다.
토큰 효율 덕에 같은 단가라도 실제 비용이 내려갑니다. 다만 문장 품질 체감평이 엇갈리니 자기 데이터로 먼저 확인하세요.
DeepSeek V4 Flash(활성 13B)나 GLM-5.2(8×H100급)가 현실적입니다. Kimi K3는 가중치는 열려 있어도 사실상 API 전용입니다.
모달리티부터 확인하세요. Solar Pro 4는 텍스트 전용이고, Grok 4.6은 이미지·PDF까지만 됩니다.
(모델 비용 + 재시도 + 검토 시간 + 수정 시간) ÷ 승인된 작업 수. 이 식으로 재면 비싼 모델이 이기는 경우가 자주 있습니다.
참고
이미지·영상·음성 쪽은 언어모델보다 평가 기준이 훨씬 불안정합니다. 아레나 Elo는 8초짜리 무작위 클립 투표라 제어 가능성이나 도구 생태계를 전혀 반영하지 못합니다. 아래는 방향만 잡는 용도로 봐 주세요.
아레나 상위는 중국 모델이 차지했지만, 대사 립싱크가 필요하면 Veo 3.1, 캐릭터·음성 일관성이면 Kling 3.0처럼 용도로 갈립니다.
Nano Banana Pro는 텍스트 렌더링이 강해 도표·안내물 계열에 유리합니다. 가중치를 직접 다뤄야 하면 FLUX 쪽입니다.
gemini-3.1-flash-image는 영상 입력 → 이미지 생성도 지원TTS 품질은 여전히 ElevenLabs 계열이 기준선. OpenAI는 듣기와 말하기를 동시에 하는 GPT-Live를 GPT-5.6과 함께 냈습니다.
근거
아래 자료를 2026년 8월 22일에 확인해 작성하고, 8월 23일에 다시 점검했습니다. 벤더 자체 발표와 독립 평가를 구분해 표기했으니, 숫자를 인용하실 땐 원문을 한 번 더 확인해 주세요.