구글 제미나이 4 아르곤 공개 - 출력 100만 토큰과 보안 우선 공개
구글이 차세대 프런티어 모델 제미나이 4 아르곤을 공개했습니다. 출력 토큰 한도를 100만 개로 끌어올리고 업계 최저 할루시네이션을 내세웠지만, 벤치마크 측정 조건과 실제 API 스펙에는 따져볼 지점이 있습니다.
구글은 2026년 9월 30일(미국 현지 시간) 차세대 프런티어 모델 제미나이 4 아르곤(Gemini 4 Argon) 을 공개했습니다.
이번 발표에서 눈에 띄는 지점은 두 가지입니다. 하나는 출력 토큰 한도를 100만 개로 끌어올린 것, 다른 하나는 일반 사용자가 아니라 사이버 방어 전문가에게 먼저 풀었다는 것입니다.
가장 큰 변화: 출력 100만 토큰
지금까지 모델 경쟁의 초점은 주로 입력 컨텍스트 윈도우였습니다. 아르곤이 건드린 쪽은 출력 한도입니다.
| 모델 | 최대 출력 토큰 |
|---|---|
| Gemini 4 Argon | 1,000,000 |
| 이전 제미나이 | 64,000 |
| GPT-6 Astra | 128,000 |
기존 6만 4,000개에서 약 16배로 늘어난 수치이고, GPT-6 Astra의 12만 8,000개와 비교하면 7배 이상입니다. 한 번의 호출로 대규모 코드 마이그레이션 결과물이나 장문 문서를 통째로 뽑아내는 시나리오를 노린 설계입니다.
다만 여기에 확인이 필요한 부분이 있습니다. 공식 발표는 100만 토큰이지만, 실제 API 스펙에는 262,144(약 262K) 로 표기되어 있다는 지적이 나왔습니다. 발표 수치가 아직 전면 적용되지 않은 상태로 보이므로, 긴 출력을 전제로 설계하려면 실제 응답 한도를 먼저 직접 확인해보는 편이 안전합니다.
벤치마크: 구글 발표 기준 19개 중 13개 1위
구글이 공개한 벤치마크 표는 19개 항목 중 13개 1위, 1개 동점, 5개 패배입니다. 주요 항목을 모델별로 정리하면 다음과 같습니다.
| 벤치마크 | 측정 대상 | Argon | GPT-6 Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Vals Index | 지식 업무 종합 | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | 업무 자동화 | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 | 금융 업무 | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey’s Legal Agent | 법률 업무 | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 | 장기 SW 엔지니어링 | 77.9% | 74.1% | 67.4% | 74.2% |
| Vibe Code Bench | 에이전트 코딩 | 91.9% | 89.6% | 90.3% | 90.3% |
| FrontierSWE v2 | 고난도 SW 문제 | 55.0% | 65.5% | 56.3% | 62.3% |
| Terminal-Bench 4.0 | 터미널 작업 | 57.4% | 58.2% | 57.9% | 66.4% |
| GraphWalks (256K~1M) | 긴 문맥 추적 | 84.2% | 71.8% | 65.0% | 66.8% |
| LABBench 2 | 과학·수학 | 88.8% | 85.4% | 68.6% | 73.1% |
| LVBench | 장시간 영상 이해 | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 | 취약점 수정 | 68.0% | 68.0% | 58.0% | 67.0% |
PostTrainBench, RiemannBench, Chartography, Agent’s Last Exam, OSWorld-2.0 등을 포함한 19개 항목 전체는 구글이 공개한 아래 표에서 볼 수 있습니다.

이미지 출처: Google 공식 블로그
경향이 뚜렷합니다. 지식 업무(금융·법률·자동화)와 긴 문맥, 멀티모달에서는 아르곤이 큰 차이로 앞서고, 터미널·고난도 코딩에서는 밀립니다. 특히 법률 에이전트(19.6% vs 3.86.7%)와 긴 문맥 추적(84.2% vs 6572%)의 격차는 단순한 오차 범위가 아닙니다.
구글이 가장 앞세우는 수치는 장기 소프트웨어 엔지니어링을 측정하는 DeepSWE v1.1의 77.9%입니다.

이미지 출처: Google 공식 블로그
반대로 FrontierSWE v2는 Astra가 10.5점 앞서고, Terminal-Bench 4.0은 Claude Opus 5.5가 9점 앞섭니다. “코딩 전반에서 1위”라고 읽으면 안 되고, 긴 작업을 끝까지 끌고 가는 능력(DeepSWE)은 1위지만 어려운 단발 문제와 터미널 조작은 아니다로 읽는 것이 정확합니다.
짚어둘 부분: 측정 조건이 동일하지 않다
이 표를 그대로 받아들이기 전에 알아둘 점이 있습니다. 19개 항목 중 제3자가 모든 모델을 동일 조건에서 측정한 것은 9개뿐이고, 나머지는 구글이 아르곤을 직접 측정하고 경쟁사 점수는 공개 리더보드나 각사 리포트에서 가져온 구조입니다.
구체적으로 지적된 사례들입니다.
- LVBench(영상): 아르곤은 초당 1프레임으로 측정했는데, Astra는 영상당 800프레임, Opus 5.5는 600프레임, Fable 5.1은 300프레임이었습니다. 구글은 API 제한을 이유로 밝혔지만, 이 조건에서 91.7%라는 수치가 무엇을 측정한 것인지는 해석이 갈립니다.
- DeepSWE v1.1: 아르곤만 구글 자체 하네스(harness)로 측정하고, 경쟁 모델은 공개 리더보드나 시스템 카드 수치를 사용했습니다.
- Terminal-Bench Science 0.1: 아르곤은 기본값의 6배 검증 타임아웃을 받았는데도 Astra에 10.7점 밀렸습니다.
- Harvey’s Legal Agent: 공식 발표는 19.6%지만, 외부 리더보드에서는 5위로 집계됩니다.
벤더가 자사 모델에 유리한 조건으로 표를 만드는 것은 이 업계의 일반적인 관행이지만, 아르곤의 경우 1위 항목 수(13개)와 측정 조건의 불균형이 함께 거론된다는 점은 기억해둘 만합니다.
할루시네이션 15%: 업계 최저, 그런데 정확도도 낮다
이번 발표에서 가장 의미 있는 개선은 할루시네이션입니다. Artificial Analysis의 AA-Omniscience 벤치마크 기준입니다.
| 모델 | 할루시네이션 비율 |
|---|---|
| Gemini 4 Argon | 15% |
| GPT-6 Astra | 51% |
| GPT-6.1 Sol | 54% |
차이가 36%p입니다. 아르곤은 모르는 것을 틀린 답으로 메우기보다 모른다고 인정할 가능성이 훨씬 높은 모델이라는 뜻이고, 그동안 제미나이 계열의 약점으로 지적돼온 부분을 정면으로 개선한 결과입니다.
다만 같은 벤치마크에서 정확도는 아르곤 50%, Astra 63% 로, 아르곤이 13점 낮습니다. 즉 “덜 틀리게 말하는” 모델인 동시에 “맞히는 비율 자체도 낮은” 모델입니다. 두 수치를 함께 봐야 합니다.
- 아르곤이 유리한 경우: 틀린 답이 들어가면 손해가 큰 작업(법률·금융 검토, 보안 분석). 모른다고 답하면 사람이 받아 처리하면 됩니다.
- 아르곤이 불리한 경우: 어떻게든 답을 끌어내야 하는 작업. 보수적 성향이 “모르겠다”로 돌아오는 비율을 높입니다.
독립 평가는 조금 더 냉정하다
구글 발표 표에서는 아르곤이 압도적이지만, 외부 평가 기관의 집계는 결이 다릅니다. Artificial Analysis 기준입니다.
- Intelligence Index: 아르곤(high) 53점 — GPT-6 Astra(max), Claude Fable 5.1과 동률이고 GPT-6.1 Sol보다 1점 높습니다. 이전 모델 Gemini 3.1 Pro Preview 대비 23점 상승이라는 점이 중요합니다. 다만 Claude Opus 5.5(58점)에는 밀립니다.
- Text Arena(사람 선호도 평가): 아르곤 1위(1,525점), 2위와 20점 차.
- 토큰 효율: 같은 작업에서 출력 토큰 6만 2,000개 사용. Astra는 2만 7,000개로, 아르곤이 2배 이상 씁니다.
- 웹 개발 작업: 8위 수준.
정리하면 “선두를 빼앗은 것이 아니라 격차를 좁힌 것” 에 가깝습니다. 직전 모델에서 23점을 끌어올려 최상위권에 복귀했지만, 종합 지능 지표에서 단독 1위는 아닙니다.
가격: 도입가 기준으로는 가장 싸다
| 항목 | 도입가 | 정가(도입 기간 후) |
|---|---|---|
| 입력 (100만 토큰) | $2 | $4 |
| 출력 (100만 토큰) | $10 | $20 |
| 캐시된 입력 | 95% 할인 | — |
도입가 기준으로 GPT-6 Astra($10/$50)보다 약 60% 저렴합니다. 작업당 실제 비용으로 비교하면 다음과 같습니다.
| 모델 | 작업당 비용 |
|---|---|
| Gemini 4 Argon | $1.99 (도입가) |
| GPT-6 Astra | $3.26 |
| Claude Opus 5.5 | $5.98 |
단 이 우위는 도입 기간 한정입니다. 정가($4/$20)가 적용되면 작업당 약 $4 수준으로 올라 Astra와 비슷해집니다. 아르곤의 토큰 소비량이 Astra의 2배 이상이라는 점도 함께 계산해야 합니다. 지금 싼 것이 계속 싸지는 않습니다.
참고로 에이전트형 작업에서는 비용이 크게 뛸 수 있습니다. CUA-bench 기준 테스트당 $193.78 이 측정된 사례가 보고되었습니다.
페어윈드 프로그램: 왜 보안 전문가가 먼저인가
아르곤은 전체 공개가 아니라 페어윈드(Fairwind) 프로그램을 통한 단계적 공개로 시작했습니다.
- 참여 규모: 650곳 이상의 파트너 (정부 기관, 국가 사이버 기관)
- 대상: 의료·통신·에너지·금융 등 기반시설 운영자
- 조건: 악성코드 방어 목적으로만 접근 허용, 제작은 금지, MFA 인증 필수
공개 순서는 ① 신뢰할 수 있는 사이버 방어 전문가·정부 → ② 유료 API 고객 및 구글 AI 울트라 구독자 → ③ 개발자 → ④ 기업 → ⑤ 소비자 입니다. 일반 공개 시점은 “가능한 한 빠르게”라고만 밝혀 아직 미정입니다.
이 방식은 GPT-6 Astra가 사이버보안 능력 때문에 신청 기반으로 기능을 제한했던 것과 같은 흐름입니다. 모델의 보안 능력이 임계점을 넘으면 공개 방식 자체가 제품 설계의 일부가 된다는 점이 업계 표준으로 굳어지는 모습입니다.
보안 벤치마크: CWE-bench v1
취약점을 찾아 수정하는 능력을 측정하는 CWE-bench v1에서 아르곤은 68%를 기록했습니다. 앞의 4개 모델 비교표에서는 Astra와 동점이지만, 전체 리더보드로 넓혀 보면 Grok 4.7과 GPT-6 Astra까지 포함한 3개 모델 공동 1위입니다.

이미지 출처: Google 공식 블로그
적용된 안전장치
- 프롬프트 인젝션 방어 — Gray Swan IPI 기준 공격 성공률 0.7%
- 모델 활성화 상태 모니터링
- 적대적 훈련 및 자동 레드팀 테스트
- 에이전트 실행 환경 샌드박스 격리
프롬프트 인젝션 방어는 이번 발표에서 수치 차이가 가장 큰 항목입니다. 15회 시도 기준 공격 성공률이 아르곤 0.7%인 데 비해, Claude Opus 5.5와 Fable 5.1이 1.0%, GPT-6 Astra가 8.5%, Grok 4.6은 51.8%입니다.

이미지 출처: Google 공식 블로그
에이전트가 외부 문서나 웹페이지를 읽는 구조라면 이 수치가 실무에서 체감되는 차이로 이어집니다.
구글 내부 활용 사례
구글이 공개한 자체 적용 결과가 발표에서 가장 설득력 있는 부분입니다.
- 코드 마이그레이션: C/C++ 코드를 러스트로 전환, 최대 80만 줄 규모
- 양자 알고리즘 최적화: 기존 기준 대비 40% 개선
- 데이터센터 메모리 절감: 300TiB 이상 확보
- libgav1 영상 디코더: 기존 대비 2.7배 빠른 결과물
- 보안 취약점 발견: 전 세계 병원 의료 소프트웨어에서 민감 정보 노출 결함 탐지 (기존 프런티어 모델들이 찾지 못했던 사례)
80만 줄 규모 마이그레이션은 출력 100만 토큰이라는 스펙이 왜 필요했는지를 보여주는 사례입니다. 벤치마크 점수보다 이런 결과물이 모델의 실제 용도를 더 잘 설명합니다.
개발자에게 의미하는 바
1. “출력이 짧아서 못 하던 작업”이 열린다
그동안 대규모 리팩터링이나 마이그레이션은 출력 한도 때문에 작업을 쪼개고 이어 붙이는 과정이 필수였습니다. 출력 한도가 늘어나면 쪼개는 과정에서 생기는 맥락 손실을 줄일 수 있습니다. 다만 앞서 언급한 262K 표기 이슈가 있으니, 실제 한도를 먼저 측정해보고 설계하는 것이 좋습니다.
2. 모델 선택 기준이 “성능”에서 “성향”으로 옮겨간다
아르곤(할루시네이션 15%, 정확도 50%)과 Astra(51%, 63%)는 어느 쪽이 더 좋은 모델이냐로 정리되지 않습니다. 틀린 답의 비용이 큰 파이프라인이면 아르곤, 답을 받아내는 것이 우선이면 Astra가 맞습니다. Jev 포스팅에서 정리한 신뢰도 기반 라우팅처럼, 모델의 성향에 맞춰 경로를 나누는 설계가 점점 중요해지고 있습니다.
3. 벤더 벤치마크는 측정 조건부터 본다
아르곤의 19개 중 13개 1위라는 수치는 사실이지만, 그중 절반 이상이 동일 조건 측정이 아닙니다. 영상 벤치마크에서 1fps와 800프레임을 나란히 비교한 표를 보고 나면, “몇 위”보다 “어떻게 측정했는지”를 먼저 확인하는 습관이 필요하다는 생각이 듭니다.
결론
제미나이 4 아르곤은 구글이 최상위권으로 복귀했음을 보여주는 모델입니다. 직전 모델 대비 지능 지표 23점 상승, 지식 업무와 긴 문맥에서의 뚜렷한 우위, 업계 최저 할루시네이션까지 분명한 성과가 있습니다.
동시에 단독 선두는 아닙니다. 고난도 코딩과 터미널 작업에서는 경쟁 모델에 밀리고, 종합 지능 지표는 Astra와 동률이며, 가격 우위는 도입 기간 한정입니다. 발표 수치인 100만 토큰 출력도 현재 API 스펙과 차이가 있습니다. “반격 성공”보다는 “격차 해소”가 더 맞는 평가입니다.
핵심 정리
- 출력 한도: 6만 4,000 → 100만 토큰(약 16배) — 단 실제 API는 262K 표기 논란
- 벤치마크: 구글 발표 19개 중 13개 1위, 지식 업무·긴 문맥·영상 강세, 고난도 코딩·터미널 약세
- 측정 조건: 19개 중 9개만 제3자 동일 조건, LVBench는 1fps vs 경쟁사 300~800프레임
- 할루시네이션: 15%로 업계 최저(Astra 51%)지만 정확도도 50%로 13점 낮은 보수적 성향
- 독립 평가: Intelligence Index 53점으로 Astra·Fable 5.1과 동률, Opus 5.5(58점)에는 밀림
- 가격: 도입가 $2/$10로 Astra보다 60% 저렴, 정가 전환 시 $4/$20
- 공개 방식: 페어윈드 프로그램(650+ 파트너)으로 사이버 방어 전문가 우선, 일반 공개 미정