Google은 Gemini 4 Argon 9월 30일 발표와 함께 지식 업무와 코딩에서 높은 점수, 최대 100만 출력 토큰이라는 주장, 향후 API 출시 가격을 공개했다. 신뢰하는 사이버 보안 방어 담당자와 테스터에게 먼저 모델을 제공하고 있다. 개발자용 공개 모델 ID와 유료 API 고객 또는 Google AI Ultra 구독자가 사용할 수 있는 날짜는 아직 제시하지 않았다. Google의 발표 와 Gemini API 모델 카탈로그 를 보면 출시 발표와 대다수 독자의 실제 액세스 사이에 간극이 있음을 알 수 있다.
달라진 점
- 무엇이 달라졌나: Google은 새 최첨단 모델을 일부 사이버 보안 방어 담당자에게 제공했지만 대부분의 개발자와 구독자는 여전히 이용할 수 없다. 주요 성능과 가격 주장은 공개됐지만, 공개 API는 아직 출시되지 않았다.
- 왜 중요한가: Vals AI의 독립 평가에서 아르곤은 폭넓은 지식 업무와 금융 에이전트 테스트에서 1위를 차지했다. 모델을 비교하는 팀에는 진지하게 검토할 새 후보가 생긴 셈이다. 과제별 성능이 엇갈리고 배포 범위가 제한돼 각 팀의 실제 업무 흐름에서 성능과 비용이 어떨지는 아직 알 수 없다.
- 앞으로 볼 점: Google은 유료 API 고객과 AI Ultra 구독자를 다음 대상으로 지목했지만 날짜는 밝히지 않았다. 문서화된 모델 ID와 서비스 한도가 공개되면 개발자는 중요한 업무를 직접 시험하고, 주장된 100만 출력 토큰을 실제로 쓸 수 있는지도 확인할 수 있다.
현재 Gemini 4를 사용할 수 있는 사람
Google에 따르면 첫 사용자는 자사의 Fairwind 프로그램에 참여하는 신뢰할 수 있는 사이버 보안 방어 담당자와 테스터다. Fairwind는 일부 Google Cloud 고객, 정부 기관, 보안 파트너에게 제한된 액세스를 제공하는 프로그램이다. Google은 신뢰받는 방어 담당자가 아르곤의 방어 기능을 활용하도록 통상적인 사이버 안전장치를 적용하지 않고 제공한다고 설명한다. 이번 초기 출시는 특히 민감한 사용 사례를 통제된 환경에서 시험하는 것이다.
Google은 유료 API 고객과 Google AI Ultra 구독자를 시작으로 개발자, 기업, 일반 소비자에게 액세스를 확대할 계획이다. 시점은 발표하지 않았다. 10월 1일 확인 당시 Google의 Gemini API 모델 디렉터리 에는 Gemini 3 모델만 있었고 Gemini 4 아르곤 ID는 없었다. API 가격 페이지 에도 아르곤 항목이 없었다. 따라서 API 호출 안내를 만들려면 Google이 문서화하지 않은 모델 이름과 액세스 경로를 지어내야 한다.
그럼에도 Google은 출시 게시물에서 향후 토큰 가격을 밝혔다. 초기 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러이며 캐시된 입력은 입력 요금보다 95% 저렴하다. 초기 기간이 끝나면 요금은 4달러와 20달러로 오른다고 Google은 밝혔다. 초기 기간의 종료 시점은 공개하지 않았다. 이는 발표된 요금이지 현재 셀프서비스 API로 이용할 수 있는 가격은 아니다. 토큰당 가격만으로는 긴 에이전트 작업에 필요한 추론, 도구 사용, 출력량을 알기 전까지 실제 비용을 가늠하기 어렵다.
높은 점수와 뚜렷한 약점
Vals AI의 독립 아르곤 평가 에서 아르곤은 Vals Index 68.90% ± 0.97 를 기록해 표에 포함된 41개 모델 중 1위였다. Finance Agent v2에서는 73개 모델 중 1위로 65.40% ± 0.32를 받았다. Vibe Code Bench에서는 106개 중 2위, 91.91% ± 1.90를 기록했다. Code Migration에서는 71개 중 2위로 68.17% ± 4.35, CyberBench v1.1에서는 43개 중 2위로 77.86% ± 5.30였다. 여러 과제에서 초반 성과가 좋다는 점은 보여주지만, 모든 과제에서 아르곤이 최고라는 뜻은 아니다.
같은 평가에서 아르곤은 Terminal-Bench 4.0의 42개 모델 중 5위로 57.58% ± 2.31를 받았고, MedScribe에서는 106개 중 15위였다. 컴퓨터 사용 CUA-bench에서는 8개 중 7위로 4.83%를 기록했다. 테스트별 측정 비용 차이도 크다. Vals Index 테스트는 $15.68 , CUA-bench는 $193.78 였다. 이는 평가 작업에 든 비용이며, Google이 발표한 토큰 100만 개당 요금과는 별개다. Vals에 따르면 일부 에이전트 평가는 고정된 하네스를 쓰고 다른 평가는 모델 자체 에이전트를 사용한다. 공개된 표준 오차에는 프롬프트, 시드, 배포 설정에 따른 변동이 반영되지 않는다. 작은 점수 차이는 이런 맥락에서 읽어야 한다.
Google DeepMind가 공개한 자체 비교표 에도 전반적 우위라는 주장에 반하는 사례가 있다. 아르곤은 DeepSWE v1.1에서 GPT-6 Astra를 앞섰지만 77.9% to 74.1%, FrontierSWE v2에서는 Astra에 뒤졌고 55.0% to 65.5%, Terminal-Bench Science에서도 뒤졌다 57.6% to 68.1%. Claude Opus 5.5는 Terminal-Bench 4.0에서 아르곤보다 앞섰고 66.4% to 57.4%, PostTrainBench에서도 앞섰다 49.3% to 45.3%. 표에 포함된 오프라인 OSWorld-2.0 하위 집합에서는 Astra가 72.6% , 아르곤이 69.2%를 기록했다. 이 비교는 Google이 선택한 표와 공개된 벤치마크 설정에 따른 것으로, 조건이 문서화된 공개 서비스에서 고객이 직접 시험한 결과를 대신하지 않는다.
Google은 아르곤이 한 번의 실행에서 최대 100만 출력 토큰을 생성할 수 있다고 한다. 이전 한도는 64,000토큰이었다. Vals는 100만 토큰 컨텍스트 창을 기재했지만 아르곤 평가의 최대 출력은 262,144토큰으로 설정했다. 이 설정이 향후 Google 제품의 하드 한도를 확정하는 것은 아니다. 다만 공개된 Vals 결과가 100만 토큰 전체를 생성한 사례를 보여주지 않으며, Google도 일반 개발자가 사용할 수 있는 출력 한도를 명확히 하는 공개 API 항목을 아직 게시하지 않았다는 뜻이다.
내부 활용 사례와 안전성 주장은 별도 증거가 필요하다
Google은 아르곤 에이전트가 C/C++에서 Rust로의 코드 이전, 양자 컴퓨팅 서브루틴, 데이터센터 메모리 최적화를 도왔다고 설명한다. 메모리 변경 작업 한 건을 배포한 뒤 300TiB 이상을 확보했다고도 한다. 파트너사 Wiz가 아르곤으로 의료 소프트웨어에 영향을 주는 중대한 취약점을 찾았다고도 밝혔다. 이는 Google이 내부 또는 파트너 작업에 대해 전한 내용이다. 출시 자료에는 결과를 검증하거나 재현할 만큼 독립적인 세부 사항이 없다. Google은 대규모 Rust 재작성 코드가 프로덕션에 들어가기 전에 자동·수동 검토를 거친다고 말한다.
안전과 관련해 Google은 유해한 요청을 거부하도록 학습시키고, 간접 프롬프트 인젝션을 방어하며, 사용자 의도에서 벗어난 행동을 찾기 위해 모델의 추론과 행동을 모니터링하고, 평가 환경의 격리를 강화했다고 설명한다. 아르곤이 간접 프롬프트 인젝션에 가장 강한 모델이라는 주장은 공급업체의 설명이다. Google에 따르면 초기 사이버 사용자 그룹에는 일반적인 사이버 안전장치 없이 액세스가 제공된다. 따라서 범위가 넓어질수록 액세스 범위와 모니터링이 특히 중요하다.
일상적인 유용성에 대한 초기 증거는 엇갈린다. Axios는 보도했다 . Bloomberg는 익명 소식통을 인용해 일부 Google 직원이 아르곤의 내부 성능이 기대에 못 미쳤다고 평가했다고 전했다. Axios는 Google이 Bloomberg에 그 내용이 사실과 다르다고 말했다고도 보도했다. Google은 직원들이 어려운 코딩과 연구 작업에 모델을 사용했다고 Axios에 밝혔다. 어느 쪽 설명도 공개 버전의 성능을 확정하지 못한다. 다음에 필요한 증거는 문서화된 설정에서의 액세스, 다른 이들이 검토할 수 있는 과제 결과와 비용이다.



