구글, 차세대 AI ‘제미나이 4 아르곤’ 공개…코딩·보안 능력 강화

100만 토큰 출력 지원…복잡한 장기 작업 수행 능력 확대
사이버보안 전문가부터 제한 공개…검증 후 이용 범위 확대
구글이 차세대 인공지능 모델 제미나이 4 아르곤을 공개했다. 사진=구글.

구글이 복잡한 소프트웨어 개발부터 금융·법률 업무, 사이버보안까지 장시간 전문 작업을 수행하도록 설계된 차세대 인공지능 모델 ‘제미나이 4 아르곤(Gemini 4 Argon)’을 공개했다.

구글은 9월 30일Gemini 4 Argon을 발표하며 이 모델이 단순한 질의응답을 넘어 여러 단계에 걸친 복잡한 문제를 지속적으로 분석하고 해결하는 ‘장기 작업(long-horizon workflow)’ 능력에 초점을 맞췄다고 밝혔다. 실제 소프트웨어 엔지니어링과 기업 지식 업무, 사이버보안 분야에서 성능을 크게 끌어올렸다는 설명이다.

Gemini 4 Argon의 가장 눈에 띄는 변화 가운데 하나는 출력 한도다. 구글은 기존 6만4,000토큰 수준이었던 최대 출력 한도를 100만 토큰으로 확대해 대규모 코드 분석이나 복잡한 연구처럼 긴 분석 과정이 필요한 작업을 한 번에 수행할 수 있도록 했다고 밝혔다.

구글은 Gemini 4 Argon이 이미 사내 개발과 연구 과정에서 활용되고 있다고 설명했다. 구글 직원 수천 명이 전문적인 코딩과 연구, 문서 작성 등에 사용하고 있으며, 단순한 코드 생성을 넘어 대규모 코드베이스를 다른 프로그래밍 언어로 이전하는 작업에도 활용하고 있다.

실제로 구글은 C와 C++로 작성된 대규모 프로그램을 메모리 안전성이 높은 Rust로 전환하는 데 아르곤을 사용하고 있다. 일부 프로젝트에서는 수만 줄 규모의 코드에서 시작해 Fuchsia 운영체제의 Zircon 커널처럼 80만 줄이 넘는 코드베이스까지 적용 범위를 확대하고 있다.

영상 디코딩 소프트웨어 libgav1 프로젝트에서는 약 3만2,000줄의 Rust SIMD 코드를 아르곤 에이전트가 반복적으로 분석하고 최적화했다. 구글에 따르면 이를 통해 기존 Rust 버전보다 처리 속도를 2.7배 높이면서 동일한 영상 결과를 유지했다.

데이터센터 운영에서도 성과가 나왔다. 여러 AI 에이전트가 데이터센터의 성능 자료를 분석해 불필요한 메모리 사용을 찾아냈으며, 실제 적용 과정에서 300TiB가 넘는 메모리 용량을 확보했다. 구글은 향후 전체 최적화가 적용될 경우 절감 규모가 500TiB에서 최대 1PiB까지 확대될 수 있다고 밝혔다.

양자컴퓨팅 연구에서도 아르곤은 특정 양자 알고리즘의 큐비트와 연산량을 줄이는 최적화 문제를 분석해 기존에 발표된 기준보다 약 40% 개선된 결과를 몇 분 만에 찾아냈다고 구글은 설명했다.

실제 소프트웨어 엔지니어링 능력을 평가하는 딥SWE v1.1(DeepSWE v1.1) 벤치마크에서는 77.9%를 기록했다. 구글은 복잡하고 장시간 진행되는 실제 개발 업무에서 높은 수준의 성능을 나타냈다고 평가했다. 다만 벤치마크 결과는 시험 환경에 따라 실제 사용 경험과 차이가 날 수 있다.

이번 모델에서 구글이 특히 강조한 분야는 사이버보안이다. 제미나이 4 아르곤(Gemini 4 Argon)은 소프트웨어에 숨어 있는 보안 취약점을 찾아내고 실제 취약점인지 검증한 뒤 수정 패치까지 생성할 수 있도록 훈련됐다.

취약점 수정 능력을 평가하는 CWE-벤치 v1(CWE-bench v1)에서는 68%를 기록해 최고 점수와 공동 1위를 기록했다고 구글은 밝혔다. 내부 평가에서도 20개 프로그래밍 언어에 걸쳐 다양한 보안 문제를 찾아냈으며, 사이버보안 기업 Wiz가 진행한 실제 웹 시스템 침투 테스트에서는 기존 모델인 ‘제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)’보다 향상된 성능을 보였다는 설명이다.

Wiz의 ‘스캔 포 굿(Scan for Good)’ 프로젝트에서는 아르곤이 전 세계 병원에서 사용되는 의료 소프트웨어에서 개인정보가 노출될 수 있는 심각한 취약점을 발견하기도 했다. 구글은 이전 세대 프런티어 AI 모델들이 찾아내지 못했던 문제라고 밝혔다.

다만 이처럼 강력한 사이버보안 능력 때문에 구글은 제미나이 4 아르곤(Gemini 4 Argon)을 즉시 일반 사용자에게 공개하지 않기로 했다.

현재 아르곤은 구글의 ‘페어윈드 프로그램(Fairwind Program)’을 통해 검증된 일부 사이버보안 전문가에게 우선 제공되고 있다. 해당 전문가들은 실제 취약점 탐지와 방어 목적으로 모델의 고성능 사이버보안 기능을 사용할 수 있다.

구글은 미국 정부가 운영하는 고성능 AI 모델 사전 검토 절차에도 참여하고 있다고 밝혔다. 초기 사용자 평가를 토대로 안전장치를 강화한 뒤 개발자와 기업, 일반 이용자로 사용 범위를 확대한다는 계획이다.

특히 사이버 공격뿐 아니라 화학·생물학·방사능·핵무기 관련 위험한 요청에 모델이 악용될 가능성도 주요 위험 요소로 보고 있다. 구글은 위험한 요청을 차단하면서 정상적인 연구와 방어 목적의 사용은 가능하도록 안전장치를 설계하고 있다고 설명했다.

외부 웹사이트나 문서에 숨겨진 악성 명령을 AI가 실행하도록 유도하는 ‘간접 프롬프트 인젝션’ 공격에 대한 방어도 강화됐다. 구글은 자동화된 레드팀 테스트와 적대적 훈련을 통해 아르곤의 공격 저항성을 높였다고 밝혔다.

AI 에이전트가 사용자의 지시 범위를 넘어 독자적으로 행동하는 것을 막기 위한 시스템도 적용됐다. 모델의 내부 추론과 행동을 감시해 의도하지 않은 행동이 감지되면 실행을 중단하도록 설계했으며, 고위험 모델의 훈련과 테스트는 외부 시스템과 격리된 환경에서 진행한다는 방침이다.

가격은 초기 제공 기준으로 입력 100만 토큰당 2달러, 출력 100만 토큰당 10달러다. 캐시된 입력 토큰에는 입력 가격의 95% 할인이 적용된다. 초기 프로모션 종료 후에는 입력 100만 토큰당 4달러, 출력은 20달러로 인상될 예정이다.

10월 1일 현재 일반 제미나이(Gemini) 이용자가 곧바로 제미나이 4 아르곤(Gemini 4 Argon)을 선택해 사용할 수 있는 단계는 아니다. 구글은 안전성 검증과 초기 사용자 평가를 거쳐 유료 API 고객과 구글 AI 울트라(Google AI Ultra) 가입자를 시작으로 개발자와 기업, 소비자에게 제공할 계획이다. 구체적인 전면 공개 날짜는 밝히지 않았다.

제미나이 4 아르곤(Gemini 4 Argon)의 등장은 AI 경쟁이 단순히 질문에 얼마나 정확히 답하느냐를 넘어 실제 업무를 얼마나 오랫동안 독립적으로 수행할 수 있는지를 겨루는 단계로 이동하고 있음을 보여준다.

특히 구글이 코딩과 연구, 금융·법률 업무와 함께 사이버보안을 핵심 능력으로 내세운 것은 AI가 답변을 생성하는 도구에서 복잡한 업무를 직접 수행하는 ‘AI 에이전트’로 빠르게 진화하고 있다는 점을 보여준다. 동시에 가장 강력한 기능을 제한적으로 먼저 공개한 것은 AI 성능 경쟁과 함께 안전성과 통제 문제가 핵심 과제로 부상하고 있음을 보여주고 있다.



스티브 권 기자 / steve.kwon@baynewslab.com
저작권자 © SF Bay News Lab, 무단 전재–재배포 금지 / 광고문의 ad@baynewslab.com

Related Posts

의견 남기기