구글 제미나이 4 공개했지만…직원들 "실무 코딩 벤치마크만 못해"

입력 2026-10-01 10:19:43
구글 검색 선호 출처로 추가
로봇
mWiz 이 기사 포인트

블룸버그, 구글 직원들 제미나이 4 실제 코딩 성능 회의적…구글 "사실 아냐" 반박

구글이 차세대 인공지능(AI) 플래그십 모델 '제미나이 4 아르곤'을 공개한 직후, 내부 직원들 사이에서 실제 코딩 성능에 대한 회의론이 제기됐다.

알파벳 산하 구글은 오랫동안 기다려온 플래그십 AI 모델 제미나이 4 아르곤의 배포를 시작했지만, 코딩 등 핵심 분야에서의 실제 성능을 둘러싼 내부 회의론에 직면했다. 블룸버그가 30일(현지시간) 해당 프로젝트에 직접 접근 권한을 가진 관계자들을 인용해 보도했다.

구글은 이날 소수의 신뢰할 수 있는 사이버보안 파트너사들에게 먼저 모델을 공개했고, 추가 테스트를 거친 뒤 유료 구독자부터 순차적으로 접근을 확대하겠다고 밝혔다. 구글은 제미나이 4가 여러 주요 벤치마크에서 선도적인 점수를 기록했으며, 보안 능력을 측정하는 한 테스트에서는 오픈AI의 아스트라 모델을 앞질렀다고 설명했다.

문제는 벤치마크 점수와 실무 성능 간의 괴리다. 제미나이 4는 모델 성능을 평가하는 업계 벤치마크에서는 우수한 결과를 보였지만, 직원들이 실제 업무에 적용했을 때는 성능이 떨어지는 것으로 나타났다. 블룸버그가 인용한 관계자들에 따르면 이 모델은 특정 코딩 작업을 처리하는 데 어려움을 겪고 있다.

직원들이 특히 지적한 약점은 앱과 웹사이트의 외관과 사용자 경험을 결정하는 프론트엔드 설계 분야다. 일부 직원들은 앤스로픽의 페이블과 오픈AI의 아스트라가 제미나이보다 빠르게 발전하고 있다고 보고 있으며, 최상의 상태에서도 제미나이 4가 경쟁 모델에 뒤처지는 영역이 있다고 판단했다.

반면 구글 내부의 다른 관계자들은 제미나이 4가 주요 AI 연구소들과 동등한 수준에 도달했다는 반대 의견을 블룸버그에 전했다.

구글은 블룸버그 보도 내용에 강하게 반박했다. 구글은 "제미나이 4가 코딩 등의 분야에서 성능이 떨어진다는 표현은 사실과 다르다"고 밝혔으며, 모델 개발에 정통한 구글 직원은 제미나이 4가 AI 최전선에 있다는 것이 내부적으로 "광범위한 공감대"를 형성하고 있다고 전했다. 구글 딥마인드 수장 코레이 카부쿠오글루는 "팀을 전적으로 신뢰한다. 우리가 항상 최전선에 있을 것이라는 점은 확실하다"고 말했다.

구글에 따르면 제미나이 4 아르곤은 소프트웨어 엔지니어링, 금융, 법률, 사이버보안 분야의 복잡하고 장기적인 작업을 처리하도록 설계됐다.

블룸버그 보도는 구글이 당초 6월에 '제미나이 3.5 프로'라는 다른 버전을 출시할 계획이었으나 이를 포기했다는 사실도 전했다. 앞서 7월에는 구글 딥마인드 직원들 사이의 낮은 사기가 출시 지연의 원인 중 하나였다는 보도도 나온 바 있다.

내부 논란은 알파벳 주가에도 영향을 미쳤다. 알파벳 주가는 블룸버그 보도 이후 수요일 장 마감을 앞두고 상승폭이 2% 이상에서 0.5%로 축소됐다.

제미나이 모델은 검색 AI 답변부터 지도, 지메일, 크롬에 이르기까지 구글이 판매하는 거의 모든 제품의 기반이 되며, 해당 제품 각각의 이용자는 10억 명이 넘는다. 구글은 추가 테스트를 마친 뒤 유료 구독자를 시작으로 제미나이 4 아르곤의 접근 범위를 단계적으로 넓혀갈 계획이다.