2026년 8월 22일 (6)
정부 “독파모 벤치맥싱 문제없다”…2차 평가 공정성 논란 일축

정부 “독파모 벤치맥싱 문제없다”…2차 평가 공정성 논란 일축

승인 2026-08-18 14:44:58
Google에서 선호하는 출처로 추가 관심 있는 쿠키뉴스 기사를 Google 검색에서 더 쉽게 만나보세요.
류제명 과학기술정보통신부 2차관이 18일 서울 종로구 정부서울청사에서 독자 AI파운데이션모델 프로젝트 2차 단계평가 결과 브리핑을 하고 있다. 연합뉴스
류제명 과학기술정보통신부 2차관이 18일 서울 종로구 정부서울청사에서 독자 AI파운데이션모델 프로젝트 2차 단계평가 결과 브리핑을 하고 있다. 연합뉴스
정부가 ‘독자 인공지능(AI) 파운데이션 모델’ 프로젝트 2차 평가를 둘러싼 이른바 ‘벤치맥싱’ 논란에 대해 평가 결과의 신뢰성에는 문제가 없다고 선을 그었다. 벤치마크 운영기관에 직접 검증을 요청한 결과 체계적인 암기나 과적합 정황이 확인되지 않았다는 설명이다.

류제명 과학기술정보통신부 제2차관은 18일 정부서울청사에서 열린 독파모 2차 단계평가 결과 브리핑에서 “해당 평가기관에 벤치맥싱 우려를 의뢰한 결과, 평가를 위한 체계적인 암기나 과적합 문제가 입증될 만한 답변을 찾지 못했으며, 큰 문제가 없다는 답변을 받았다”고 밝혔다.

논란이 된 것은 40점이 배정된 벤치마크 평가다. 독파모 2차 벤치마크 평가는 글로벌 AI 모델 평가기관 아티피셜 애널리시스의 AI 지수(AAII) 25점과 한국지능정보사회진흥원(NIA) 평가 15점으로 구성됐다.

AAII는 에이전트와 코딩, 일반·과학 추론 등 고난도 벤치마크 9종을 종합해 모델 성능을 평가한다. 그러나 일부 참여사가 공개된 평가 항목에 맞춰 모델 성능을 집중적으로 끌어올렸다는 의혹이 업계에서 제기됐다. 실제 사용 성능보다 시험 점수를 높이는 데 초점을 맞춘 것 아니냐는 지적이다.

과기정통부는 AAII를 운영하는 아티피셜 애널리시스에 관련 분석을 공식 요청했다. 기관 측은 체계적인 암기나 평가 데이터 과적합을 입증할 만한 단서를 발견하지 못했다는 취지로 답변했다.

류 차관은 “AAII의 공식 답변을 토대로 했고, 전문가 평가를 통해 여러 가지를 검증한 결과 불공정한 기술 지원 등은 없었다는 결론을 내렸다”고 말했다.

정부는 특정 벤치마크 점수가 당락을 좌우했다는 지적에도 반박했다. 이번 평가는 벤치마크 40점과 전문가 평가 35점, 사용자 평가 25점으로 구성됐다.

각 영역 1위도 모두 달랐다. 벤치마크 평가에서 1위와 4위의 격차는 4점, 전문가 평가는 2.4점, 사용자 평가는 5점이었다.

류 차관은 “특별히 어떤 항목이 결정적이었다고 보기 어려울 정도로 각 항목별 결과를 종합적으로 만들어낸 결과”라고 설명했다.

독파모 프로젝트는 정부가 독자 AI 파운데이션 모델을 육성하기 위해 추진하는 사업이다. LG AI연구원과 SK텔레콤, 업스테이지, 모티프테크놀로지스 등 4개 팀이 2차 평가에 참여했다.

이번 평가에서는 모티프테크놀로지스가 탈락했다. LG AI연구원과 SK텔레콤, 업스테이지는 3차 평가에 진출했다. 정부는 추가 평가를 거쳐 내년 초 최종 2개 팀을 선정할 예정이다.

이혜민 기자 hyem@kukinews.com
이혜민 기자 프로필 사진
이혜민 기자
산업의 흐름 속에서 의미 있는 이야기를 찾겠습니다.
이 기사 어떻게 생각하세요
  • 추천해요
    추천해요
    0
  • 슬퍼요
    슬퍼요
    0
  • 화나요
    화나요
    0

쿠키오리지널

전체보기

쿠키피드

전체보기

슥- 넘겨 보는 세상 이야기, 기자의 솔직한 코멘터리까지

많이 본 기사