카카오, 언어모델링 국제학회 'COLM 2026'서 AI 연구 성과 발표

카카오, 언어모델링 국제학회 'COLM 2026'서 AI 연구 성과 발표

대규모 AI 모델 학습 최적화 방법, 모델 경량화 연구 기법 발표

[아이뉴스24 정유림 기자] 카카오는 언어모델링 국제 학회 'COLM 2026'에서 대규모 전문가 혼합(MoE) 모델의 학습 효율을 높이는 기술, 모델 크기를 줄이면서도 성능을 개선하는 경량화 기술을 발표했다고 8일 밝혔다.

카카오 로고 [사진=카카오]

COLM은 대규모 언어모델(LLM)과 언어모델링 연구를 전문적으로 다루는 국제 학회로, 2024년 신설됐다. 카카오는 이번 학회의 메인 컨퍼런스와 토크나이제이션(토큰화·AI가 문자를 처리할 수 있도록 작은 단위로 쪼갬) 워크숍(톡샵·TokShop)에서 각각 성과를 소개했다.

메인 컨퍼런스에서 발표한 논문은 대규모 MoE 모델의 사전 학습에 필요한 최적의 학습률을 전체 학습 비용의 약 1% 수준으로 예측하는 방법론을 담았다.

학습률은 인공지능(AI) 모델이 학습할 때 내부 설정값인 매개변수를 얼마나 크게 조정할지 정하는 값이다. 너무 크면 학습이 불안정해지고 너무 작으면 학습 속도가 느려질 수 있어 적절한 값을 찾는 것이 중요하며 이는 학습의 안정성과 성능에 영향을 미친다.

카카오는 소규모 모델에서 찾은 최적의 학습 설정을 대규모 모델로 확장하는 '뮤-매개변수화(μ-Parameterization)' 기법을 MoE 모델 구조의 특성에 맞게 적용했다. 모델의 크기와 학습 토큰량을 단계적으로 확장하며 최적의 학습률을 탐색하고 짧은 학습 구간에서 찾은 설정이 대규모 학습에서도 유효하게 적용됨을 검증했다. 이 방법론은 카카오의 '카나나-2.6-155b-a17b' 모델의 사전학습에 적용돼 10조(10T) 토큰까지 안정적으로 학습하는 데 활용됐다.

워크숍에서는 모델 크기를 줄이면서도 성능을 높인 경량화 기술(BBT)을 공개했다. 기존 문자 조합 토큰 생성 방식(BPE) 기반 모델은 글을 읽고 답변을 생성하기 위해 수많은 단어와 단어 조각에 해당하는 정보를 저장해야 한다. BBT는 이를 더 작은 기본 단위인 바이트를 활용하는 구조로 바꿔 모델의 크기를 줄이면서 여러 문자를 묶어 효율적으로 압축 처리하는 기존 방식의 장점은 유지했다.

이 기술은 비교 실험에서 파라미터 수를 20.2~40.4% 줄이면서 테스트 성능을 2.7~6.6% 개선한 것으로 나타났다. 오탈자나 문자 교란에 대한 강건성을 확보하고 학습하지 않은 언어로의 전이 성능도 높였다.

이로써 온디바이스(기기 자체에서 AI 연산과 추론 실행) 환경에서 AI 모델의 메모리 부담을 줄이고 다국어 입력이나 오탈자가 잦은 대화 환경에서도 안정적인 성능을 구현하는데 기여할 것으로 기대를 모은다.

카카오는 앞으로 다양한 모델 구조로 적용 범위를 넓히고 효율적인 방법을 고도화해 대규모 LLM의 학습 비용을 더 절감할 계획이다.

카카오 관계자는 "이번 연구들은 AI 모델의 성능을 유지하거나 향상시키면서도 학습·운영 비용을 낮출 수 있는 실용적인 해법을 제시했다는 데 의의가 있다"며 "앞으로 다양한 모델 구조와 멀티모달(서로 다른 형태의 데이터를 동시에 받아 이해하고 추론)·다국어 환경으로 연구를 확장해 실제 서비스 활용 가능성을 높이며 경쟁력을 강화할 것"이라고 밝혔다.

/정유림 기자(2yclever@inews24.com)