검색창 열기 인더뉴스 부·울·경

Communication 통신

SKT, ‘한국어 특화’ A.X 4.0 오픈소스 공개… “최고 수준 한국어 처리”

URL복사

Thursday, July 03, 2025, 11:07:37

토크나이저 자체 설계·적용…고용량 정보처리 및 비용절감 가능

 

인더뉴스 이종현 기자ㅣSK텔레콤[017670]은 한국어 특화 LLM인 A.X(에이닷 엑스) 4.0을 오픈소스로 공개했다고 3일 밝혔습니다.

 

SKT는 이날 오전 글로벌 오픈소스 커뮤니티 허깅페이스(Hugging Face)를 통해 A.X 4.0의 표준 모델과 경량 모델 2종을 공개했습니다.

 

이번에 공개한 A.X 4.0은 현존 대규모 언어 모델(LLM) 중에서도 최상급의 한국어 처리 효율성은 물론 데이터 보안을 고려한 설계, 그리고 로컬 환경에서의 운영 가능성 등이 강점이라고 SKT는 설명했습니다. 오픈소스 모델인 Qwen2.5에 방대한 한국어 데이터를 추가로 학습시켜 국내 비즈니스 환경에 맞는 성능을 발휘합니다.

 

SKT는 A.X 4.0의 토크나이저를 자체 설계·적용해 높은 수준의 한국어 처리 역량을 구현했습니다. 자체 테스트 결과 같은 한국어 문장을 입력했을 때 GPT-4o보다 A.X 4.0이 약 33%가량 높은 토큰 효율을 기록하며 다른 LLM 대비 높은 정보 처리용량에 비용 절감까지 가능합니다.

 

토크나이저(Tokenizer)는 문장의 구조를 분석해 토큰으로 분할하는 작업 도구를 의미합니다.

 

A.X 4.0은 대표적인 한국어 능력 평가 벤치마크인 KMMLU2)에서 78.3점을 기록하여 GPT-4o(72.5점)보다 우수한 성능을 보였으며 한국어 및 한국 문화 벤치마크인 CLIcK에서도 83.5점을 획득해 GPT-4o(80.2점)보다 더 높은 한국 문화 이해도를 보였습니다.

 

SKT는 A.X 4.0를 기업 내부 서버에 직접 설치해 사용할 수 있는 온프레미스 방식으로 제공해 기업들이 데이터 보안에 대한 걱정을 덜 수 있도록 서비스할 계획입니다. A.X 4.0 개발 과정에서도 대규모 학습(CPT)의 전 과정을 외부와 연동 없이 자체 데이터로 학습해 데이터의 주권도 확보한 바 있습니다.

 

표준 모델은 720억개(72B), 경량 모델은 70억개(7B)의 매개변수를 갖추고 있어 이용자들이 목적에 맞춰 선택적으로 이용할 수 있도록 했습니다.

 

SKT는 이미 A.X 4.0을 지난 5월 에이닷 통화 요약에 적용 및 활용하고 있으며 추후 자사는 물론 SK그룹 내 다양한 서비스에 적용할 계획입니다.

 

SKT가 이번에 선보인 모델로 기업들은 파생형 모델을 개발할 수 있고 연구 분야에서도 활용할 수 있습니다.

 

SKT는 이번 A.X 4.0 지식형 모델의 오픈소스 공개와 동시에 추론형 모델의 발표도 앞두고 있습니다. SKT는 이달 중으로 수학 문제 해결과 코드 개발 능력이 강화된 추론형 모델을 공개하고 이미지와 텍스트를 동시에 이해하고 처리할 수 있는 수준까지 모델을 업데이트할 계획입니다.

 

또한, 소버린 AI 관점에서 A.X 3.0에 적용한 프롬 스크래치(모델의 맨 처음 단계부터 모두 직접 구축) 방식도 병행하여 개발을 진행하고 있으며 후속 모델도 순차적으로 공개할 예정입니다.

 

김지원 SKT AI Model Lab장은 "SK텔레콤의 다양한 서비스를 고도화하고 기업 시장에서 한국어 특화 LLM으로 국내 비즈니스 환경에 최적화된 모델이 될 수 있도록 지속적인 기술 개발을 추진할 계획"이라고 말했습니다.

English(中文·日本語) news is the result of applying Google Translate. <iN THE NEWS> is not responsible for the content of English(中文·日本語) news.

배너

이종현 기자 flopig2001@inthenews.co.kr

배너

KT “정부 소버린 AI정책, KT와 맞닿아…한국형 AI 개발 계속할 것”

KT “정부 소버린 AI정책, KT와 맞닿아…한국형 AI 개발 계속할 것”

2025.07.03 16:15:01

인더뉴스 이종현 기자ㅣKT가 자체 개발한 한국형 AI 거대언어모델(LLM) '믿:음 2.0'을 공개하고 정부의 독자 AI 파운데이션 모델 참여에 대한 의지를 내비쳤습니다. KT[030200]는 2023년 개발한 '믿:음1.0'에 이은 새로운 AI 모델 '믿:음 2.0'을 3일 선보이며 정부가 추진하고 있는 한국 독자 AI 파운데이션 모델에 참여하기 위해 준비하고 있다고 밝혔습니다. 신동훈 KT Gen AI 랩장은 "정부의 소버린 AI 정책은 KT의 AI 철학과 방향이 맞닿아 있다"라며 "KT는 한국적 데이터 얼라이언스와 그동안 1년여간의 노력을 거쳐 구축한 데이터들이 있어 독자 AI 파운데이션 모델을 구축하는 데 큰 강점이 될 것"이라고 말했습니다. 오승필 KT 기술혁신부문장은 "KT가 추구하는 소버린 AI는 데이터 주권 확보, 한국 언어 및 문화에 대한 지식, 다양한 AI 모델 선택권, 책임감 있는 AI 등 네 가지로 볼 수 있다"고 설명했습니다. 신동훈 랩장은 "믿음 모델은 데이터 구축부터 모델 학습 전 과정이 KT 자체 기술을 통해 이뤄졌기 때문에 소버린 AI 모델로 볼 수 있다"라며 "한국적 가치와 문화를 담아낸 믿음 모델은 독자적 AI를 구축하는 데 큰 강점이라 생각한다"고 설명했습니다. 정부의 소버린 AI 정책에 대해 신동훈 랩장은 "과제에 선정이 되고 안 되고를 떠나 KT는 한국형 AI 개발을 지속할 것"이라고 강조했습니다. 이어 "정부에 바라는 점이라면 공공 데이터에 대한 규제를 완화해 주는 것이 필요하다고 생각한다"라며 "규제에 막혀 일부 국가 공공문서 학습 못하고 있는 상황인데 국가가 통제 가능한 데이터를 어느 정도 기업이 AI 학습에 사용할 수 있도록 해주길 바란다"고 말했습니다. KT는 이날 마이크로소프트(MS)와 협업하는 AI 사업과 자체 개발하는 AI의 관계설정에 대해서는 상호 보완 관계라고 설명했습니다. 신동훈 랩장은 "믿음 개발을 멈춘 적은 없으며 한 번도 자체 AI 기술 개발을 포기해야 한다고 생각하지 않았다"라며 "KT의 자체 개발 AI가 완전한 기술로 거듭나기 전까지 MS와의 협업을 통해 부족한 기술을 보완하는 것"이라고 설명했습니다. MS와의 협업을 진행하면서도 AI 자체 개발도 병행하는 '투트랙' 전략을 택했다는 것으로 풀이됩니다. MS와의 협업 모델과 믿:음 2.0의 역할이 다를 것이라고도 설명했습니다. 고성능·복잡 업무에는 MS와의 협업 모델을, 단순 및 문서 업무에서는 믿음 모델을 활용해 상황에 따라 유연하게 사용할 수 있을 것이라는 입장입니다. 앞서 KT는 MS와의 협업 모델을 올해 2분기 상용화를 목표로 공동 개발 중이라고 밝힌 바 있습니다. 협업 모델의 출시 지연에 대해 KT는 "조만간 공개될 예정"이라며 "시기가 밀리는 이유는 내부적으로 성능을 높이기 위한 테스트 과정이 진행되고 있기 때문"이라고 설명했습니다.


배너


배너