주요 인공지능(AI) 모델에 영어 또는 표준 중국어(만다린)로 질문하면, 대부분 유창하고 미묘한 뉘앙스까지 담아 답변한다. 하지만 광둥어로 질문하면 균열이 드러나기 시작한다. 바로 그 격차를 메우려는 것이 홍콩 스타트업 Votee AI의 목표다. 이 회사는 대형 AI 연구소들이 대체로 간과해 온 언어로 은행, 대학, 정부 부처를 지원하기 위해 설계된 광둥어 AI 모델을 구축하고 있다.
Summary
핵심 요약
- OpenAI, Anthropic, DeepSeek, Moonshot AI, Z.ai와 같은 기업들이 만든 대부분의 선도 AI 모델은, 개발사가 미국이나 중국 본토에 기반을 두고 있기 때문에 주로 영어와 표준 중국어(만다린)를 중심으로 개발된다.
- 광둥어는 전 세계적으로 8천만 명 이상이 사용하지만, 표준화된 디지털 텍스트의 양은 만다린에 비해 훨씬 적어, AI 학습 관점에서 전형적인 “저자원 언어(low resource language)”에 해당한다.
- Votee AI는 Meta의 Llama와 같은 오픈 웨이트(open-weight) 모델을 광둥어 데이터로 재학습시키며, 웹 크롤링, 커뮤니티 소스, 합성 데이터 등을 통해 학습 코퍼스를 1억 토큰에서 5억 토큰 이상으로 늘렸다.
- 이렇게 만들어진 모델은 약 700억 개의 파라미터를 가지며, 최전선(frontier) 시스템보다는 작다. 5억~10억 토큰으로 학습하는 데 드는 비용은 약 25만 달러 수준으로, 영어 모델에 비해 훨씬 적은 비용이다.
- 회사는 자사의 작업을 더 넓은 “주권 AI(sovereign AI)” 흐름의 일부로 규정하며, 현재 AI Singapore를 통해 동남아시아로의 확장을 논의 중이다.
영어·만다린 중심의 AI가 광둥어를 소외시키다
현재의 AI 붐은 거의 전적으로 두 개의 언어에 의존하고 있다. Votee AI의 CEO 팍선 팅(Pak-Sun Ting)에 따르면, “AI 혁명 전체가 영어와 만다린으로 진행되고 있으며”, “다른 언어가 차지하는 비중은 극히 일부에 불과하다.” 이 불균형은 우연이 아니다. OpenAI, Anthropic, DeepSeek, Moonshot AI, Z.ai 등 이 분야를 선도하는 기업 대부분이 미국이나 중국 본토에 본사를 두고 있어, 이들의 대표 모델이 개발자의 모국어에서 가장 강력한 것은 놀라운 일이 아니다.
그 결과, 널리 사용되는 수십 개의 언어와 더 많은 지역 방언들이 AI 역량 면에서 크게 뒤처지고 있다. 광둥어는 매일 수천만 명이 사용하는 언어임에도, 그 격차가 얼마나 클 수 있는지를 잘 보여주는 대표적인 사례다.
광둥어가 만다린과 ‘다른 언어’인 이유
광둥어는 흔히 중국어의 “방언”으로 불리지만, 이 표현은 실제 차이를 과소평가한 것이다. 광둥어는 만다린과 문법이 다르고 고유한 어휘를 갖고 있으며, 홍콩에서는 한 문장 안에 영어와 광둥어 단어를 섞어 쓰는 일이 흔하다. 전 세계적으로 8천만 명 이상이 광둥어를 사용하며, 이는 한국어 사용 인구와 비슷하고, 이탈리아어나 태국어 사용 인구보다 많다.
그럼에도 불구하고, 광둥어는 만다린이나 영어만큼 표준화된 문어 텍스트를 충분히 생산하지 못했다. 규슈대학과 홍콩교육대학교, 그리고 현지 AI 커뮤니티 hon9kon9ize가 함께 개발하고 Votee가 후원한 HKCanto-Eval 같은 벤치마크에 따르면, 주류 AI 모델은 일상적인 광둥어는 어느 정도 처리하지만, 문화적·지역적 지식에서는 자주 비틀거린다. 팅의 말처럼, 광둥어는 “교육, 의료, 경찰 소통에 사용되기 때문에” AI가 이를 제대로 다루지 못하면 “AI는 사실상 쓸모가 없다.”
Votee AI의 광둥어 AI 모델 구축 방식
Votee는 처음부터 모델을 새로 만드는 대신, Meta의 Llama나 알리바바의 Qwen 같은 기존 오픈 웨이트 시스템을 가져와 광둥어 데이터로 강하게 재학습시킨다. 팅은 이 과정을 “사실상 처음부터 모델을 학습시키는 것과 같은 단계”를 밟되, 다른 이가 만든 기반 위에 쌓는 것이라고 설명한다. 이렇게 재학습된 시스템은 만다린이나 영어가 아닌 광둥어로 작동하는 AI 도구가 필요한 은행, 대학, 정부 부처에 판매된다.
방송사와 합성 데이터 세트에서 데이터 수집
저자원 언어 AI 프로젝트를 위한 유용한 코퍼스를 구축하려면, 확보 가능한 모든 곳에서 데이터를 긁어모아야 한다. Votee는 홍콩 공영방송사인 RTHK(Radio Television Hong Kong)의 콘텐츠를 포함해, 온라인 크롤링을 통해 광둥어 텍스트를 수집한다. 여기에 대학, 더 넓은 커뮤니티, 빅데이터 회사로 활동하던 초기 시절의 아카이브 자료를 보완해 사용한다. 실제 텍스트가 부족한 부분은 Votee가 자체적으로 합성 광둥어 데이터 세트를 생성해 메운다. 이 모든 노력을 통해 회사의 광둥어 코퍼스는 1억 토큰에서 5억 토큰 이상으로 확대됐다.
모델 규모와 학습 비용: 최전선 연구소와의 비교
Votee가 만든 모델은 약 700억 개의 파라미터를 가지며, 최상위 연구소의 선도 시스템보다는 눈에 띄게 작다. 그럼에도 팅은 이 모델들이 고객이 필요로 하는 실용적인 작업에서 광둥어를 이해하고 추론하는 데 충분한 성능을 낸다고 말한다. 경제성도 뚜렷하다. Votee는 5억~10억 토큰으로 모델을 학습시키며, 추정 비용은 약 25만 달러 수준이다. 반면, 최전선 영어 모델은 수조 개의 토큰으로 학습되며, 비용도 훨씬 크다. 바로 이 가격 차이 덕분에, 더 작고 특정 용도에 맞춘 광둥어 AI 모델이 빅테크가 아닌 스타트업에게도 상업적으로 성립 가능한 선택지가 된다.
이 비용 구조는 Votee 자체를 넘어서는 의미를 가진다. 저자원 언어 AI 시장을 서비스하기 위해 꼭 최전선 연구소에 투입되는 수십억 달러가 필요한 것은 아니라는 점을 시사한다. 필요한 것은 쓸 만한 오픈 웨이트 기반 모델, 탄탄한 데이터 파이프라인, 그리고 그에 비례하는 적은 연산 자원이다. 이는 광둥어 AI 개발의 향방을 지켜보는 다른 소외 언어들에게도 중요한 신호다.
주권 AI와 동남아 진출
Votee의 작업은 주권 AI(sovereign AI)라 불리는 더 큰 흐름 속에 자리한다. 이는 정부와 기업이 해외 사업자에 전적으로 의존하지 않고, 자신들의 데이터, 모델, 인프라를 직접 소유하고자 하는 움직임이다. 팅은 “AI가 너무나 필수적인 존재가 되었기 때문에, 언제든 끊어버릴 수 있는 다른 누군가에게 묶여 있고 싶지 않다”고 말한다.
스택을, 비록 부분적으로라도, 소유하기
팅은 한 국가가 AI 공급망의 모든 고리를 통제하는 가장 완전한 형태의 주권 AI를 실제로 구현하는 것은 “매우 어렵다”고 솔직히 인정한다. 그가 제시하는 보다 현실적인 방향은, 각국이 기반이 되는 파운데이션 모델과 그 위에 구축된 소프트웨어 솔루션을 모두 보유하는 데 중점을 두는 것이다. 또한 정부가 특정 업무를 자동화하는 데 꼭 최전선 수준의 성능이 필요한 것은 아니며, 10억 개 파라미터 정도의 모델만으로도 좁은 범위의 행정 업무에는 충분할 수 있다고 지적한다. 혹은 더 작은 현지 언어 레이어를 통해, 더 큰 영어 또는 중국어 모델의 출력을 단순히 라우팅하는 방식도 가능하다.
하드웨어 파트너십과 향후 계획
Votee는 단일 생태계에 자신을 한정하지 않는다. 팅에 따르면 회사는 MiniMax와 SenseTime의 모델과도 협력하며, Nvidia 칩 위에서 운영을 수행할 수 있다. 그는 “우리는 Nvidia 칩을 쓸 수도 있고, Moonshot이나 DeepSeek의 모델을 쓸 수도 있다”며, “우리는 고등학교에서 모두와 친구인 그런 사람”이라고 말한다. Votee는 수익이 비용을 상회하는 의미에서 흑자를 내고 있다고 설명하며, 주로 고객사 계약을 통해 자금을 조달하고 있다. 또한 홍콩의 란콰이퐁(Lan Kwai Fong) 유흥가 개발로 잘 알려진 홍콩 재벌 앨런 지먼(Allan Zeman)을 자문으로 두고 있다.
회사의 야망은 이제 홍콩을 넘어선다. 팅은 Votee가 AI Singapore와 활발히 논의 중이며, 동남아시아 전역으로의 추가 확장을 계획하고 있다고 말한다. 그는 또한 동아시아, 북미, 아프리카 등 지역에서 위기에 처한 언어를 보호하는 데 AI를 활용하는 장기 목표도 염두에 두고 있다. 팅은 영어 중심 AI의 지배를 “타자기 순간(typewriter moment)”이라고 표현하며, 생산성 향상이 너무 커서 사람들이 따라가기 위해 자신의 언어를 포기하게 되는 시점이라고 말한다. “사람들은 타자기의 생산성이 자기 언어보다 너무 강력하기 때문에 영어를 채택하게 될 것”이라는 것이다. 700억 파라미터 규모의 광둥어 AI 모델이 이러한 흐름에 의미 있게 맞설 수 있을지는 여전히 미지수지만, 팅에게 동기는 단순한 시장 점유율을 넘어선다. “언어 하나가 사라질 때마다, 세상을 바라보는 또 하나의 방식이 사라진다”고 그는 말한다.
FAQ
Votee AI가 광둥어 AI 모델 개발에 집중하는 이유는 무엇인가요?
광둥어는 8천만 명 이상이 사용하는 언어로, 만다린과 상당히 다르지만 AI에서 충분히 지원받지 못하고 있습니다. 이는 정확한 현지 언어 도구가 필수적인 교육, 의료 등 분야에 직접적인 영향을 미칩니다.
Votee AI는 광둥어 AI 모델을 어떻게 구축하나요?
Votee AI는 Meta 등 개발사의 오픈 웨이트 모델을 가져와, 웹 크롤링, 커뮤니티 소스, 대학, 합성 데이터를 통해 수집한 광둥어 데이터로 재학습시키며, 코퍼스를 1억 토큰에서 5억 토큰 이상으로 확장합니다.
주권 AI란 무엇이며, Votee AI는 이에 어떻게 기여하나요?
주권 AI는 정부와 기업이 해외 공급자에 전적으로 의존하지 않고, AI 데이터·모델·인프라를 직접 소유하는 것을 의미합니다. Votee AI는 광둥어에 특화된 AI 모델을 현지화하고, 지역 및 글로벌 하드웨어·모델 공급자와 협력함으로써 이러한 흐름을 지원합니다.
Votee AI의 지역 확장 계획은 무엇인가요?
Votee AI는 AI Singapore와 활발히 논의 중이며, 동남아시아로의 확장을 계획하고 있습니다. 동시에, 세계 다른 지역의 위기 언어 보호에 AI를 활용하는 방안도 모색하고 있습니다.
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”Votee AI가 광둥어 AI 모델 개발에 집중하는 이유는 무엇인가요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”광둥어는 8천만 명 이상이 사용하는 언어로, 만다린과 상당히 다르지만 AI에서 충분히 지원받지 못하고 있습니다. 이는 정확한 현지 언어 도구가 필수적인 교육, 의료 등 분야에 직접적인 영향을 미칩니다.”}},{“@type”:”Question”,”name”:”Votee AI는 광둥어 AI 모델을 어떻게 구축하나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Votee AI는 Meta 등 개발사의 오픈 웨이트 모델을 가져와, 웹 크롤링, 커뮤니티 소스, 대학, 합성 데이터를 통해 수집한 광둥어 데이터로 재학습시키며, 코퍼스를 1억 토큰에서 5억 토큰 이상으로 확장합니다.”}},{“@type”:”Question”,”name”:”주권 AI란 무엇이며, Votee AI는 이에 어떻게 기여하나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”주권 AI는 정부와 기업이 해외 공급자에 전적으로 의존하지 않고, AI 데이터·모델·인프라를 직접 소유하는 것을 의미합니다. Votee AI는 광둥어에 특화된 AI 모델을 현지화하고, 지역 및 글로벌 하드웨어·모델 공급자와 협력함으로써 이러한 흐름을 지원합니다.”}},{“@type”:”Question”,”name”:”Votee AI의 지역 확장 계획은 무엇인가요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Votee AI는 AI Singapore와 활발히 논의 중이며, 동남아시아로의 확장을 계획하고 있습니다. 동시에, 세계 다른 지역의 위기 언어 보호에 AI를 활용하는 방안도 모색하고 있습니다.”}}]}
이 기사는 인공지능의 도움을 받아 제작되었으며, 편집팀의 검수를 거쳤습니다.

