HomeAI구글의 수어 AI 번역 기능은 농인 사용자가 타이핑 대신 수어로 표현할 수...

구글의 수어 AI 번역 기능은 농인 사용자가 타이핑 대신 수어로 표현할 수 있게 해준다

Google DeepMind는 청각장애인과 난청 사용자가 타이핑 대신 휴대전화에 직접 수어를 할 수 있게 해 주는 새로운 형태의 수어 AI 번역을 선보였으며, 회사는 이를 접근성 기술의 진정한 돌파구라고 부르고 있습니다. 2026년 8월 12일에 공개된 이 모델의 이름은 SL2T로, sign-language-to-text(수어-텍스트 변환)의 약자이며, 이와 같은 기술이 연구실을 벗어나 Gboard와 Live Transcribe와 같은 일상적인 소비자용 앱에 처음으로 도입되었다는 점에서 의미가 있습니다.

핵심 요약

  • Google DeepMind는 수어를 바로 문자로 변환하는 다국어 수어 모델 SL2T를 출시했습니다.
  • 현재는 추가 비용 없이 Pixel 11의 Gboard와 Live Transcribe에서 미국 수어(ASL)를 영어로 변환하는 기능을 지원합니다.
  • 이 모델은 50개가 넘는 수어에 걸쳐 10만 시간 이상의 데이터로 학습되었으며, FLEURS-ASL 벤치마크에서 70 BLEURT 점수를 기록해 이전 모델들을 크게 상회합니다.
  • SL2T는 사용자 프라이버시를 보호하기 위해 원본 영상 대신 포즈 랜드마크를 추적하며, 카메라 영상은 즉시 폐기합니다.
  • 수어 사용자 커뮤니티 구성원들이 초기부터 프로젝트에 참여했으며, Google은 출시를 안내하기 위해 AI 수어 자문 위원회(AISLAC)를 구성했습니다.

Google DeepMind, 다국어 수어 AI 번역 모델 SL2T 출시

SL2T는 수년간 AI에 존재해 온 공백에 대한 DeepMind의 해답입니다. 받아쓰기나 자동 번역과 같은 음성 언어 도구는 지난 20년 동안 대중화되었지만, 전 세계 2백 개가 넘는 수어 — 약 7천만 명의 청각장애인과 난청인이 사용하는 언어 — 는 대부분 소외되어 왔습니다. DeepMind는 SL2T를 번역 품질과 언어 범위 모두에서 의미 있는 도약을 이루기 위해 구축된 “대규모 다국어” 시스템이라고 설명합니다.

실질적인 결과는 새로운 형태의 받아쓰기입니다. 청인 사용자가 타이핑 대신 말할 수 있듯이, SL2T는 청각장애 사용자가 웹 검색, 메시지나 문서 작성, Gemini에게 작업을 요청하는 등 평소 타이핑을 하던 어디에서나 휴대전화에 수어를 할 수 있게 해 줍니다. Live Transcribe 안에서는 청각장애 사용자가 청인과의 대화에서 타이핑 대신 자신의 발화를 수어로 표현할 수 있습니다. Google의 자체 테스터들에 따르면, ASL로 수어를 하는 것이 같은 내용을 영어로 타이핑하는 것보다 더 빠르고 자연스럽게 느껴졌다고 합니다.

Pixel 11의 Gboard 및 Live Transcribe에서 제공되는 ASL 지원

현재 이 기술은 하나의 언어 쌍만 지원합니다. 미국 수어를 영어로 번역하는 기능입니다. 우선 Pixel 11의 Gboard와 Live Transcribe에서 제공되며, Google은 더 많은 기기와 추가 수어 지원을 예고하고 있습니다. 특히 이 기능은 사용자에게 추가 비용 없이 제공되어, 프리미엄 부가 기능이 아닌 표준 접근성 기능으로 자리매김하고 있습니다.

다국어 수어 모델은 어떻게 만들어졌나

SL2T는 10만 시간이 넘는 데이터셋으로 학습되었으며, 50개 이상의 수어를 포괄합니다. 이 중 약 4분의 1은 ASL 데이터입니다. 개별 단일 언어 시스템을 따로 만드는 대신, 다양한 언어와 숙련도 수준을 한 번에 학습시키는 방식은 공통 구조를 학습하는 데 도움이 되었고, DeepMind의 자체 테스트에서 단일 언어 모델보다 전반적인 성능이 더 뛰어난 것으로 나타났습니다.

이 규모는 수치에서도 드러납니다. ASL에서 영어로의 번역 품질을 측정하는 FLEURS-ASL 벤치마크에서 SL2T는 제로샷 기준 70 BLEURT 점수를 기록했는데, DeepMind는 이것이 이와 같은 작업에서 지금까지 보고된 어떤 결과보다도 상당히 높은 수치라고 말합니다. 이 격차는 중요합니다. SL2T가 단순한 점진적 개선을 넘어, 수어를 단어에 대응되는 일련의 손동작이 아닌 완전한 언어로서 AI가 이해하는 수준을 한 단계 끌어올렸다는 신호이기 때문입니다.

난점의 일부는 수어가 단순히 손으로 수행하는 음성 언어가 아니라는 데 있습니다. 수어는 고유한 문법, 어휘, 구조를 가지고 있으며, 손과 팔, 상체, 머리, 얼굴의 동시 움직임을 통해 의미를 전달합니다. 이를 실시간으로 추적하는 것은 까다로운 컴퓨터 비전 문제이며, 과거의 수어 장갑과 같은 시도가 어려움을 겪었던 이유이기도 합니다. 이들 시도는 수어를 실제 언어 번역이 아닌 좁은 의미의 손 추적 과제로 취급했기 때문입니다.

포즈 랜드마크로 수어 사용자의 프라이버시 보호

SL2T는 원본 영상을 서버로 전송하는 대신, 수어를 포즈 랜드마크 좌표 스트림으로 처리합니다. MediaPipe Holistic이라는 온디바이스 모델이 수어 사용자의 몸에 있는 여러 지점을 추적하며, 번역을 위해 전송되는 것은 카메라 영상이 아닌 이러한 기하학적 좌표뿐입니다. 원본 영상은 즉시 폐기되며, 이는 프라이버시 보호를 사후에 덧붙이는 것이 아니라 시스템 아키텍처에 직접 내장하는 방식이라고 DeepMind는 설명합니다.

글로스를 건너뛰어 직접 번역 정확도 향상

SL2T는 이전 수어 연구에서 흔히 사용되던 접근법과도 결을 달리합니다. 좌표 시퀀스를 단계별 주석인 “글로스(gloss)”를 거치지 않고 바로 텍스트로 번역하는 방식입니다. 글로스는 표정이나 공간 활용과 같이 수어의 풍부하고 비선형적인 요소를 놓치는 경향이 있습니다. 이러한 요소들은 실제 의미를 담고 있습니다. 이 단계를 생략함으로써 SL2T는 인위적인 어휘 제한을 피하고, 데이터가 늘어날수록 번역 품질이 직접적으로 향상될 수 있게 합니다.

Google은 벤치마크 점수 외에도 실제 환경에서의 실용적인 문제를 함께 다뤘다고 말합니다. 스트리밍 지연을 줄이고, 실제로 수어를 하지 않을 때 잘못된 번역이 발생하는 일을 방지했으며, 전체 수어 사용자 중 약 10%를 차지하는 왼손잡이 사용자와, 한 손으로 휴대전화를 들고 다른 한 손으로 수어를 하는 사용자에 대한 정확도를 특히 개선했습니다.

수어 커뮤니티가 SL2T 개발을 이끌다

DeepMind는 이 프로젝트를 단순히 수어 커뮤니티를 위한 것이 아니라, 수어 커뮤니티와 함께 만든 프로젝트로 규정합니다. 이 아이디어는 청각장애인 구글러인 Sam Sepah에게서 시작되었으며, 데이터 수집, 사용자 테스트, 기술의 실제 영향 평가 전 과정에 걸쳐 수어 커뮤니티 파트너들이 참여했습니다.

초기 출시 이후에도 이러한 참여를 구조적으로 유지하기 위해, Google은 전 세계 수어 관련 단체와 전문가들을 모은 AI 수어 자문 위원회(AISLAC)를 구성해 앞으로 이 기술이 어떻게 배포될지 방향을 제시하도록 했습니다. 또한 회사는 커뮤니티 파트너들과 함께 이번 첫 출시를 위한 공동 영향 보고서를 작성해, SL2T가 할 수 있는 일과 현재 한계를 모두 명시했으며, 향후 수어 관련 출시에서도 이 같은 접근을 반복할 계획이라고 밝혔습니다.

수어 AI 번역의 다음 단계

DeepMind는 ASL 지원을 종착점이 아닌 출발점으로 보고 있습니다. 팀은 SL2T를 더 많은 수어로 확장하고, 텍스트를 수어 출력으로 바꾸는 역방향 과정인 수어 생성 기술을 탐구하며, 기존 모델 위에 더 발전된 AI 기능을 추가하는 작업을 진행 중이라고 말합니다.

이러한 더 큰 목표는 정보를 보편적으로 접근 가능하게 만들겠다는 Google의 오랜 비전과 맞닿아 있습니다. 청각장애인 커뮤니티에 이를 실현하려면, 단일 기기의 단일 기능을 출시하는 수준을 넘어, 디지털 제품 전반에서 수어를 음성 및 문자 언어와 비슷한 수준으로 끌어올려야 합니다. SL2T의 초기 ASL 성과가 각기 다른 문법과 지역 변이를 가진 수십 개의 수어로 확장될 때도 유지되는지 여부는, Pixel 11을 넘어 더 많은 사용자에게 이 비전이 얼마나 빨리 현실이 될지를 좌우할 가능성이 큽니다.

FAQ

SL2T란 무엇이며 무엇을 하나요?

SL2T는 Google DeepMind의 다국어 수어-텍스트 변환 모델입니다. 수어를 직접 문자로 번역해, 청각장애 사용자가 키보드 대신 휴대전화에 수어를 하여 메시지를 입력하고, 검색하고, 소통할 수 있게 해 줍니다.

현재 SL2T가 지원하는 수어는 무엇인가요?

현재 SL2T는 미국 수어를 영어로 번역하는 기능만 지원하며, Pixel 11의 Gboard와 Live Transcribe를 통해 사용할 수 있습니다. 향후 출시에서 추가 수어 지원이 예정되어 있습니다.

SL2T는 수어 번역 중 사용자 프라이버시를 어떻게 보호하나요?

SL2T는 원본 영상을 전송하는 대신, 수어 사용자의 몸에 있는 여러 지점을 읽어들이는 온디바이스 추적 시스템을 실행합니다. 번역에는 이러한 좌표만 사용되며, 카메라 영상 자체는 즉시 폐기됩니다.

SL2T 프로젝트에 수어 커뮤니티는 어떻게 참여하고 있나요?

청각장애인은 초기 개념 단계부터 데이터 수집, 테스트, 거버넌스에 이르기까지 전 과정에 참여했습니다. Google은 또한 수어 관련 단체와 전문가들로 구성된 AI 수어 자문 위원회를 설립해, 이 기술이 앞으로 어떻게 발전할지 방향을 제시하도록 하고 있습니다.

{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”SL2T란 무엇이며 무엇을 하나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”SL2T는 Google DeepMind의 다국어 수어-텍스트 변환 모델입니다. 수어를 직접 문자로 번역해, 청각장애 사용자가 키보드 대신 휴대전화에 수어를 하여 메시지를 입력하고, 검색하고, 소통할 수 있게 해 줍니다.”}},{“@type”:”Question”,”name”:”현재 SL2T가 지원하는 수어는 무엇인가요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”현재 SL2T는 미국 수어를 영어로 번역하는 기능만 지원하며, Pixel 11의 Gboard와 Live Transcribe를 통해 사용할 수 있습니다. 향후 출시에서 추가 수어 지원이 예정되어 있습니다.”}},{“@type”:”Question”,”name”:”SL2T는 수어 번역 중 사용자 프라이버시를 어떻게 보호하나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”SL2T는 원본 영상을 전송하는 대신, 수어 사용자의 몸에 있는 여러 지점을 읽어들이는 온디바이스 추적 시스템을 실행합니다. 번역에는 이러한 좌표만 사용되며, 카메라 영상 자체는 즉시 폐기됩니다.”}},{“@type”:”Question”,”name”:”SL2T 프로젝트에 수어 커뮤니티는 어떻게 참여하고 있나요?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”청각장애인은 초기 개념 단계부터 데이터 수집, 테스트, 거버넌스에 이르기까지 전 과정에 참여했습니다. Google은 또한 수어 관련 단체와 전문가들로 구성된 AI 수어 자문 위원회를 설립해, 이 기술이 앞으로 어떻게 발전할지 방향을 제시하도록 하고 있습니다.”}}]}

이 기사는 인공지능의 도움을 받아 제작되었으며, 편집팀의 검수를 거쳤습니다.

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST