바이트댄스, 더우바오에 음성·영상 동시 처리 AI 모델 시드리얼타임 적용

홈 > 투자정보 > 코인뉴스
코인뉴스

바이트댄스, 더우바오에 음성·영상 동시 처리 AI 모델 시드리얼타임 적용

코인개미 0 7
13da94e7d7acb325289d936dda349a37_1751507870_8121.png


바이트댄스(ByteDance)가 자사의 음성, 영상, 텍스트를 동시에 처리할 수 있는 전이중 AI 모델인 시드리얼타임(SeedRealtime)을 자사 앱 더우바오(Doubao)에 적용했다고 발표했다. 바이트댄스의 AI 연구 부서인 시드(Seed)는 10일에 이 모델을 공개하였으며, 이는 오디오와 비디오, 텍스트를 엔드투엔드(end-to-end) 구조로 통합하여 인식, 이해, 판단, 표현을 병렬적으로 처리하는 기능을 소개하는 것이다.

시드리얼타임의 가장 큰 특징은 사용자의 말이 끝날 때까지 기다리지 않고 입력을 수집하는 능력으로, 대화 흐름을 실시간으로 판단하는 전이중 상호작용을 지원한다. 이로 인해 대화 차례 전환 기능이 모델 내부에 내장되어 있으며, 이는 기존의 외부 음성 활동 감지기(VAD)를 대체하는 역할을 한다. 바이트댄스의 내부 성과 평가에 따르면, 시드리얼타임은 기존 캐스케이드 구조보다 대화 리듬 문제를 절반으로 줄이는 성과를 기록하였다.

또한 이번 모델은 지난 4월에 공개된 전이중 음성 모델인 시드유플렉스(Seeduplex)의 기능을 영상으로 확장한 방식으로 설계되었다. 바이트댄스는 시드유플렉스가 복잡한 소음 환경에서도 오응답률과 오중단률을 각각 절반으로 낮췄다고 언급했으며, 특히 사용자가 머뭇거리는 동안 AI가 먼저 끼어드는 빈도는 40% 감소하였고, 대화 유창성 지표는 12% 개선된 것으로 나타났다.

더우바오는 음성과 화면을 동시에 처리할 수 있으며, 작업 오류를 신속하게 알리는 실시간 멀티모달 기능을 도입한 바 있다. 시드리얼타임은 이러한 기능을 바탕으로 텍스트 생성에 국한되었던 대화형 AI의 기능을 확장시켜 실시간 음성 통화, 화면 이해 및 영상 인식까지 포함하는 모델로 발전시킨 것이다.

그러나 이번 발표가 암호화폐 또는 블록체인와의 직접적인 연결성을 내포하고 있다는 점은 밝혀지지 않았다. 바이트댄스의 발표 자료에는 토큰 발행이나 블록체인 네트워크와의 연동 계획이 포함되지 않았으며, 기술 보고서, 파라미터 규모, 오픈소스 가중치 및 외부 개발자를 위한 API와 같은 추가 정보는 공개되지 않았다. 이러한 점들은 향후 바이트댄스가 해당 기술을 발전시키는 데 어떠한 방향으로 나아갈지에 대한 궁금증을 증대시키고 있다.

media&token=64ea2fa3-18fc-4c6d-8ae4-4d697f432ce0
0 Comments

공지사항


모바일