![[科技奇點]Google Pixel 11 手語轉文字:AI 突破溝通藩籬實現科技平權 [科技奇點]Google Pixel 11 手語轉文字:AI 突破溝通藩籬實現科技平權](https://i0.wp.com/s.yimg.com/fz/api/res/1.2/h6yCNNGgqrLoFCAkUd34ug--~C/YXBwaWQ9c3JjaGRkO2ZpPWZpbGw7aD0xMDY7cHhvZmY9MDtweW9mZj0wO3E9ODA7dz0xNjA-/https://s.yimg.com/bo/5c3ef95b-c17f-5d20-b763-e6be81064595_1786269033577.jpg?ssl=1)
突破溝通藩籬:Google AI 手語轉文字技術問世
Google DeepMind 近期發表的 SL2T 模型,標誌著 AI 輔助科技在消費性裝置上的重大突破。這項技術首度整合進 Pixel 11 系列手機的 Gboard 與即時轉錄系統,讓聽障人士能直接以美國手語(ASL)進行搜尋、撰寫文件及即時對話,打破了傳統輸入法對聽障社群的溝通藩籬。
SL2T 的核心價值在於它不僅是單純的影像辨識,而是將手語視為具備獨立文法與詞彙的自然語言。透過訓練超過 10 萬小時的影像資料,模型能同時處理手部、軀幹及臉部表情等複雜動作,並將其轉譯為流暢的文字。
然而,此技術在推廣上也面臨挑戰。目前僅支援美國手語,如何確保未來擴展至全球 200 多種手語時,能精準捕捉各地區的文化差異與方言,成為技術普及的關鍵。此外,也有觀點提醒,若過度依賴技術,是否會忽略聽障社群在真實互動中對情感交流的深層需求。
儘管如此,各界對此技術多持正面肯定,強調 Google 與聽障社群合作開發的過程。本文認為,SL2T 的成功不僅在於演算法的優化,更在於其「以人為本」的開發策略。透過成立 AI 手語諮詢委員會(AISLAC),將聾人社群的實際需求納入技術迭代,這種跨領域的協作模式,或許正是未來 AI 輔助科技能否真正落實社會平權的關鍵指標。
技術挑戰與創新:超越單純的手部動作辨識
過去的手語辨識多受限於硬體設備,或僅能處理單一靜態手勢。SL2T 透過跨語言訓練,成功克服技術瓶頸,能精準捕捉包含軀幹、臉部表情與手部動作在內的全身性視覺資訊。這項技術不僅是硬體功能的升級,更體現了將手語視為具備獨立文法與詞彙之「自然語言」的觀點。
為了在確保辨識準確度的同時保護使用者隱私,Google 採取了手機與雲端協作的機制:手機端僅負責擷取臉部、手部及身體的關鍵點座標,再將這些數據傳輸至雲端進行翻譯,原始影像則完全不會上傳。這種將複雜視覺資訊轉化為輕量化數據的策略,不僅是技術上的突破,更是回應大眾對 AI 隱私疑慮的關鍵解方。
以人為本的開發:聽障社群的深度參與
這項技術的開發並非僅是演算法的堆疊,其核心在於跨越「技術開發」與「社群需求」之間的鴻溝。過去許多研究往往忽略手語的語言特性,且過度依賴實驗室環境,導致實際應用受限。
為了扭轉此局面,Google 邀請全球聽障組織與專家深度參與從研究、資料蒐集到測試的全過程。這種「共創」模式不僅確保了技術能針對左撇子、單手比手語等多元情境進行優化,更體現了以人為本的開發精神。透過將聽障社群的真實回饋納入開發迴圈,Google 試圖證明 AI 的價值不應僅止於提升運算效率,更應在於解決日常溝通中的痛點,讓數位環境能真正實現與口語及書面語言同等的包容性。
未來展望:邁向數位溝通的平權時代
隨著 Google 在最新 Pixel 11 系列手機中導入 SL2T 模型,數位溝通的平權願景正邁向新里程碑。這項技術讓聽障人士能透過手語直接進行網路搜尋、撰寫文件或與 Gemini 互動,打破了過去必須依賴打字溝通的數位藩籬。
儘管目前僅支援美國手語轉英文,但 Google 已明確規劃將此功能擴展至更多語言與裝置,並著手研發「文字轉手語」技術,目標是讓全球約 7,000 萬名手語使用者在數位環境中享有與口語使用者同等的地位。這項進展不僅是硬體功能的升級,更是科技巨頭試圖透過 AI 消除數位落差、實踐溝通平權的具體行動,為未來數位生活開創了更具包容性的可能性。
參考閱讀
,中央社 ・ 37 分鐘前
Google Pixel手機新增手語轉文字 聽障者溝通再進化 | 美股動態 | 國際 | 經濟日報, 聯合財經網
Google DeepMind發表手語翻譯AI SL2T可辨識全身動作並翻譯成文字 | ETtoday AI科技 | ETtoday新聞雲, ETtoday東森新聞雲
Google推出手語轉文字AI模型,讓手機看懂手語, iThome