國家安全部今天發(fā)布安全提示文章,當(dāng)前,人工智能浪潮奔涌向前,各種新技術(shù)新應(yīng)用層出不窮。AI語音克隆作為深度合成技術(shù)的重要分支,憑借極小樣本、高仿真還原、輕量化操作等優(yōu)勢,在有聲讀物、無障礙服務(wù)、智能語音播報等領(lǐng)域釋放創(chuàng)新價值,為數(shù)字生活添便利、為產(chǎn)業(yè)發(fā)展賦動能。技術(shù)無善惡,濫用藏禍端。當(dāng)前,網(wǎng)絡(luò)黑灰產(chǎn)低成本復(fù)刻他人聲紋、偽造語音實施詐騙、惡意合成虛假言論等亂象滋生,嚴(yán)重擾亂社會秩序、侵害人民群眾財產(chǎn)安全,值得高度警惕。
聲音不再是唯一標(biāo)識
語音合成技術(shù)并不新鮮,但近年來相關(guān)技術(shù)更新迭代非常迅速,早期的語音合成系統(tǒng)只能生成機械感強烈的“電子音”,而今天的AI語音克隆技術(shù)已能在極短時間內(nèi)完成一個真實人聲的高仿真復(fù)刻。
——極為快速的采樣速度。主流商業(yè)平臺所需的最短訓(xùn)練樣本時長已從幾十分鐘壓縮到3至5秒。這意味著,一條隨手發(fā)出的語音消息、一段短視頻里的人聲片段、一通電話的簡短應(yīng)答,都可能被用來合成任意內(nèi)容的仿冒語音。
——極為逼真的合成語音。當(dāng)前語音克隆結(jié)果的自然度、情感還原度和口音相似度,已達(dá)到讓人難以分辨的水平。研究顯示,在沒有任何提示的情況下,普通人識別高質(zhì)量合成語音的準(zhǔn)確率不足50%。
——極為簡單使用操作。目前一大批在線平臺將“聲音克隆”功能向公眾開放,普通用戶無需專業(yè)技術(shù)背景,上傳樣本即可一鍵生成,操作與發(fā)送一條語音一樣簡便。
濫用滋生風(fēng)險
當(dāng)聲音可能被隨意偽造時,它所承載的信任價值將面臨被消解的風(fēng)險。從個人財產(chǎn)損失到公眾輿論失真,語音合成技術(shù)的濫用正滋生一系列新風(fēng)險。
——冒充親友,實施詐騙。不法分子會通過收集受害者家屬、好友的聲音樣本,合成帶有對方聲音特征的語音,編造車禍、疾病等緊急事由實施詐騙。由于聲音高度相似,受害者很容易上當(dāng)受騙。
——克隆聲紋,侵犯權(quán)益。國內(nèi)多個平臺出現(xiàn)了利用AI偽造影視明星、運動冠軍、知名專家聲音的音視頻,內(nèi)容涉及商業(yè)廣告、視頻配音、自媒體引流等,此類行為直接侵犯了自然人法定聲音權(quán)益。
——偽造語音,擾亂輿論。個別別有用心之人惡意克隆公職人員、行業(yè)權(quán)威及其他公眾人物的語音,拼接編造不實言論、虛假政策解讀、惡意抹黑話術(shù),通過社交媒體批量傳播,企圖煽動網(wǎng)絡(luò)輿情,誤導(dǎo)公眾認(rèn)知,影響社會穩(wěn)定。

國家安全機關(guān)提示
當(dāng)前,我國已基本形成集民事保護、行業(yè)監(jiān)管、刑事懲戒于一體的制度約束體系,為AI語音克隆應(yīng)用劃定了清晰法治底線。依據(jù)《中華人民共和國民法典》,對自然人聲音的保護參照適用肖像權(quán)保護的有關(guān)規(guī)定,未經(jīng)本人明確授權(quán),任何主體擅自克隆、合成、傳播他人可識別語音,均屬侵權(quán)行為,須承擔(dān)法律責(zé)任。根據(jù)《生成式人工智能服務(wù)管理暫行辦法》《互聯(lián)網(wǎng)信息服務(wù)深度合成管理規(guī)定》等國家級監(jiān)管規(guī)范,深度合成語音服務(wù)提供者必須落實平臺備案、用戶實名、授權(quán)核驗、溯源標(biāo)識等合規(guī)要求,嚴(yán)禁無約束聲紋克隆,禁止偽造虛假語音擾亂公共秩序。利用AI語音克隆實施電信詐騙、造謠抹黑、非法牟利等行為,觸犯刑法的,將依法從嚴(yán)追究刑事責(zé)任。
規(guī)范語音合成技術(shù)應(yīng)用,防范安全風(fēng)險,需多方協(xié)同共治。
網(wǎng)絡(luò)平臺須落實主體責(zé)任,清理違規(guī)工具功能,完善審核溯源預(yù)警機制;
行業(yè)從業(yè)者應(yīng)恪守科技向善底線,堅守合規(guī)創(chuàng)作準(zhǔn)則;
廣大群眾應(yīng)增強防范意識,謹(jǐn)慎保護個人聲紋信息,涉資金、隱私核驗務(wù)必進行多重驗證,遇侵權(quán)詐騙應(yīng)及時留存證據(jù)、舉報維權(quán),最大限度降低個人損失。(王莉)