復旦大學自然語言處理實驗室發佈模型魯棒性評測平臺 TextFlint

項目地址:

https://github.com/textflint

官方網站:

http://textflint.io/

論文鏈接:

https://arxiv.org/pdf/2103.11441.pdf

引言

近年來,隨着自然語言處理技術的不斷突破,深度學習模型在各項 NLP 任務中的表現正在穩步攀升。2018 年 1 月,在斯坦福大學發起的 SQuAD 閱讀理解評測任務中,來自微軟亞洲研究院的自然語言計算組所提出的算法率先趕超了人類。短短三年後,微軟的 DeBERTa 和谷歌的 T5+Meena 模型在包含了多種自然語言處理任務的綜合評測集合 SuperGLUE 上再次超越了人類。近日 IBM 號稱 “首個能在複雜話題上與人類辯論的 AI 系統” 的 Project Debater 登上了 Nature 雜誌的封面,該系統在 78 類辯題中獲得了接近人類專業辯手的平均評分。**我們不禁要問,人類真的被打敗了嗎? **

事實上,縱使這些 NLP 模型在實驗數據集上的表現十分驚人,在實際應用中我們卻很難感知到自然語言處理系統 “超越人類” 的語言理解水平。難倒這些看似 “聰明” 的模型,只需要一個簡單的 “逗號”,即便是基於赫赫有名的預訓練語言模型 BERT 的算法也不例外。

例如,“漢堡很好喫薯條一般” 對漢堡的評價是正面的,但當我們插入 “,” 時,一些模型就會將 “漢堡很好喫,薯條一般” 判別爲對漢堡的負面評價。一個微小且無關緊要的改動就能使自然語言處理系統失效,諸如此類的例子屢見不鮮。

魯棒性何爲

**爲何大殺四方的優秀模型在紛繁複雜的現實場景中紛紛折戟沉沙?**其中一個很重要的原因是此前缺乏對模型魯棒性的重視和深入探討,導致模型只能在特定語料中圈地爲王,在模型的效果評測中也僅僅關心在特定測試語料上的性能。如何幫助模型走出這樣的困局,給自然語言處理領域帶來質的飛躍,是實現下一步技術發展的緊要任務。

魯棒性是機器學習模型的一項重要評價指標,主要用於檢驗模型在面對輸入數據的微小變動時,是否依然能保持判斷的準確性,也即模型面對一定變化時的表現是否穩定。魯棒性的高低直接決定了機器學習模型的泛化能力。在研究領域中,許多模型只能在某一特定的數據集上呈現準確的結果,卻不能在其他數據集上覆刻同樣優異的表現,這就是由於模型對新數據中的不同過於敏感,缺乏魯棒性。

在現實世界的應用場景中,模型要面對的是更加紛繁複雜的語言應用方式,待處理的數據裏包含着更加龐雜的變化。一旦缺乏魯棒性,模型在現實應用中的性能就會大打折扣。在測試數據集上獲得高分是遠遠不夠的,機器學習模型的設計目標是讓模型在面對新的外部數據時依然維持精準的判斷。因此,爲了確保模型的實際應用價值,對模型進行魯棒性評測是不可或缺的。

方法 & 實驗

目前已有一些正在關注模型魯棒性的工作,但大多隻針對單個的 NLP 任務,或是隻使用了少量的數據變形方法,缺乏系統性的工具集合。針對這一問題,復旦大學自然語言處理實驗室展開了大規模的魯棒性測評工作,在桂韜博士、王梟博士、張奇教授、黃萱菁教授的主導下,20 餘位博士生和碩士生共同參與,歷時 9 個月,開發了面向自然語言處理的多語言魯棒性測評一站式平臺 TextFlint。 

TextFlint 包含針對 12 項 NLP 任務,設計了 80 餘種數據變形方法(20 餘種任務通用變形、60 餘種領域特有變形),涵蓋了領域相關黑盒變形、領域無關黑盒變形、白盒變形、分組抽樣、分析報告等等一系列功能。爲了確保數據變形方法符合語言使用,針對不同任務上的所有變形選取約 10 萬條變形後的語料進行了語言合理性(Plausibility)和語法正確性(Grammaticality)人工評測,確保了變形方法的可用性。使用者僅僅需要添加幾行代碼,就可以完成模型魯棒性的詳細檢測。

例如針對細粒度情感傾向分析 SemEval 2014 Restaurant 數據集,將 847 個帶有明顯情感詞的測試用例進行文本變換,使用轉換評論對象傾向性極性(RevTgt),轉換非評論對象傾向性極性(RevNon)和原句後增加干擾句(AddDiff)三種不同的變形分別生成了 847、582 和 847 個測試實例。10 種不同模型在上述變形語料上的分析結果如下所示:

從結果中可以看到,原始測試集上所有模型的精度(Accuracy)和宏平均 F1(Macro-F1)得分都非常高,平均精度接近 86%,平均宏平均 F1 達到 65%。但是,這些指標在變形後的三個新測試集上均有顯著下降。轉換評論對象傾向性極性變形使得模型的性能下降最多,因爲它要求模型更精準地關注目標情感詞。原句後增加干擾句變形導致非 BERT 模型的性能下降顯著,這表明大多數非預訓練模型缺乏將相關方面與無關方面進行區分的能力。

總結

大規模的其他領域測評結果也同樣顯示,現有算法在大多數任務的測評數據集上的表現都較原始結果有所下降。即便是基於大規模預訓練模型 BERT 的算法在一些任務的精度指標上也呈現了超過 50% 的降幅,這意味着這些算法在真實場景中幾乎是不可用的。從以上大規模的評測結果可以看出,目前絕大多數算法模型的魯棒性都亟待提升,這是一場無可迴避的技術攻堅。 

復旦大學自然語言處理實驗室希望通過 TextFlint 這一面向自然語言處理的魯棒性評測工具集合,爲研究人員提供一個便捷的模型魯棒性驗證方法,從而推動自然語言處理算法更好地應用於真實場景。同時,也呼籲將模型魯棒性納入模型評估的必要維度,推動自然語言處理技術實現有效良性的發展。在未來,復旦大學自然語言處理實驗室也將投入更多的人力和算力,進一步完善 TextFlint 工具的任務覆蓋範圍和模型驗證數量,並開展面向 NLP 任務的高魯棒可解釋模型的原創研究。

本文由 Readfog 進行 AMP 轉碼,版權歸原作者所有。
來源https://mp.weixin.qq.com/s/M3pY8vfiDaZw9yhZJqNcrg