【科技】如何分辨AI撰寫學術文章？專家指留意標點以及這些單字

文：MenClub 魏文青　　
POSTED ON 19 Jun 2023

人工智能發展迅速，同時亦已經開始有人將其應用於日常生活嘅方方面面。而作為人類，除咗要學識如何使用人工智能幫助自己之外，更需要學識如何分辨由人工智能生成嘅內容，以確保接受最準確嘅資料。近日一班來自美國Kansas大學嘅學者，就開發出一個能夠分辨AI撰寫學術論文嘅文字分析模型，除咗準確度高達99%之外，其背後原理就連普通人都可以用下。

來自Kansas大學嘅Heather Desaire表示，目前由人工智能撰寫嘅文章有多個問題，而最大問題就係佢會不經Fact check嘅情況下，將資料庫內多篇文章混合，生成用家想要嘅文章，換言之文章內容可能係真假混合，而且難以分辨究竟邊一部份係啱，邊一部份係錯。所以佢哋就希望建立一個簡單、易用，連學生都可以自己設立嘅文字分析模型，協助大眾分辦文章，特別係學術文章是否由AI生成。於是佢哋搵黎64篇由真人撰寫嘅學術文章，再指示AI生成咗128篇類似嘅文章，再將兩組文章作對比，以搵出AI生成文章嘅「特色」。結果就發現「段落及句子長度」、「標點符號」以及「詞彙選用」三個可以用黎分辨AI生成文章嘅條件。
圖片：Distinguishing academic science writing from humans or ChatGPT with over 99% accuracy using off-the-shelf machine learning tools
研究團隊指，如果文章係由人寫嘅話，段落結構通常會比較複雜，每句句子嘅長度亦會變黎變去，但相比之下AI生成文章嘅段落及句子長度都會頗為相似，令整篇文章睇落去「工整」得多；另外，人類使用嘅標點符號亦會比較豐富，例如問號、括號等；最後，團體亦發現真人撰寫嘅文章，會大量出現「However」、「But」、「although」、「Because」等轉接詞 (同時亦反映出句子結構較為複雜)，而AI就好鍾意用「Others (其他人)」、「Researchers (研究員)」呢兩個單字。研究團隊表示，佢哋目前嘅模型能夠100%分辨出人工智能撰寫嘅學術文章，分辦人類擴寫嘅亦有92%準確性。但佢亦指出隨住AI技術發展，呢類「特色」好可能會有所改變。
資料來源：Distinguishing academic science writing from humans or ChatGPT with over 99% accuracy using off-the-shelf machine learning tools