AI坐上文本裁判席,真的靠譜嗎
生成式AI普及之后,寫作這件事變得有些微妙。過去人們問“寫得好不好”,現(xiàn)在多了一個問題“這到底是不是人寫的”?AI檢測器正是在這樣的需求下,進入了人們的視野。它們分析文字中的語言特征,試圖判斷文本更像是人寫的,還是機器生成的。
美國《連線》雜志近日報道,作家米婭·巴拉德的小說《Shy Girl》曾被AI檢測公司Pangram判定為78%由AI生成。但巴拉德否認使用AI寫作。隨后,出版商Hachette取消了這本書在美國的出版計劃。
如今,Pangram、GPTZero等AI檢測產(chǎn)品已經(jīng)進入出版社、學(xué)校和科研機構(gòu)。一個原本用于輔助判斷的技術(shù),正在越來越多地參與實際決策。
AI檢測器正變得更準確
早期AI檢測主要依賴困惑度和突發(fā)性。困惑度衡量一段文字對語言模型來說有多“意外”,如果下一個詞很容易預(yù)測,困惑度通常較低。突發(fā)性則關(guān)注句子長短、結(jié)構(gòu)等變化。人類寫作往往長短錯落、起伏轉(zhuǎn)折,AI則偏愛整齊劃一、千篇一律。
但這種方法漏洞很明顯。一個文風嚴謹?shù)膶W(xué)者,或者一個英語不夠流利的非母語者,寫出來的東西很容易被誤判成AI。因此,一些高校一度停止或限制使用AI檢測工具。
隨著大模型的發(fā)展,以Pangram為例,它用海量人類文本和AI文本訓(xùn)練模型,還讓AI自己生成與真實文本相似的“鏡像文本”,專門挑那些容易被誤判的樣本反復(fù)訓(xùn)練。Pangram 4的技術(shù)報告顯示,在它們的測試數(shù)據(jù)里,英文文本的誤判率降到了0.0041%。《自然》雜志也提到,今年7月Epoch AI測試了495篇純?nèi)祟悓懙奈恼拢瑳]有發(fā)現(xiàn)Pangram出現(xiàn)誤判。
不過,這些數(shù)據(jù)主要來自企業(yè)自己的測試,第三方獨立評估還不夠。同時,檢測模型和生成模型都在快速迭代,今天表現(xiàn)良好的模型,明天可能就會面臨新的挑戰(zhàn)。檢測器給出的數(shù)字,不能直接當作事實。
“96% AI”不等于96%由AI寫成
《自然》雜志曾拿Frontiers出版社科研誠信總監(jiān)埃琳娜·維卡里奧的一篇文章去作檢測。維卡里奧表示,文章初稿和想法完全由自己完成,只在修改過程中讓AI潤色了一下,之后又經(jīng)過了人工編輯。然而,Pangram舊版本將這篇文章判定為100% AI生成,升級后的Pangram 4仍給出了96% AI的比例。
但這里的“96% AI”,并不是說文章中96%的內(nèi)容都是AI完成的。檢測器給出的“AI比例”,與作者實際使用AI的程度,并不是一回事。
Pangram解釋稱,“100% AI”并不是說文章中的每一個詞都是AI寫的。系統(tǒng)會把文章切分成不同片段,分別判斷這些片段更接近AI、人類還是兩者混合,再根據(jù)這些判斷計算整體比例。因此,“96% AI”更準確的含義是,檢測器認為這篇文本具有很強的AI生成特征,而不是認定作者有96%的內(nèi)容由AI完成。
今天的寫作早已不是“人寫”與“AI寫”的二元對立。一位作者可能獨立完成初稿,僅用AI修改措辭;也可能讓AI生成框架,再逐段重寫;還可能經(jīng)過翻譯、潤色、人工修訂等多道工序。然而,從檢測器的視角看,這些參與程度完全不同的寫作方式,最終產(chǎn)出的文本卻可能呈現(xiàn)相似的AI特征。
檢測結(jié)果本身也并非完全穩(wěn)定。《自然》的測試發(fā)現(xiàn),同一段文字,單獨檢測和放在完整文章中檢測時,分數(shù)可能不一樣。《連線》的測試也發(fā)現(xiàn),對文本進行一些修改后,檢測分數(shù)可能隨之改變。
一場沒有終點的“貓鼠游戲”
檢測器在升級,規(guī)避檢測的方法也在更新。市面上已經(jīng)出現(xiàn)了專門的人性化改寫工具,能把AI寫的句子重新組織一遍,換上更自然的詞,調(diào)整表達節(jié)奏,目的就是讓檢測器認不出來。研究顯示,經(jīng)過這種處理的AI文本,漏檢率會明顯上升。
讓AI模仿某個具體作者的風格,也是一條路徑。非營利研究機構(gòu)Epoch AI的一項獨立評估發(fā)現(xiàn),當AI被要求模仿特定作者的寫作風格時,部分生成文本能夠繞過檢測。
語言差異也增加了這種不確定性。一些非英語母語者使用AI翻譯或潤色后,文章反而更容易被判成AI生成。Pangram新版模型對此有所改善,但檢測結(jié)果仍可能受到語言背景和文本類型影響。
生成模型和檢測模型,就這么你追我趕,誰也停不下來。生成模型想方設(shè)法學(xué)著“說人話”,檢測模型就拼命尋找哪里還露出馬腳。檢測器更新之后,新的改寫工具或許又會出現(xiàn)。
檢測器應(yīng)是指南針而非判決書
對于學(xué)校、出版社和科研機構(gòu)來說,檢測器更適合承擔“篩查”的角色。對于學(xué)校、出版社和科研機構(gòu)而言,判斷一篇文章是否違規(guī)使用AI,還需要結(jié)合具體的使用情況。
據(jù)《自然》雜志報道,美國癌癥研究協(xié)會已經(jīng)使用Pangram檢查同行評議。一名審稿人因檢測結(jié)果異常受到詢問后,承認自己在評審意見中使用了AI。這樣的案例說明,檢測器確實可以幫助機構(gòu)發(fā)現(xiàn)異常,但從“發(fā)現(xiàn)異?!钡健按_認違規(guī)”,中間仍然需要人的判斷。
Pangram也建議,在處理AI學(xué)術(shù)誠信問題時,應(yīng)結(jié)合草稿、筆記、修改記錄和寫作過程等信息,而不能只看檢測分數(shù)。
檢測器可以告訴人們一段文字像不像AI生成,卻無法僅憑一個數(shù)字還原真實的寫作過程。隨著AI和檢測技術(shù)繼續(xù)發(fā)展,這個邊界可能還會不斷變化。
(科技日報 本報記者 張佳欣)
國內(nèi)新聞精選:
- 2026年09月23日 16:03:38
- 2026年09月23日 15:09:48
- 2026年09月23日 14:41:56
- 2026年09月23日 14:21:17
- 2026年09月23日 13:59:53
- 2026年09月23日 13:58:33
- 2026年09月23日 13:41:24
- 2026年09月23日 13:05:27
- 2026年09月23日 12:11:59
- 2026年09月23日 09:49:08
















































京公網(wǎng)安備 11010202009201號