術(shù)誠信邊界)
1. 從一個真實的“烏龍”事件說起去年美賽MCM/ICM成績公布后我認識的一位學(xué)弟團隊經(jīng)歷了一場過山車。他們提交的論文在初步評審中獲得了“Meritorious Winner”一等獎的評定團隊上下歡欣鼓舞。然而幾周后他們收到了一封來自COMAP美賽主辦方的官方郵件通知他們論文因“疑似違反競賽規(guī)則”而被取消資格最終成績被標記為“Disqualified”取消資格。郵件內(nèi)容非常簡短只提到了“Unusual Similarity”異常相似性并要求他們?nèi)缬挟愖h可以申訴。整個團隊瞬間懵了他們反復(fù)確認絕對沒有抄襲、沒有購買成品、沒有使用任何違規(guī)的AI工具生成核心模型和論文正文。經(jīng)過緊張的材料準備和申訴又過了漫長的一個月他們才收到復(fù)核通知確認是誤判恢復(fù)了獎項。這件事讓我深刻意識到對于美賽這樣一項全球性的學(xué)術(shù)競賽其“反作弊”機制遠比我們想象的要復(fù)雜和嚴格而且其判定邏輯并非完全透明很多細節(jié)是參賽者容易忽略的“雷區(qū)”。今天我就結(jié)合這個案例以及多年來輔導(dǎo)和觀察的經(jīng)驗深入拆解一下美賽官方是如何判定作弊的以及我們該如何在規(guī)則內(nèi)安全地“航行”。2. 美賽反作弊系統(tǒng)的核心多重過濾與交叉驗證很多人以為美賽查作弊就是查重類似知網(wǎng)。這個認知是片面的甚至是有害的。美賽的反作弊是一個立體的、多層次的系統(tǒng)其核心目標不是抓住“作弊者”而是維護競賽的公平性和學(xué)術(shù)誠信。這套系統(tǒng)可以理解為幾道連續(xù)的過濾網(wǎng)。2.1 第一道網(wǎng)格式與基礎(chǔ)規(guī)則審查在論文進入實質(zhì)內(nèi)容評審前系統(tǒng)會進行自動化與人工結(jié)合的基礎(chǔ)審查。這部分主要針對硬性規(guī)則頁數(shù)限制嚴格檢查正文是否超過20頁2023年及之后規(guī)則附錄是否超過25頁。超頁會直接導(dǎo)致扣分甚至取消資格??刂凭幪柵c摘要頁檢查是否包含了正確的控制編號和摘要頁。摘要頁是獨立于正文頁數(shù)之外的但必須存在。文件格式與命名提交的PDF文件是否符合要求命名是否正確如2312345.pdf。團隊信息一致性注冊時填寫的隊員信息與最終論文署名是否一致。這部分看似簡單但每年都有團隊因疏忽在此翻車。例如有團隊將摘要算入了正文頁數(shù)導(dǎo)致超頁或者提交了錯誤的文件版本。這些“低級錯誤”會被系統(tǒng)快速標記可能影響后續(xù)評審的觀感甚至觸發(fā)更嚴格的審查。2.2 第二道網(wǎng)文本相似性檢測查重這是大家最熟悉的環(huán)節(jié)但美賽使用的系統(tǒng)和比對庫有其特殊性。比對庫主要包括歷年美賽優(yōu)秀論文庫、公開的學(xué)術(shù)數(shù)據(jù)庫如部分期刊、會議論文以及當(dāng)屆所有提交的論文。這意味著你抄襲往屆O獎?wù)撐?、抄襲網(wǎng)上某篇相關(guān)研究或者與其他參賽隊“交流”過度導(dǎo)致論文部分雷同都會被檢測出來。檢測重點摘要這是重中之重。摘要需要高度原創(chuàng)清晰概括你們的方法和結(jié)論。直接套用往屆摘要模板或大量使用常見套話可能導(dǎo)致相似度偏高。模型描述與假設(shè)對問題背景、模型假設(shè)的通用性描述如果完全照搬教科書或網(wǎng)絡(luò)資料也可能被標記。關(guān)鍵在于要用自己的語言重新組織。結(jié)論結(jié)論部分的獨創(chuàng)性也很關(guān)鍵。閾值與人工研判系統(tǒng)會生成一個相似度百分比報告但沒有一個固定的、公開的“合格線”。相似度報告會提交給評審委員會和仲裁委員會。他們關(guān)注的是“異常相似”的模式例如兩篇毫不相干的論文在模型核心推導(dǎo)部分出現(xiàn)大段重合或者一篇論文的摘要與某篇網(wǎng)絡(luò)資源高度相似。低比例的、不可避免的相似如對通用名詞的定義通常不會被追究。注意直接使用翻譯軟件將中文思路翻譯成英文論文是極度危險的行為。這不僅會導(dǎo)致語言生硬更重要的是如果多人采用類似的中文模板再翻譯其生成的英文文本結(jié)構(gòu)可能會呈現(xiàn)出詭異的相似性容易被系統(tǒng)捕捉到。2.3 第三道網(wǎng)模型與結(jié)果的“合理性”審查這是美賽反作弊的“高階”部分也是很多團隊意識不到的。評審專家和仲裁委員會成員都是經(jīng)驗豐富的教授和研究者他們具備強大的專業(yè)直覺。模型與問題的匹配度如果一個問題明顯需要用動態(tài)規(guī)劃或模擬而你的論文通篇只用了簡單的線性回歸卻得出了非常“漂亮”的結(jié)果這會引起懷疑。結(jié)果的“過于完美”在存在大量不確定性的實際問題中如果你的結(jié)果精確到小數(shù)點后很多位且與任何合理預(yù)期都完全吻合這反而不真實。合理的模型應(yīng)該能處理噪聲結(jié)果應(yīng)有適當(dāng)?shù)恼`差分析。代碼與論文的對應(yīng)關(guān)系雖然不要求提交代碼但論文中描述的算法、流程圖必須清晰、合理。如果描述了一個復(fù)雜的算法但給出的結(jié)果看起來像是用簡單方法就能生成的專家會質(zhì)疑其真實性。在申訴或爭議處理階段組委會可能會要求提供代碼、數(shù)據(jù)或計算中間過程進行驗證。可復(fù)現(xiàn)性邏輯論文中的步驟是否邏輯自洽他人根據(jù)論文描述是否能大致復(fù)現(xiàn)你們的工作。如果關(guān)鍵步驟缺失或邏輯跳躍巨大也會被標記審查。我那位學(xué)弟團隊的“烏龍”事件事后分析很可能就是在“模型合理性”環(huán)節(jié)被初步標記的。他們針對一個非線性優(yōu)化問題使用了一種改進的啟發(fā)式算法并在論文中引用了一篇較為冷門的參考文獻來佐證其有效性。巧合的是當(dāng)屆可能有另一支隊伍也引用了同一篇文獻并采用了類似的技術(shù)名詞表述框架。系統(tǒng)在文本相似性檢測中可能發(fā)現(xiàn)了這種“共引”和“術(shù)語簇”的相似結(jié)合他們模型結(jié)果的一些突出特性觸發(fā)了“異常相似”的警報從而進入了人工仲裁流程。2.4 第四道網(wǎng)跨團隊比對與行為模式分析這是針對集體作弊或購買“成品”論文的終極手段。當(dāng)屆論文橫向比對COMAP擁有當(dāng)屆所有提交的論文。計算機會對所有論文進行交叉比對尋找超出正常范圍的相似段落、相同的圖表數(shù)據(jù)、甚至相同的排版錯誤或字體。寫作風(fēng)格分析雖然不公開說明但高級的文本分析工具可以評估寫作風(fēng)格的一致性。如果一篇論文的不同部分如摘要、模型、結(jié)論在句式復(fù)雜度、詞匯選擇、學(xué)術(shù)風(fēng)格上存在顯著差異可能暗示有多人代寫或拼湊的痕跡。IP地址與提交行為雖然官方強調(diào)不基于IP判定但極端情況下如大量論文從同一IP地址或極小地理范圍提交這可能作為輔助信號結(jié)合內(nèi)容相似性進行綜合判斷。3. 哪些行為會被明確判定為作弊根據(jù)COMAP官方規(guī)則和歷年判例以下行為幾乎100%會導(dǎo)致被取消資格Disqualified購買或獲取現(xiàn)成的論文/解決方案從任何渠道獲取非本團隊獨立完成的成果。與競賽以外的任何人討論賽題或獲取思路包括咨詢老師、學(xué)長、網(wǎng)友等。團隊所有討論應(yīng)僅限于三名隊員內(nèi)部。使用禁用的人工智能工具生成論文內(nèi)容這是當(dāng)前最大的灰色地帶和風(fēng)險區(qū)。COMAP規(guī)則明確禁止使用AI生成“文本”Prose。這意味著用ChatGPT、Gemini等工具直接生成論文段落、摘要、模型描述是違規(guī)的。但是使用AI進行語法檢查、潤色表達、翻譯輔助非生成、或者作為編程工具如生成和調(diào)試代碼是允許的。關(guān)鍵在于“生成核心學(xué)術(shù)內(nèi)容”的邊界。抄襲直接復(fù)制粘貼任何來源書籍、論文、網(wǎng)頁、往屆賽題論文的句子或段落而不引用。團隊協(xié)作超出范圍兩個或多個參賽隊之間分享任何形式的成果。在競賽期間公開討論賽題在社交媒體、論壇等公共場所發(fā)布或討論賽題細節(jié)、解題思路。提交非參賽隊員完成的成果請他人代寫、代碼、代做模型。4. 高風(fēng)險行為與“灰色地帶”避坑指南很多隊伍并非故意作弊而是在一些“灰色地帶”操作不當(dāng)引火燒身。以下是我總結(jié)的避坑要點4.1 關(guān)于文獻與資料的使用可以做的閱讀任何公開的書籍、論文、網(wǎng)站資料來獲取知識背景。在文中合理引用。不能做的直接復(fù)制資料中的文字作為自己的描述。即使是“常識性”描述也務(wù)必改寫。例如描述“蒙特卡洛模擬是一種基于隨機抽樣的統(tǒng)計方法”這句話在很多資料里都有你必須換種說法如“我們采用蒙特卡洛模擬技術(shù)該技術(shù)的核心是通過大量隨機采樣來近似求解復(fù)雜問題的數(shù)值結(jié)果”。建議在文獻調(diào)研階段用自己理解的話做筆記而不是復(fù)制粘貼。寫作時關(guān)閉所有參考資料窗口憑自己的筆記和理解來撰寫。4.2 關(guān)于編程與計算工具可以做的使用任何軟件MATLAB, Python, R, SPSS等、任何庫、任何開源代碼包。使用AI助手如GitHub Copilot, ChatGPT來幫助編寫、調(diào)試或解釋代碼。高風(fēng)險行為直接使用網(wǎng)上找到的、針對該賽題的完整代碼或模型并將其結(jié)果作為自己的成果。即使你修改了參數(shù)其核心框架和算法思路如果不是你們獨立構(gòu)思的就存在風(fēng)險。建議將AI生成的代碼視為一個“高級搜索引擎”的結(jié)果。你必須完全理解每一行代碼的作用并能根據(jù)你們的具體模型進行調(diào)整和重寫。在論文中應(yīng)重點闡述你們?nèi)绾卧O(shè)計算法而不是僅僅貼出代碼。4.3 關(guān)于寫作與潤色可以做的使用Grammarly等工具檢查語法和拼寫。使用詞典和同義詞工具豐富表達。在競賽結(jié)束后可以請他人閱讀并提出修改建議但必須在提交前完成所有修改。絕對不能做的在競賽期間將你們的思路、模型描述或數(shù)據(jù)輸入給ChatGPT等工具并讓它“寫一段關(guān)于這個模型的論文段落”或“生成摘要”。這是典型的“生成文本”違規(guī)行為。高風(fēng)險區(qū)域用AI工具“重寫”Rewrite或“擴寫”Expand你們自己寫的句子。如果只是調(diào)整語序、替換同義詞風(fēng)險較低但如果AI完全改變了句子的學(xué)術(shù)內(nèi)涵或添加了原本沒有的論點就進入了危險區(qū)。建議最安全的做法是所有核心學(xué)術(shù)內(nèi)容問題重述、假設(shè)、模型建立、推導(dǎo)、結(jié)論的初稿必須由隊員親手寫出哪怕句子很生澀。之后可以基于自己寫的句子使用AI工具進行“polishing”打磨即只改善語言流暢度、糾正語法而不改變技術(shù)事實和邏輯。保留你們最初的草稿版本以備不時之需。4.4 關(guān)于團隊合作與外部溝通可以做的三名隊員之間任意討論。使用任何工具進行內(nèi)部溝通微信、騰訊會議等。絕對不能做的在比賽期間與任何非隊員包括指導(dǎo)老師、其他隊伍同學(xué)、線上網(wǎng)友討論賽題的具體內(nèi)容、模型思路、數(shù)據(jù)或結(jié)果。甚至在私人聊天中抱怨“這個題好難我們用了XXX方法”都可能構(gòu)成風(fēng)險雖然被發(fā)現(xiàn)的概率小但原則如此。建議比賽期間團隊自成一個信息孤島。所有資料查找都應(yīng)是“只讀”的即從公開渠道獲取信息但不向外輸出你們的任何進展。5. 如果被誤判申訴流程與材料準備就像我學(xué)弟團隊的經(jīng)歷誤判是有可能發(fā)生的。如果你堅信自己沒有違規(guī)可以申訴。申訴流程通常如下收到通知COMAP會發(fā)送正式郵件告知論文被標記并給出初步原因如“Unusual Similarity”。準備申訴信這是最關(guān)鍵的一步。申訴信不是情緒宣泄而是一份嚴謹?shù)摹稗q護狀”。態(tài)度保持尊重、冷靜、專業(yè)。內(nèi)容清晰陳述你們沒有違反任何規(guī)則。針對指控點進行逐條反駁。如果原因是“相似性”詳細解釋你們模型中任何可能與他人相似的部分是如何獨立得出的??梢蕴峁┧季S導(dǎo)圖、草稿紙記錄、軟件操作歷史日志如MATLAB命令歷史、Overleaf版本歷史作為證據(jù)。提供你們的工作過程證據(jù)這是最有說服力的。包括版本歷史Overleaf/Git的版本提交記錄顯示論文是如何一步步由簡到豐富寫成的。代碼開發(fā)記錄腳本文件的修改時間戳、帶有時間注釋的代碼版本。數(shù)據(jù)文件原始數(shù)據(jù)、中間處理數(shù)據(jù)、最終結(jié)果數(shù)據(jù)。團隊內(nèi)部聊天記錄關(guān)鍵部分顯示你們在比賽期間的討論過程注意抹去個人信息。解釋模型與結(jié)果的合理性從學(xué)術(shù)角度詳細闡述你們?yōu)槭裁催x擇這個模型結(jié)果為什么是合理的任何看似“突出”或“巧合”的地方都有其內(nèi)在邏輯。提交申訴在截止日期前通過官方指定渠道提交申訴信和所有證據(jù)。等待仲裁COMAP會有一個仲裁委員會重新審查論文和你們的材料。這個過程可能長達數(shù)周。收到結(jié)果最終裁定為維持原判或撤銷判罰。申訴的成功率取決于證據(jù)的扎實程度和指控的具體性質(zhì)。對于明顯的抄襲或購買行為申訴毫無意義。但對于因獨立研究巧合或AI使用邊界模糊導(dǎo)致的誤判充分的證據(jù)鏈是翻盤的唯一希望。6. 終極建議將學(xué)術(shù)誠信內(nèi)化為工作習(xí)慣與其戰(zhàn)戰(zhàn)兢兢地躲避規(guī)則不如從一開始就將學(xué)術(shù)誠信作為團隊的工作準則。獨立是金堅信你們?nèi)齻€人的智慧足以解決這個問題。所有想法從最蠢的開始自己推導(dǎo)、自己驗證。過程留痕養(yǎng)成隨時記錄的習(xí)慣。用Overleaf寫論文用Git管理代碼用共享文檔記錄每天的討論要點和決策。這些痕跡不僅是申訴的證據(jù)更是你們團隊協(xié)作的寶貴財富。理解而非套用對于任何引用的方法、代碼、公式確保每個隊員都理解其原理和在本問題中的應(yīng)用方式。這樣寫出來的文字才是你們自己的。誠實面對結(jié)果如果模型結(jié)果不理想分析原因并寫在論文里這比一個完美但無法解釋的結(jié)果更真實、更安全、也往往更能體現(xiàn)你們的工作量。賽后復(fù)盤比賽結(jié)束后可以公開討論對比其他隊伍的思路找出自己的不足。這才是參賽最大的收獲。美賽的魅力在于用96小時挑戰(zhàn)一個開放性問題這個過程本身的價值遠大于獎項。官方嚴格的反作弊機制雖然有時會帶來“誤傷”的陣痛但根本上是為了守護這份價值的純粹性。清晰了解規(guī)則在界限內(nèi)盡情發(fā)揮你們的創(chuàng)造力這才是通往成功最穩(wěn)健的道路。記住你們產(chǎn)出的不僅僅是一篇論文更是一個關(guān)于團隊、關(guān)于思考、關(guān)于誠信的完整故事。