Expectations and Practices around AI Disclosure in CS Research
Arati Mohapatra, Danish Pruthi
EMNLP 2026 (Findings)
cs.CY, cs.CL, cs.HC
2026-08-24
IISc对照109人调查与1.4万份披露:该报研究设计,实践里ICLR 96.5%报润色,EMNLP 98%缺责任声明。
顶会这两年几乎都要求论文披露生成式AI的使用。麻烦在于:报什么、什么时候报、报多细,政策经常自己说不清。读者和审稿人拿到一句「我们使用了AI辅助写作」,看不出作者把哪些智力活交给了模型。
印度科学理工学院(Indian Institute of Science)的Mohapatra和Pruthi把这件事拆成三问。现有政策到底规定了什么。研究者觉得哪些任务必须披露。已经交上去的声明实际写了什么。三者对不上,披露就变成走过场。
证据分三块,彼此独立。
政策盘点从CSRankings取65个顶会,看2025–2026周期有没有AI披露条款,再对照AAAI、ACL、ACM、IEEE四家学会政策,用Wayback Machine追到2023年初首次出台之后改过几次。
预期调查找了109名CS研究者,在LimeSurvey上给21项研究任务、3档人工介入程度打5点Likert量表。1分是不必报,5分是必须报。任务覆盖选题、研究设计、数据采集、数据分析、写作五个阶段。线性混合效应模型把任务类型和人工介入从个人打分习惯里拆出来:固定效应是任务和介入程度,随机截距吃掉「这个人一贯打高分或低分」。
实践审计从OpenReview拉ICLR 2026的19525篇投稿,从ACL Anthology拉EMNLP 2025 Main和Findings的3216篇录用稿,用Gemini 2.5 Flash抽出12577份ICLR声明和1290份EMNLP声明。抽取在100篇人工对照上F1为100%;细节标注micro-F1 96.5%,任务标注90.6%。
三档人工介入很直白。Assumed是问卷不点明,让人自己脑补默认监督。High是人主导、输出被仔细核过。Low是模型主导,人只松散看一眼。
65个顶会里35个有披露政策,其中29个几乎照抄学会文本,21个直接指向ACM署名政策。学会政策自2023年初出台后只改过1到4次,修订多是结构重排、补审稿人条款、加prompt injection处罚。ACL和ACM至少按「生成文本新不新」或「辅助研究还是辅助写作」划了要不要报的线。AAAI和IEEE基本只说「用了就报」。四家都没规定声明里必须写哪些字段。
调查均值2.95,95%置信区间[2.78, 3.13],整体落在「中等必要」。阶段上研究设计最该报,写作与报告最不该报。选题阶段均值只有2.86,低于「新想法必须透明」的直觉。任务之间能差一整档:生成合成数据集4.02,提出新假设3.54,翻译论文3.31,清洗重排数据3.24,改代码2.96,改图3.00,找文献2.46。人工介入低会把必要性抬高β=0.49,人工介入高会压低β=−0.44,两边都是p<0.001。
实践写的是另一套优先级。
| 指标 | ICLR 2026投稿 | EMNLP 2025录用 |
| 含披露声明 | 64%(12577/19525) | 40%(1290/3216) |
| 报「润色论文」 | 96.5% | 81.4% |
| 报「写或改代码」 | 16.1% | 23.3% |
| 报「生成合成数据」 | 2.1% | 2.5% |
| 报「翻译论文」 | 1.6% | 2.0% |
| 含责任声明 | 23% | 2% |
| 篇幅 | 41%为数句短段 | 91%只有1–2句 |
71%的受访者希望声明里有「作者对终稿负责」这一句。ICLR约一半声明会写「哪些任务没用AI」,而这是受访者最不在意的字段。点名具体模型的人不到一半。同一段披露原文出现在95篇互不相关的ICLR投稿里,检测器Pangram把它标成AI生成。声明写得再全,复制粘贴之后就不描述任何一篇论文实际用了什么。
对要交差的作者,这篇给出一张可执行的分级。均值≥3.5强制报:合成数据、理论框架、新假设。2.5–3.5建议报:实验设计、翻译、洗数据、写代码、起草正文。低于2.5可选:润色、找文献、排参考文献、拟标题。同时给了一份超过半数受访者想看到的模板字段,核心是任务、人工监督、责任声明。论文建议把模板嵌进会议LaTeX,把强制项单独放进投稿checklist。
对审稿人和会议椅子,数字说明现有政策在生产表演性合规。ICLR把声明做成正文独立节,EMNLP允许写在正文或checklist,两种设计抽出的任务分布几乎一样。只要求「有一节叫AI Disclosure」不够。
日常写论文的人会碰到一个直接后果:润色几乎人人报,合成数据和假设生成几乎没人报。按研究者自己的标准,优先级写反了。
作者自己列了三条。问卷靠方便抽样和滚雪球,愿意填的人本来就对披露有意见,更广人群的预期可能更弱、更散。范围只覆盖计算机科学。标注用了LLM judge,任务类别micro-F1是90.6%,低频任务上会有残差。
另外几处没钉死。109人相对65个顶会和上万份声明偏瘦,撑不起「全社区共识」。必要性评分是态度,不是观察真实使用率。「该报的不报」也可能是那些高必要性任务本来就用得少。论文提到了这个解释,但没有用量数据把它从隐瞒里拆开。95份重复声明被Pangram标成AI生成,检测器本身会误报;重复是硬事实,生成来源只是旁证。分级阈值3.5和2.5是作者建议,不是受访者投票出来的政策。伦理一节还提醒:披露翻译可能在审稿阶段暴露非英语母语身份,建议评审期遮蔽语言辅助项。