Testing the Reliability of ChatGPT for Text Annotation and Classification: A Cautionary Remark
Michael V. Reiss
Abstract
Testing the Reliability of ChatGPT for Text Annotation and Classification: A Cautionary Remark Michael V. Reiss***Department of Communication and Media Research, University of Zurich, Andreasstrasse 15, 8050 Zurich, Switzerland, m.reiss@ikmz.uzh.ch.
中文速览
用ChatGPT做文本标注听起来省时省力,但它有个致命缺陷——同样的输入不一定给出同样的答案。这项研究用一个真实任务(把网站文本区分为"新闻"或"非新闻")系统测试了ChatGPT零样本(zero-shot)分类的一致性,重点考察了温度参数(temperature)高低、提示词(prompt)措辞变化以及对完全相同输入的反复提交这三类因素的影响。结果令人警惕:仅把"classify"换成"rate"这样的微小改动,就能让一致性系数(Krippendorff's Alpha)跌破0.6,远低于学界公认的0.8可靠性门槛;即便提示词完全不变,高温度设置下反复提交同一输入也会得到相互矛盾的标签。好消息是,多次重复分类后取多数票可以明显提升一致性,但这样做成本倍增,也并非总能达标。这项研究提醒研究者:在没有人工标注数据作为对照验证之前,把ChatGPT当作"全自动"文本编码工具使用是不可靠的,相关软件宣称的"全自动数据编码"功能尤其需要审慎对待。
原文 arXiv:2304.11085;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2304.11085v1