TrustLLM: Trustworthiness in Large Language Models – A principle and benchmark
Yue Huang1,2111Major contribution. 222Yue Huang and Lichao Sun are co-corresponding authors: 333Visiting Students at LAIR Lab, Lehigh University. Lichao Sun1111Major contribution. 222Yue Huang and Lichao Sun are co-corresponding authors: Haoran Wang3111Major contribution. Siyuan Wu4111Major contribution. 333Visiting Students at LAIR Lab, Lehigh University. Qihui Zhang4111Major contribution. 333Visiting Students at LAIR Lab, Lehigh University. Yuan Li5 333Visiting Students at LAIR Lab, Lehigh University. Chujie Gao4111Major contribution. 333Visiting Students at LAIR Lab, Lehigh University. Yixin Huang6111Major contribution. Wenhan Lyu7111Major contribution. Yixuan Zhang7111Major contribution. Xiner Li8111Major contribution. Hanchi Sun1 Zhengliang Liu9111Major contribution. Yixin Liu1111Major contribution. Yijue Wang10111Major contribution. Zhikun Zhang11111Major contribution. Bertie Vidgen12,45 Bhavya Kailkhura13 Caiming Xiong14 Chaowei Xiao15 Chunyuan Li16 Eric Xing17,43 Furong Huang18 Hao Liu19 Heng Ji20 Hongyi Wang17,44 Huan Zhang20 Huaxiu Yao21 Manolis Kellis22 Marinka Zitnik23 Meng Jiang2 Mohit Bansal21 James Zou11 Jian Pei24 Jian Liu25 Jianfeng Gao16 Jiawei Han20 Jieyu Zhao26 Jiliang Tang27 Jindong Wang28 Joaquin Vanschoren29 John Mitchell11 Kai Shu3 Kaidi Xu30 Kai-Wei Chang31 Lifang He1 Lifu Huang32 Michael Backes4 Neil Zhenqiang Gong24 Philip S. Yu33 Pin-Yu Chen34 Quanquan Gu31 Ran Xu14 Rex Ying35 Shuiwang Ji8 Suman Jana36 Tianlong Chen21 Tianming Liu9 Tianyi Zhou18 Willian Wang37 Xiang Li38 Xiangliang Zhang2 Xiao Wang39 Xing Xie28 Xun Chen10 Xuyu Wang40 Yan Liu26 Yanfang Ye2 Yinzhi Cao41 Yong Chen42 Yue Zhao26 1Lehigh University 2University of Notre Dame 3Illinois Institute of Technology 4CISPA 5University of Cambridge 6Institut Polytechnique de Paris 7William、Mary 8Texas A、M University 9University of Georgia 10Samsung Research America 11Stanford University 12University of Oxford 13Lawrence Livermore National Laboratory 14Salesforce Research 15University of Wisconsin, Madison 16Microsoft Research 17Carnegie Mellon University 18University of Maryland 19University of California, Berkeley 20University of Illinois Urbana-Champaign 21UNC Chapel Hill 22Massachusetts Institute of Technology 23Harvard University 24Duke University 25University of Tennessee, Knoxville 26University of Southern California 27Michigan State University 28Microsoft Research Asia 29Eindhoven University of Technology 30Drexel University 31University of California, Los Angeles 32Virginia Tech 33University of Illinois Chicago 34IBM Research AI 35Yale University 36Columbia University 37University of California, Santa Barbara 38Massachusetts General Hospital 39Northwestern University 40Florida International University 41Johns Hopkins University 42University of Pennsylvania 43Mohamed Bin Zayed University of Artificial Intelligence 44Rutgers University 45MLCommons
Abstract
Large language models (LLMs), exemplified by ChatGPT, have gained considerable attention for their excellent natural language processing capabilities. Nonetheless, these LLMs present many challenges, particularly in the realm of trustworthiness. Therefore, ensuring the trustworthiness of LLMs emerges as an important topic. This paper introduces TrustLLM, a comprehensive study of trustworthiness in LLMs, including principles for different dimensions of trustworthiness, established benchmark, evaluation, and analysis of trustworthiness for mainstream LLMs, and discussion of open challenges and future directions. Specifically, we first propose a set of principles for trustworthy LLMs that span eight dimensions. Based on these principles, we further establish a benchmark across six dimensions including truthfulness, safety, fairness, robustness, privacy, and machine ethics. We then present a study evaluating 16 mainstream LLMs in TrustLLM, consisting of over 30 datasets. Our findings firstly show that in general trustworthiness and utility (i.e., functional effectiveness) are positively related. For instance, LLMs like GPT-4, ERNIE, and Llama2, which exhibit strong performance in stere
中文速览
大型语言模型(LLM)如ChatGPT在各行各业的快速普及,使"能不能信任它"成为一个迫切需要回答的问题。研究团队为此构建了TrustLLM——一套覆盖真实性、安全性、公平性、鲁棒性、隐私和机器伦理六大维度、汇聚30余个数据集的综合可信度基准(benchmark),并据此系统评测了GPT-4、Llama2等16款主流LLM。结果显示:可信度与模型的实际能力总体正相关;闭源模型整体领先大多数开源模型,但Llama2等少数开源模型已接近闭源水平,同时也存在"过度保守"问题——把无害提问误判为有害而拒绝回答;此外,所有模型在刻板印象识别、复杂伦理推理、隐私保护等方面仍有明显短板,最强的GPT-4在刻板印象分类上准确率也仅65%。这项工作首次提供了横跨多维度、覆盖多模型的可信度全景评估,为开发者改进模型对齐策略、推动行业与学术界协作制定可信AI标准提供了重要参考。
原文 arXiv:2401.05561;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2401.05561v6