ToolVerifier: Generalization to New Tools via Self-Verification
Dheeraj Mekala*,♢,♠♢♠{}^{*,\diamondsuit,\spadesuit}start_FLOATSUPERSCRIPT * , ♢ , ♠ end_FLOATSUPERSCRIPT, Jason Weston♢♢{}^{\diamondsuit}start_FLOATSUPERSCRIPT ♢ end_FLOATSUPERSCRIPT, Jack Lanchantin♢♢{}^{\diamondsuit}start_FLOATSUPERSCRIPT ♢ end_FLOATSUPERSCRIPT, Roberta Raileanu♢normal-♢{}^{\diamondsuit}start_FLOATSUPERSCRIPT ♢ end_FLOATSUPERSCRIPT, Maria Lomeli♢normal-♢{}^{\diamondsuit}start_FLOATSUPERSCRIPT ♢ end_FLOATSUPERSCRIPT, Jingbo Shang♠normal-♠{}^{\spadesuit}start_FLOATSUPERSCRIPT ♠ end_FLOATSUPERSCRIPT, Jane Dwivedi-Yu♢normal-♢{}^{\diamondsuit}start_FLOATSUPERSCRIPT ♢ end_FLOATSUPERSCRIPT ♢♢{}^{\diamondsuit}start_FLOATSUPERSCRIPT ♢ end_FLOATSUPERSCRIPT Meta ♠♠{}^{\spadesuit}start_FLOATSUPERSCRIPT ♠ end_FLOATSUPERSCRIPT University of California San Diego
Abstract
Teaching language models to use tools is an important milestone towards building general assistants, but remains an open problem. While there has been significant progress on learning to use specific tools via fine-tuning, language models still struggle with learning how to robustly use new tools from only a few demonstrations. In this work we introduce a self-verification method which distinguishes between close candidates by self-asking contrastive questions during (1) tool selection; and (2) parameter generation. We construct synthetic, high-quality, self-generated data for this goal using Llama-2 70B, which we intend to release publicly. Extensive experiments on 4 tasks from the ToolBench benchmark, consisting of 17 unseen tools, demonstrate an average improvement of 22% over few-shot baselines, even in scenarios where the distinctions between candidate tools are finely nuanced.
中文速览
让大语言模型学会使用新工具、快速泛化到从未见过的API,是构建通用AI助手的关键难题。ToolVerifier提出了一套"自我验证"框架:先用合成数据微调模型完成工具选择,再通过自动生成对比性问题(contrastive verification questions)来区分最容易混淆的候选工具和参数,从而在工具选择和参数生成两个环节分别纠错、减少误差传播。在ToolBench基准的4个任务、17个未见过的真实API上,该方法比少样本提示基线平均提升22%,其中自我验证机制本身贡献了约8%的增益。这项工作的价值在于:无需对每种新工具重新微调,仅靠少量示例和一套轻量的验证机制就能大幅提升模型对陌生工具的泛化能力,为打造能持续适应工具生态变化的通用助手提供了实用路径。
原文 arXiv:2402.14158;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2402.14158v2