Supplementary Material for Set Transformer
Juho Lee Yoonho Lee Jungtaek Kim Adam R. Kosiorek Seungjin Choi Yee Whye Teh
Abstract
The mean operator $\mathrm{mean}(\{x_{1},\ldots,x_{n}\})=\frac{1}{n}\sum_{i=1}^{n}x_{i}$ is a special case of dot-product attention with softmax.
中文速览
针对如何高效处理"集合"(set)这类无序输入数据的问题,研究者提出了一种名为 Set Transformer 的注意力机制框架,其核心创新在于引入了"诱导点"(inducing points)的 ISAB 模块,将自注意力的计算复杂度从元素数量 n 的平方级降至线性级。理论上,作者严格证明了该模型是置换不变函数空间中的通用函数逼近器,并说明均值池化、广义幂均值等经典聚合操作都可被其表达。实验在最大值回归、字符计数、混合高斯参数估计、异常检测和点云分类等多项任务上验证了模型的有效性,尤其在大规模数据(千至万量级元素)下,ISAB 仅需少量诱导点即可保持高精度并显著提速。这项工作为需要对集合数据建模的场景——如分子性质预测、点云理解和摊销推断——提供了一个兼具理论保障与实际可扩展性的统一工具。
原文 arXiv:1810.00825;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1810.00825v3