水印与掩码递归离散分布估计的极小极大界研究
原文:Minimax bounds for watermarked and masked recursive discrete distribution estimation
水印(watermarking)被提出用于在估计场景中识别合成样本,即在没有任何元数据可将其与真实样本区分开的情况下,但其确切影响尚未被探索。在没有区分机制的情况下,已有研究表明,加入合成样本会显著降低新增真实样本的边际效力。在本工作中,我们研究了存在水印时此类递归离散分布估计的极小极大损失,并与无辅助损失和oracle辅助损失进行对比。当真实样本比例渐近趋近于零时,我们给出一个下界,表明除非检测的假阴性率也趋近于零,否则不可能通过添加水印来提升性能。此外,我们证明在大多数情形下,一组简单的确定性估计器的最坏情况损失在常数因子内匹配相应的下界。最后,我们提出掩码(masking),一种随机化过程,能将其余情形下的差距缩小到一个Jensen差距。我们推测通过更紧的下界论证可以消除这一差距。