Compressing Encoder (TBF)

 On Sparsifying Encoder Outputs in Sequence-to-Sequence Models

Learned Token Pruning for Transformers

Comments

Popular posts from this blog

Humans Learn From Task Descriptions and So Should Our Models

Divergence Frontiers for Evaluating Deep Generative Models