Multimodal Pretrained Models

 AudioCLIP: Extending CLIP to Image, Text and Audio

Comments

Popular posts from this blog

Humans Learn From Task Descriptions and So Should Our Models

Divergence Frontiers for Evaluating Deep Generative Models