A 1B speech-generation model capable of receiving texts and audio as inputs. A bigger, fine-tuned version of the model went viral for its quality (see blog post too).