Frontier CoreML audio models for iOS/macOS — local speech-to-text, TTS, VAD, and speaker diarization
Instant zero-shot voice cloning with granular style control, by MIT & MyShell