Text generation Visual understanding Image generation and editing Video generation and editing World model Speech synthesis Audio generation Music generation Speech-to-text Speech-to-speech Omni-modal Embedding and rerank