OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Paper β’ 2607.23855 β’ Published 9 days ago β’ 26
FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation Paper β’ 2601.23182 β’ Published Jan 30 β’ 21
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm Paper β’ 2511.04570 β’ Published Nov 6, 2025 β’ 242
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Paper β’ 2607.23855 β’ Published 9 days ago β’ 26
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation Paper β’ 2607.23855 β’ Published 9 days ago β’ 26
OpenMOSS-Team/MOSS-Transcribe-Diarize Audio-Text-to-Text β’ 0.9B β’ Updated 3 days ago β’ 214k β’ 354
Running on Zero MCP 1 MOSS-VL-Instruct-0708 π§ 1 Image and video understanding with MOSS-VL multimodal model
Running on Zero Agents 6 MOSS-Music-8B-Instruct π΅ 6 Analyze uploaded music and get detailed textual insights
Running on Zero Agents 6 MOSS-Music-8B-Instruct π΅ 6 Analyze uploaded music and get detailed textual insights