OpenMOSS-Team/moss-video-preview-realtime-sft
Video-Text-to-Text • 11B • Updated • 174 • 26
LLM
WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation