Efficient_UG Collection Resources for “Understanding and Harnessing Sparsity in Unified Multimodal Models”, including the paper and efficient BAGEL-MoE checkpoints. • 3 items • Updated Jul 31 • 1
VLADrop Collection Resources for Drop-Then-Recovery (DTR), including VLADrop checkpoints for studying and recovering redundancy in vision-language-action models. • 1 item • Updated Jul 31 • 1
EffiR Collection Resources for paper “Making Large Language Models Efficient Dense Retrievers” (ACL 2026), including the paper and efficient Mistral-based dense retrie • 5 items • Updated Jul 31 • 1
Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models? Paper • 2606.27755 • Published Jun 26 • 6
view article Article Welcome Gemma 4: Frontier multimodal intelligence on device +5 merve, pcuenq, sergiopaniego, burtenshaw, Steveeeeeeen, alvarobartt, SaylorTwift • Apr 2 • 927
Demystifying When Pruning Works via Representation Hierarchies Paper • 2603.24652 • Published Apr 6 • 20
ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model Paper • 2603.22281 • Published Mar 23 • 22
Qwen2.5 Collection Qwen2.5 language models, including pretrained and instruction-tuned models of 7 sizes, including 0.5B, 1.5B, 3B, 7B, 14B, 32B, and 72B. • 43 items • Updated Mar 2 • 734
Making Large Language Models Efficient Dense Retrievers Paper • 2512.20612 • Published Dec 23, 2025 • 5
Understanding and Harnessing Sparsity in Unified Multimodal Models Paper • 2512.02351 • Published Dec 2, 2025 • 6
MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation Paper • 2511.09611 • Published Nov 12, 2025 • 72
When Visualizing is the First Step to Reasoning: MIRA, a Benchmark for Visual Chain-of-Thought Paper • 2511.02779 • Published Nov 4, 2025 • 60
Dense Video Understanding with Gated Residual Tokenization Paper • 2509.14199 • Published Sep 17, 2025 • 3
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning Paper • 2506.01713 • Published Jun 2, 2025 • 48
Router-Tuning: A Simple and Effective Approach for Enabling Dynamic-Depth in Transformers Paper • 2410.13184 • Published Oct 17, 2024 • 3
Capacity-Aware Inference: Mitigating the Straggler Effect in Mixture of Experts Paper • 2503.05066 • Published Mar 7, 2025 • 5
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning Paper • 2501.12948 • Published Jan 22, 2025 • 463