benchmark.
Listed 4Updated Sep 11, 2026
- Rank 1. OSWorld[NeurIPS 2024] OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environmentsapache-2.0 · linuxGitHub stars: 3.1k
- Rank 2. OpenSTLOpenSTL: A Comprehensive Benchmark of Spatio-Temporal Predictive Learningapache-2.0 · linuxGitHub stars: 1.1k
- Rank 3. OSWorld-V2OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasksapache-2.0 · linuxGitHub stars: 303
- Rank 4. XLingEvalCode and Resources for the paper, "Better to Ask in English: Cross-Lingual Evaluation of Large Language Models for Healthcare Queries"apache-2.0 · linuxGitHub stars: 202