M Saad Salman
MSS444
AI & ML interests
None yet
Recent Activity
upvoted a paper about 3 hours ago
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks upvoted a paper about 3 hours ago
StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling upvoted a paper about 3 hours ago
Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory AgentsOrganizations
None yet