background pattern
2026年10月22日 2026年10月23日

Advancing the science of AI agent evaluation and governance

地点: New York, NY, USA

注册


Thursday, October 22

9:00 AM – 10:00 AM

Check-in & breakfast social

Breakfast included

10:00 AM – 10:15 AM

Welcome & Workshop Overview

10:15 AM – 10:30 AM

Opening remarks

Sarah Bird: Chief Product Officer of Responsible AI, Microsoft

10:30 AM – 11:00 AM

Keynote 1: title

Zico Kolter: Professor, Carnegie Mellon University; Board of Directors, OpenAI

11:00 AM – 11:30 AM

Keynote 1: title

Yacine Jernite: ML & Society lead; Hugging Face

11:45 AM – 12:30 AM

Cross Sector Panel

12:30 PM – 2:00 PM

Lunch break

Lunch included

2:00 PM – 3:00 PM

Lightning talks (session 1)

  • 11:00 AM – 11:15 AM
    Lightning talk 1
  • 11:15 AM – 11:30 AM
    Lightning talk 2
  • 11:30 AM – 11:45 AM
    Lightning talk 3
  • 11:45 AM – 12:00 PM
    Lightning talk 4
3:00 PM – 3:30 PM

Lightning talks panel + Q&A

3:30 PM – 4:00 PM

Coffee break

3:30 AM – 4:30 PM

Lightning talks (session 2)

  • 3:30 PM – 3:45 PM
    Lightning talk 5
  • 3:45 PM – 4:00 PM
    Lightning talk 6
  • 4:00 PM – 4:15 PM
    Lightning talk 7
  • 4:15 PM – 4:30 PM
    Lightning talk 8
4:30 PM – 5:00 PM

Lightning talks panel + Q&A

5:00 PM onward

Happy hour & refreshments

Included

Friday, October 23

9:00 AM – 10:00 AM

Check-in & breakfast social

Breakfast included

10:00 AM – 11:00 AM

Lightning talks (session 3)

  • 10:00 AM – 10:15 AM
    Lightning talk 9
  • 10:15 AM – 10:30 AM
    Lightning talk 10
  • 10:30 AM – 10:45 AM
    Lightning talk 11
  • 10:45 AM – 11:00 AM
    Lightning talk 12
11:00 AM – 11:30 AM

Lightning talks panel + Q&A

11:30 PM – 1:00 PM

Lunch break

Lunch included

1:00 PM – 2:00 AM

Lightning talks (session 4)

  • 1:00 PM – 1:15 PM
    Lightning talk 13
  • 1:15 PM – 1:30 PM
    Lightning talk 14
  • 1:30 PM – 1:45 AM
    Lightning talk 15
  • 1:45 PM – 2:00 PM
    Lightning talk 16
2:00 PM – 2:30 PM

Lightning talks panel + Q&A

2:30 PM – 4:00 PM

Breakout group discussions

  • Group 1
    Evaluating long-horizon tasks and multi-agent coordination
  • Group 2
    Safety, red-teaming, and vulnerability assessment in autonomous agents
  • Group 3
    Domain specific evaluation and governance of agents
  • Group 4
    Societal impact of agentic economy
4:00 PM – 4:30 PM

Breakout group presentations & key takeaways

4:30 PM – 5:00 PM

Closing remarks & next steps in agent evaluation