日本語訳
私たちは、より困難な種類の AI の進歩のための研究レベルのベンチマークである GeneBench-Pro を導入します。これは、エージェントが乱雑な生物学的データをどれだけうまくナビゲートし、適切な分析パスを選択し、実際の計算研究が依存する判断を下せるかということです。
本文
We’re introducing GeneBench-Pro, a research-level benchmark for a harder kind of AI progress: how well agents can navigate messy biological data, choose the right analysis path, and make judgment calls that real computational research depends on. https://openai.com/index/introducing-genebench-pro/