Dernière minute
ARإجلاء عشرات الآلاف في فرنسا وإسبانيا مع اتساع حرائق الغاباتARرومانيا تسقط طائرة مسيّرة في مجالها الجوي للمرة الأولى منذ بدء حرب أوكرانياARآلاف يفرون من حرائق الغابات في فرنسا وإسبانياARضربات إيرانية على قاعدة أمريكية في البحرين.. صفارات الإنذار وتصاعد الدخانARحادث برلين: شاحنة تدهس حشدًا في تيرغارتن، 1 ميت و17 مصاب - إشتباهات بعمليّة إرهابيةARبن عبد الرحمن وبن فرحان يبحثان العلاقات الثنائية وتحسين الأمن في المنطقةARحكومة اليمن تدعو المجتمع الدولي إلى موقف أشد حزماً تجاه الحوثيين بعد سقوط مقذوف بالقرب من ناقلة نفط في البحر الأحمرARدعوة الأمين العام للأمم المتحدة إلى وقف "الانتهاكات" في الجولان السوريARعمليات أمريكية ضد إيران "معلقة".. إيران تستثمر الهدنة وتزود قدراتها العسكريةARالتحالف العربي يعلن تنفيذ عملية عسكرية ضد أهداف حوثية في اليمنARإجلاء عشرات الآلاف في فرنسا وإسبانيا مع اتساع حرائق الغاباتARرومانيا تسقط طائرة مسيّرة في مجالها الجوي للمرة الأولى منذ بدء حرب أوكرانياARآلاف يفرون من حرائق الغابات في فرنسا وإسبانياARضربات إيرانية على قاعدة أمريكية في البحرين.. صفارات الإنذار وتصاعد الدخانARحادث برلين: شاحنة تدهس حشدًا في تيرغارتن، 1 ميت و17 مصاب - إشتباهات بعمليّة إرهابيةARبن عبد الرحمن وبن فرحان يبحثان العلاقات الثنائية وتحسين الأمن في المنطقةARحكومة اليمن تدعو المجتمع الدولي إلى موقف أشد حزماً تجاه الحوثيين بعد سقوط مقذوف بالقرب من ناقلة نفط في البحر الأحمرARدعوة الأمين العام للأمم المتحدة إلى وقف "الانتهاكات" في الجولان السوريARعمليات أمريكية ضد إيران "معلقة".. إيران تستثمر الهدنة وتزود قدراتها العسكريةARالتحالف العربي يعلن تنفيذ عملية عسكرية ضد أهداف حوثية في اليمن
Newsgather
RetourCode Arena Benchmark for Web Development
Code Arena Benchmark for Web Development
Tech
SCMP Economy27/05/2026Tech1 min de lectureChina

Code Arena Benchmark for Web Development

Assessing Model Capabilities in Building Interactive Web Apps

L'essentiel

Code Arena, a benchmark by researchers from UC Berkeley, UC San Diego, and Carnegie Mellon, evaluates AI models' ability to create complete web applications from scratch, with rankings based on blind user votes reflecting real developer preferences.

Résumé généré par IA

Taille de police

Alibaba owns the South China Morning Post. Unlike traditional coding benchmarks such as HumanEval or SWE-bench, which rely on standardised tests, Code Arena users test how well models can independently build complete, interactive web applications from scratch, based on user prompts. Users then vote on anonymised outputs in blind comparisons, meaning the leaderboard closely reflects the preferences of real-world developers. The benchmark is run by Arena, an organisation founded by researchers from the University of California, Berkeley in collaboration with University of California San Diego and Carnegie Mellon University.

Sujets liés

This article was originally published by SCMP Economy.

Articles liés

Plus sur ce sujetCode Arena