Última hora
FRLes États-Unis lancent une nouvelle salve de frappes en IranFRCédric Jubillar avoue avoir tué son épouse DelphineFRLoi Duplomb : la pétition contre l'acétamipride dépasse le million de signatures, débat à l'Assemblée envisagéCRYPTO-FRPiratage du compte X de Marine Le Pen et du site du RN pour promouvoir un memecoin frauduleuxFRL'ambassadeur de France en Algérie propose d'augmenter les visas, provoquant des réactions à droiteFRIncendie majeur dans le Var : évacuations et mobilisation des secoursFRFermeture du tunnel de Saint-Cloud sur l'A13 en direction de la Normandie jusqu'en 2027FRLa France interdit l'accès aux réseaux sociaux aux moins de 15 ansFRLe nouveau Premier ministre Andy Burnham annonce une baisse de la TVA sur l'électricitéFRPlus de 40 personnes enlevées par un gang armé dans le nord-ouest du NigeriaFRLes États-Unis lancent une nouvelle salve de frappes en IranFRCédric Jubillar avoue avoir tué son épouse DelphineFRLoi Duplomb : la pétition contre l'acétamipride dépasse le million de signatures, débat à l'Assemblée envisagéCRYPTO-FRPiratage du compte X de Marine Le Pen et du site du RN pour promouvoir un memecoin frauduleuxFRL'ambassadeur de France en Algérie propose d'augmenter les visas, provoquant des réactions à droiteFRIncendie majeur dans le Var : évacuations et mobilisation des secoursFRFermeture du tunnel de Saint-Cloud sur l'A13 en direction de la Normandie jusqu'en 2027FRLa France interdit l'accès aux réseaux sociaux aux moins de 15 ansFRLe nouveau Premier ministre Andy Burnham annonce une baisse de la TVA sur l'électricitéFRPlus de 40 personnes enlevées par un gang armé dans le nord-ouest du Nigeria
Newsgather
AtrásNew Benchmark Tests AI Research Capabilities, China Unveils Autonomous LLM Agent
New Benchmark Tests AI Research Capabilities, China Unveils Autonomous LLM Agent
Tecnología
SCMP Economyhace 5 horasTecnología1 min de lecturaChina

New Benchmark Tests AI Research Capabilities, China Unveils Autonomous LLM Agent

En resumen

  • ResearchClawBench tests AI agents' research capabilities against human papers to see if they can match or exceed human authors.
  • Meanwhile, China's Qiushi Engine, an LLM-based agent launched by a Zhejiang University-led team, aims for 'end-to-end autonomous scientific discovery' in real physical environments.

Resumen generado por IA

Por qué importa

ResearchClawBench evaluates the ability of AI agents to conduct independent research by comparing their results against human-written papers. A new large language model-based agent, Qiushi Engine, has been launched to perform scientific research autonomously in real physical environments.

Tamaño de fuente

ResearchClawBench tests the ability of AI agents to independently carry out research and compares their results against reference papers written by humans to see if they can reach the same conclusions or even outdo the original authors.

The benchmark, created by a team led by the Shanghai Artificial Intelligence Laboratory, was designed to assess whether agents can really conduct the kind of tasks their creators say they can handle.

Qiushi Engine, which was officially launched by a Zhejiang University-led team last week, is a large language model-based agent designed to perform scientific research in real physical environments.

Its developers said that unlike some other existing systems that could be limited to performing specific tasks, Qiushi Engine was capable of “end-to-end autonomous scientific discovery”.

Preguntas abiertas

  • How will Qiushi Engine perform in real-world tests?
  • What specific scientific domains will Qiushi Engine focus on initially?

Temas relacionados

This article was originally published by SCMP Economy.

Noticias relacionadas

Más sobre este temaai agents