Breaking
ESAndy Burnham asume como primer ministro del Reino Unido y promete estabilidadESFlorian Lipowitz abandona el Tour de Francia por fractura de clavículaESEl Valencia busca el regreso de Largie Ramazani tras su exclusión del LeedsESJulio Martínez ratifica ante el juez que Zapatero marcaba los pasos en el rescate de Plus UltraESFrancia prohíbe el acceso a redes sociales a menores de 15 añosESEl 40% de los institutos españoles permite el móvil para uso educativoESIncendio en buque cargado con GLP en el Mar Negro cerca de RumaniaESEmpresas de IA destruyen libros para entrenar sus sistemasESAnálisis del gasto en salud y la reforma de la financiación autonómica en EspañaESFiscalía del Tribunal de Cuentas reitera solicitud de amnistía para ex altos cargos del Govern por gastos del procésESAndy Burnham asume como primer ministro del Reino Unido y promete estabilidadESFlorian Lipowitz abandona el Tour de Francia por fractura de clavículaESEl Valencia busca el regreso de Largie Ramazani tras su exclusión del LeedsESJulio Martínez ratifica ante el juez que Zapatero marcaba los pasos en el rescate de Plus UltraESFrancia prohíbe el acceso a redes sociales a menores de 15 añosESEl 40% de los institutos españoles permite el móvil para uso educativoESIncendio en buque cargado con GLP en el Mar Negro cerca de RumaniaESEmpresas de IA destruyen libros para entrenar sus sistemasESAnálisis del gasto en salud y la reforma de la financiación autonómica en EspañaESFiscalía del Tribunal de Cuentas reitera solicitud de amnistía para ex altos cargos del Govern por gastos del procés
Newsgather
BackNew Benchmark Tests AI Research Capabilities, China Unveils Autonomous LLM Agent
New Benchmark Tests AI Research Capabilities, China Unveils Autonomous LLM Agent
Tech
SCMP Economy2 hours agoTech1 min readChina

New Benchmark Tests AI Research Capabilities, China Unveils Autonomous LLM Agent

Quick Look

  • ResearchClawBench tests AI agents' research capabilities against human papers to see if they can match or exceed human authors.
  • Meanwhile, China's Qiushi Engine, an LLM-based agent launched by a Zhejiang University-led team, aims for 'end-to-end autonomous scientific discovery' in real physical environments.

AI-generated summary

Why It Matters

ResearchClawBench evaluates the ability of AI agents to conduct independent research by comparing their results against human-written papers. A new large language model-based agent, Qiushi Engine, has been launched to perform scientific research autonomously in real physical environments.

Font size

ResearchClawBench tests the ability of AI agents to independently carry out research and compares their results against reference papers written by humans to see if they can reach the same conclusions or even outdo the original authors.

The benchmark, created by a team led by the Shanghai Artificial Intelligence Laboratory, was designed to assess whether agents can really conduct the kind of tasks their creators say they can handle.

Qiushi Engine, which was officially launched by a Zhejiang University-led team last week, is a large language model-based agent designed to perform scientific research in real physical environments.

Its developers said that unlike some other existing systems that could be limited to performing specific tasks, Qiushi Engine was capable of “end-to-end autonomous scientific discovery”.

Open Questions

  • How will Qiushi Engine perform in real-world tests?
  • What specific scientific domains will Qiushi Engine focus on initially?

Related Topics

This article was originally published by SCMP Economy.

Related Stories

More on this topicai agents