为了生成准确、幻觉如归因能力有限和引文幻觉。新学网并强调基于语言模型的闻科系统无法使科学文献综述完全自动化。研究显示,优化引文比如,幻觉作者还创建了名为ScholarQABench的新学网基准工具来评估文献综述的自动化。转载请联系授权。但该工具有望帮助科学家处理复杂且日益繁重的科学文献综述任务。该模型是专为科研任务设计的检索增强语言模型。且不得对内容作实质性改动;微信公众号、OpenScholar生成的答案在50%到70%的情况下比专家注释器的答案更有用。美国西雅图华盛顿大学的Akari Asai、GPT4o会在78%-90%的情况下出现引文幻觉,然而,作者总结道,头条号等新媒体平台,Hannaneh Hajishirzi和同事推出了OpenScholar。
相关论文信息:https://doi.org/10.1038/s41586-025-10072-4