arXiv怎么用:从关键词、分类号到每日论文追踪的实战检索流程
夜里十一点半,问题通常不是“找不到论文”,而是找得太多
实验室的暖气在窗边轻轻响,屏幕上开着十几个标签页,咖啡已经凉了。我第一次认真使用 arXiv,是为了追一篇扩散模型的预印本。标题只记得半句,作者也拼不准,Google Scholar 里结果像潮水一样涌来。那一晚我明白:arXiv预印本平台使用技巧,不在于点开搜索框,而在于把模糊的研究问题,拆成可验证的检索路径。
先说最实用的入口。arXiv 适合找计算机、数学、物理、统计、定量生物等领域的预印本。它不是正式期刊数据库,很多论文尚未同行评审,所以你要同时看版本号、提交日期、作者机构和是否已有会议接收信息。做arXiv论文下载时,优先下载 PDF,同时保存 arXiv ID,例如 2403.12345;这个编号比标题更稳定,后续引用、复查和找代码都靠它。
把检索变成一套流程:关键词、分类号、作者三条线并行
我现在检索一篇主题,通常不用一句自然语言硬搜,而是分三步。第一步,用英文核心词加同义词。例如做大语言模型检索,不只搜 “large language model”,还搜 “LLM”“instruction tuning”“retrieval augmented generation”。第二步,限定分类号。计算机常见有 cs.CL、cs.LG、cs.AI,统计学习可看 stat.ML。第三步,用作者名反查。如果你知道某个实验室或作者长期做这个方向,作者检索往往比关键词更干净。
在 arXiv 搜索框选择 Advanced Search,把关键词放入 Title 或 Abstract,而不是 All fields;这样噪声会明显下降。
用分类号过滤,例如只看 cs.CL,再按 Submitted date 排序,适合追新论文。
看到相关论文后,点开 References、Related papers,再记录 arXiv ID、版本号 v1/v2/v3 和代码仓库名。
用 Zotero 或 JabRef 保存 BibTeX。arXiv 页面通常能导出引用,但正式投稿前要检查是否已有会议版本。
如果你想做更可复现的arXiv检索教程,可以用 API 拉取结果。我常用下面这个命令快速检查某个主题近似结果数:
curl "https://export.arxiv.org/api/query?search_query=cat:cs.CL+AND+all:%22retrieval%20augmented%20generation%22&start=0&max_results=5&sortBy=submittedDate&sortOrder=descending"
在我一次测试中,同样搜索 “RAG”,All fields 返回结果里混入了不少非核心论文;改成短语 “retrieval augmented generation” 并限定 cs.CL 后,前 20 条中约 16 条与主题直接相关。这个比例不是绝对数字,但能说明一件事:检索质量来自约束,而不是运气。
追踪新论文与验证结果:让信息流安静下来
很多人问arXiv怎么用才不会每天被论文淹没。我的做法是建立一个小型“晨间收音机”:每个方向只保留 3 到 5 个检索式,每周固定检查一次。你可以订阅 arXiv 分类邮件,也可以用 Feedly、Inoreader 读取 RSS;如果习惯命令行,可用 Python 的 feedparser 定时抓取标题和摘要。关键词不要超过 6 组,否则你会重新回到噪声里。
一个可执行的追踪模板是:主题词一组,方法词一组,应用词一组。例如“graph neural network + molecular property prediction + uncertainty”。下载 PDF 后,不要急着读全文,先看四处:摘要最后两句、图 1、实验表格、Limitations。5 分钟内判断是否进入精读池。我的经验是,20 篇新论文里通常只有 3 到 5 篇值得精读,这不是偷懒,而是科研注意力的预算管理。
如何验证它真的有效:选一个你熟悉的主题,用旧方法搜索 15 分钟,记录可用论文数;再按“关键词同义词 + 分类号 + 作者反查”流程搜索 15 分钟。若后者的相关论文比例更高、重复结果更少,并且每篇都有 arXiv ID、PDF、BibTeX 记录,你的检索流程就已经跑通了。若下载速度不稳定,先尝试学校网络、官方镜像或错峰下载;确有跨地区访问需求时,也可以把 Roxi 这类工具作为备选方案之一:wizzegroup.com。但真正让夜晚安静下来的,仍是那套你亲手调好的检索方法。