面向研究
两年之后依然站得住的结论
研究出问题,通常不是因为丢了一条笔记,而是因为没人拿得出某个说法的出处,也没人能证明今天存档里的东西就是当初写下的那份。
每个说法都带着它的出处
提一个问题,回来的答案带着它所取材的段落,每一段都写明文件名和其中的行号。不是一个相似度分数加一句「大概吧」,而是原文本身,以及它确实所在的位置。摘要和引用的区别,就在这里。
历史带签名,所以可以核对
一条笔记的每个版本,在写下的当时就被记录并做了密码学签名。日后任何人都能验证这条笔记事后没有被改过——包括你自己,当提问的人没有任何理由只听你一面之词的时候。
不知道的时候,它会说不知道
一个回答会被标为三种之一:有据、薄弱,或你的笔记撑不起来;而这个判定是拿你问题里的原话去核的,不是从一个相似度分数猜出来的。对研究来说,一个会编造引用的工具,比没有工具更糟。
实际是什么样
审稿人对论文里的一句话提出质疑
这句话是两年前写的。写它的人已经离开了。
你问保险库这个说法从哪来。它给回那条访谈笔记、确切的行号和日期。旁边是这条笔记的签名记录:写于哪一天,此后未变。你自己打开源文件——那就是一个文件夹里的 Markdown 文件,中间没有任何东西挡着——把那一段放回上下文里读一遍。
给审稿人的回答不是「我们认为是这样」,而是那一段原文、它所在的文件,以及一枚任何人都能验证的签名——不必来问我们要任何东西。
在你把真东西交给它之前
我能拿它处理我的数据吗?
检索在本地。生成去哪,由你指向哪。
找出该用哪些段落,永远发生在你的机器上。接下来怎么走由你选:接一个云端模型,检索到的段落就会送到那家厂商,和你自己把它们粘贴过去没有分别;把它指向一个跑在本地的模型,就什么都不会离开这台机器。第二个选项今天就能用,它把「我们的数据在哪里被处理?」变成了「就在你的设备上」。