几百篇论文,怎么把钱花在值得细读的地方

假设你有几百篇 PDF,要从中找出使用某种实验方法的论文,提取数据集、指标和局限,最后整理成一张证据表。
这项工作里,登记标题、填写已有字段,与判断两个实验结果能否直接比较,花费的心力很不一样。前者有明确规则,后者可能需要反复读原文。让每个步骤都使用相同模型、相同推理强度,会把不少钱花在简单重复的工作上。
LightRead 把这些选择交给执行任务的 Agent:哪些部分可以同时做,用哪个模型,需要想多深,做完后怎样核对。研究者先说明目标、交付要求和预算,Agent 再据此安排工作。
同一批论文,可以有不同的读法
仍以这批 PDF 为例。主 Agent 可以先确定提取字段和判断口径,把可以独立完成的材料整理交给子代理,自己保留跨文献比较和结果整合。
派发时,每个子任务都可以选择不同的模型。规则明确的登记、提取和格式整理,可以优先使用能力足够的经济模型;遇到方法冲突、复杂推导或需要独立核验的结论,再安排适合这些工作的模型。选择来自用户已经开启的子代理模型目录,也遵循用户明确指定的模型。
推理强度也能随任务选择。对支持强度档位的模型,Agent 可以在派发或续跑时分别设定,让简单提取和复杂判断采用不同的投入。你不必逐个给执行者配置参数。
互不依赖的文献可以并行处理。某一篇卡在缺少附件或指标定义含糊上,不必让其他论文一起等待;它可以带着具体问题返回,再单独处理。并行规模则要考虑任务边界和剩余预算,每个子任务都需要带回明确的结果与来源。
并行会缩短部分等待时间,但额外的模型调用仍然有成本。 因此,主 Agent 需要判断拆分是否划算,也要检查合并后的表格有没有字段不一致、重复条目和缺失证据。批量处理的收益,应体现在最后可用的成果上。
Agent 能看到这项任务已经花了多少
LightRead 按用户发起的任务记录预算。主代理、派生子代理和纳入任务的收费工具,共用同一任务的费用统计;退款也会回到相应账本。Agent 在后续执行中可以读取已用金额,据此决定是否继续探索、派发或收尾。
如果工作接近完成,预算仍有余量,可以把时间用在原定交付的核验上:检查表格里的异常数值,补齐来源,确认代码能运行,把复现说明写清楚。剩余预算不意味着需要另开研究方向,也不要求把钱花完。
预算紧张时,Agent 应复用已有结果、停止没有进展的尝试,优先选择能胜任的低费率模型。无法完成原要求时,要保存已经完成的部分,说明还差什么;不能悄悄省掉必要核验,再把结果当成完整交付。
预算用尽后,系统会停止仍在运行的子代理并阻止新增派发,交由主 Agent 收尾。Agent 不能自行提高这次任务的预算。由于费用在调用后结算,已发出的请求和主代理收尾仍可能产生费用,因此这里的任务预算不能等同于支付前逐笔锁定的绝对金额上限。
你可以在下一轮增加预算,继续处理剩余部分,也可以换一个更经济的模型接着做。及时保存的文件、阶段结论和待办,让这种接续有明确起点。规划和执行的另一种分工方式,见 用高级模型规划,换经济模型执行。
长对话里,重复输入可以便宜很多
一次研究任务可能连续调用许多次模型。任务要求、工具说明和已经形成的对话历史,在相邻两次请求中往往有很大一部分相同。支持前缀缓存的模型服务,可以复用这部分处理结果,以更低的缓存读取价格计费,也减少重复处理的时间。Anthropic 的缓存说明解释了这种机制及不同模型的读写价格。
LightRead 的执行系统会维护稳定的会话标识,并按模型接口组织缓存断点;会变化的预算读数放在后续消息中,避免每轮改写前面的固定规则。不同服务的缓存接口并不相同,例如 Fireworks 的会话亲和设置用于提高相关请求复用缓存的机会。
我们查了 2026 年 9 月 23—29 日的实际用量记录。在纳入统计的 25,830 次云端 Agent 模型调用中,81.1% 的调用缓存命中率达到 90%,51.5% 达到 99%。把全部输入 token 合在一起计算,整体命中率为 91.1%。

统计范围:北京时间 9 月 23 日零点至 30 日零点发起的平台云端对话调用;保留已结算、未标记中断且输入量有效的记录,排除自带 Key。未命中缓存的调用也计入。每次命中率为缓存读取 token ÷ 完整输入 token;整体比例用 token 加权。数据与口径见统计说明。
这组记录以 DeepSeek V4.1 Flash 为主,占调用数的 73.0%。不同模型、任务长度与调用阶段的表现仍有差异,所以 99% 可以是实际达到的水平,却不应当写成每次请求的固定表现。
可以算一个例子:假设某模型的缓存读取单价是普通输入的十分之一,这一次请求有 99% 的输入命中缓存,其余 1% 按普通输入收费。那么这部分输入费用为 1% + 99% × 10% = 10.9%,约为全部按普通输入计费时的九分之一。

图:条件化的费用计算示例,非 LightRead 实测。比较同样数量的输入 token;不含缓存写入、输出、工具和算力费用。99% 是示例条件。
这解释了高缓存命中为什么值得关注。实际能省多少,仍取决于所用模型的价格、上下文变化、缓存有效期和写入成本;整项研究的账单还要加上输出、工具与算力费用。
LightRead 会展示调用中的缓存命中信息、费用,以及 TTFT(首个 token 等待时间) 等运行指标,便于观察长任务中哪一轮突然变慢、哪一段开始重复处理大量上下文。高命中率说明缓存得到了复用;判断模型服务来源还需要核对接入渠道,单凭命中率不能证明是否直连官方 API。
GPU 用完,先收结果,再结束占用
保存文献、运行普通整理脚本和查询资料,通常可以在云电脑上完成。需要训练模型或运行较重的推理时,再为相应阶段安排 GPU;已有实验室设备,也可以通过连接器接入。
通过对话租用 GPU 时,Agent 可以提出配置,界面展示型号、开机时间和费用预估,由用户确认。GPU 阶段结束后,Agent 可以调用结束工具,归档输出并关机,未使用的预扣运行费会退回。任务空闲与到期也有相应的收尾机制,减少完成计算后继续占卡的情况。
关机后停止收取 GPU 运行费。需要保留磁盘以便回查或续跑时,磁盘仍按规则计费;销毁才会释放机器并删除其文件。结果应先保存到云电脑,再根据需要决定是否继续保留。当前型号与价格可以在 算力配置查看。
重试和费用,也要能对上账
LightRead 自研的 Agent 执行系统(Agent Harness)负责组织模型调用、工具、子任务和恢复流程。遇到可重试的短暂网络故障,会按规则重连;需要继续处理的子任务,也可以保留上下文后续跑,减少从头整理材料的重复开销。
费用退还按具体失败环节处理。例如,文档导入失败会退回对应预扣额度,PDF 翻译等接入任务退款的处理也有失败补偿;GPU 则退回未使用的预扣运行费。已经成功完成的调用、主动中断时已经发生的用量,与这些退还项目分别结算。明细可以在 LLM 用量与额度记录核对。
研究者需要决定的是希望得到什么、愿意投入多少,以及什么样的证据才算完成。模型、推理强度和并行安排,应尽量由 Agent 根据这些要求处理。交付的 PDF、表格、代码和说明也可以一起下载带走,在下一轮或另一个工作环境里继续使用。