youtube.com/watch?v=MLZ1dU…
文档解析这活要的全是临场判断,llama_index 把 Jev 和 Jev 式模型的早期做法摆了出来。
试的几类任务照录。方向检测,这份 PDF 是横是竖;语言检测,这页是哪种文;还有路由,这类文件该往哪条线上送。都是四选一的题,一个字都用不着写。
拆文档那点判断先交给便宜的这半句是全场重心。前面斯坦福那篇讲的是千亿数据点过筛,这条把同一个思路挪到最不起眼的收件口。跟前面一人财务那篇呼应,那边筛发票,这边筛文件,都是先把答案列得全的那类活。跟前面只判不写那篇也接得上,迁移三问在这里正好派上用场,扫一眼能定的,就不必惊动大模型。
文档管道这个落点也挑得聪明。它量大、错误成本低、答案固定,是那种错了也容易被下一层拦住的活,正适合当第一块试验田。
我留的疑问有三处。准确率和原来那套规则比是升是降没给;处理一份文件省下的钱是几厘没算;视频里有没有给可抄的配置也没说。
手上有文档管道的,挑路由那一步先换,答案就那么几种,跑一周看它把文件送错的次数是多是少。
话题来源 @llama_index
26.2K阅读 ❤️29 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论
0 反应













