摘要:
Skill-α 把 agent skill 的生成变成"一步步改",用 rollback reward(编辑前后在同一任务上跑一遍对比)给每次编辑打分,绕开了"skill 没有天然监督信号"这个本质难题。如果你在做 agent、正头疼 skill 怎么积累而不是手写,这篇值得读。 阅读全文
Skill-α 把 agent skill 的生成变成"一步步改",用 rollback reward(编辑前后在同一任务上跑一遍对比)给每次编辑打分,绕开了"skill 没有天然监督信号"这个本质难题。如果你在做 agent、正头疼 skill 怎么积累而不是手写,这篇值得读。 阅读全文
posted @ 2026-08-07 09:21
Lusca2026
阅读(8)
评论(0)
推荐(0)
摘要:
💡 一句话带走:Infinity-Parser2 把"可控数据合成 + 多任务联合强化学习"拧成一个端到端文档解析大模型,开源 500 万双语数据和两个模型,给"用一个模型替掉整条解析流水线"提供了很强的公开基线——做 RAG / 文档智能的人值得在自己数据上跑一遍。 做 RAG 或文档智能的人, 阅读全文
posted @ 2026-08-04 13:47
Lusca2026
阅读(21)
评论(0)
推荐(0)
摘要:
资源 论文:https://arxiv.org/abs/2607.29677 代码:https://github.com/run-llama/ExtractBench 数据集:https://huggingface.co/datasets/llamaindex/ExtractBench 项目主页:n 阅读全文
posted @ 2026-08-03 12:07
Lusca2026
阅读(29)
评论(0)
推荐(0)
摘要:
TL;DR 这篇论文用 "MLLM 当 corrector、衡量 OCR 原始输出与校正后输出的差异" 的思路,提出一个无需人工标注的 OCR 引擎选择框架 DocOCR-Eval:对每个候选引擎的输出依次跑三阶段错误诊断(字符噪声 \(D_c\) / 分词错误 \(D_t\) / 语义一致性 \( 阅读全文
posted @ 2026-08-02 00:48
Lusca2026
阅读(16)
评论(0)
推荐(0)
先问一个做文档智能的同学都遇到过的问题:模型给你的 RAG 系统返回了一个答案,看起来没毛病,但你敢不敢让它把答案在原文里的位置圈出来?
先从一个扎心的现实说起:大模型训练的成本曲线,这几年基本把学术实验室挤出了牌桌——参数量上去,卡和电费按亿美元计,能玩万亿参数训练的只剩少数大厂。MoE(混合专家架构,总参数很大但每个输入只激活一小部分「
Coding Agent 最大的隐形开销不是推理,而是「失忆重启」:你去泡杯咖啡回来,KV 缓存早过期了,Agent 要么重新摘要一遍历史、要么把几十万 token 重新 prefill 一遍。UCSB 与微软的 ReCAP 换了个思路——推理时反正算过注意力,用完
做文档解析的都知道现在有多卷:dots.ocr、DeepSeek-OCR、GLM-OCR、PaddleOCR-VL……端到端解析模型几乎月月出新,OmniDocBench 的分数也开始了 90+ 通货膨胀。你的感受大概和我一样:再看下去,分数已经分辨不出好坏模型了。
浙公网安备 33010602011771号