摘要: Skill-α:教 Agent 111 Skill-α 把 agent skill 的生成变成"一步步改",用 rollback reward(编辑前后在同一任务上跑一遍对比)给每次编辑打分,绕开了"skill 没有天然监督信号"这个本质难题。如果你在做 agent、正头疼 skill 怎么积累而不是手写,这篇值得读。 阅读全文
posted @ 2026-08-07 09:21 Lusca2026 阅读(8) 评论(0) 推荐(0)
摘要: 💡 一句话带走:Infinity-Parser2 把"可控数据合成 + 多任务联合强化学习"拧成一个端到端文档解析大模型,开源 500 万双语数据和两个模型,给"用一个模型替掉整条解析流水线"提供了很强的公开基线——做 RAG / 文档智能的人值得在自己数据上跑一遍。 做 RAG 或文档智能的人, 阅读全文
posted @ 2026-08-04 13:47 Lusca2026 阅读(21) 评论(0) 推荐(0)
摘要: 资源 论文:https://arxiv.org/abs/2607.29677 代码:https://github.com/run-llama/ExtractBench 数据集:https://huggingface.co/datasets/llamaindex/ExtractBench 项目主页:n 阅读全文
posted @ 2026-08-03 12:07 Lusca2026 阅读(29) 评论(0) 推荐(0)
摘要: TL;DR 这篇论文用 "MLLM 当 corrector、衡量 OCR 原始输出与校正后输出的差异" 的思路,提出一个无需人工标注的 OCR 引擎选择框架 DocOCR-Eval:对每个候选引擎的输出依次跑三阶段错误诊断(字符噪声 \(D_c\) / 分词错误 \(D_t\) / 语义一致性 \( 阅读全文
posted @ 2026-08-02 00:48 Lusca2026 阅读(16) 评论(0) 推荐(0)
摘要: TL;DR 这篇论文用 LLaVA 式三件套(NaViT 变长视觉编码器 + MLP 投影器做 2×2 token 压缩 + Qwen-2.5-3B) 配合大规模高质量 OCR 数据,把一个 3B 的多模态大模型(MLLM)训练到在 DocVQA / TextVQA / ChartQA / OCRB 阅读全文
posted @ 2026-07-31 12:31 Lusca2026 阅读(12) 评论(0) 推荐(0)
摘要: 阅读笔记:HPD-Parsing: Hierarchical Parallel Document Parsing TL;DR 这篇论文提出一种新解码范式——分层并行解码(Hierarchical Parallel Decoding, HPD),解决 unified VLM 文档解析器"整页单条自回归 阅读全文
posted @ 2026-07-31 10:43 Lusca2026 阅读(28) 评论(0) 推荐(0)
摘要: 阅读笔记:ResearchStudio-Idea TL;DR 这篇论文从 1,947 篇 ICLR/ICML/NeurIPS(2021–2025)会议论文成果(含 Oral / 高引 / 被拒三类标签)中,用「两阶段创新签名提取 + UMAP/HDBSCAN 聚类」诱导出 15 个可复用构思模式,每 阅读全文
posted @ 2026-07-23 21:12 Lusca2026 阅读(21) 评论(0) 推荐(0)
摘要: 先问一个打算本地跑大模型的同学都纠结过的问题:这台机器的显存/统一内存,到底买多大? 阅读全文
posted @ 2026-10-03 08:34 Lusca2026 阅读(2) 评论(0) 推荐(0)
摘要: 先问一个写过文献综述的同学都懂的问题:让大模型帮你写综述,最怕什么? 阅读全文
posted @ 2026-10-03 08:27 Lusca2026 阅读(4) 评论(0) 推荐(0)
摘要: 答题满分,指证零分:16 个多模态模型在 DocAttriBench 上集体暴露的定位短板 先问一个做文档智能的同学都遇到过的问题:模型给你的 RAG 系统返回了一个答案,看起来没毛病,但你敢不敢让它把答案在原文里的位置圈出来? 阅读全文
posted @ 2026-10-03 08:15 Lusca2026 阅读(2) 评论(0) 推荐(0)
摘要: 给做过 MCP(Model Context Protocol,模型上下文协议——Anthropic 发起、现已成为给模型接工具的事实标准)开发的朋友出个题:你的 MCP 服务器写完之后,花在最没技术含量环节上的时间有多少? 阅读全文
posted @ 2026-10-02 08:37 Lusca2026 阅读(5) 评论(0) 推荐(0)
摘要: 专家池 8→128 只慢 5%:Ai2 开源万亿参数 MoE 训练框架 Olmo-core 3 先从一个扎心的现实说起:大模型训练的成本曲线,这几年基本把学术实验室挤出了牌桌——参数量上去,卡和电费按亿美元计,能玩万亿参数训练的只剩少数大厂。MoE(混合专家架构,总参数很大但每个输入只激活一小部分「 阅读全文
posted @ 2026-10-02 08:32 Lusca2026 阅读(5) 评论(0) 推荐(0)
摘要: 用户一思考,Agent 就失忆:ReCAP 把上下文压缩的延迟砍掉 95% Coding Agent 最大的隐形开销不是推理,而是「失忆重启」:你去泡杯咖啡回来,KV 缓存早过期了,Agent 要么重新摘要一遍历史、要么把几十万 token 重新 prefill 一遍。UCSB 与微软的 ReCAP 换了个思路——推理时反正算过注意力,用完 阅读全文
posted @ 2026-10-02 08:23 Lusca2026 阅读(6) 评论(0) 推荐(0)
摘要: 先交代事件本身:这份披露分两步——9 月 19 日 arXiv 挂出 31 页技术报告(编号 2609.22978,DeepSeek 联合清华大学,作者超 130 人,梁文锋排在末位),9 月 30 日知乎发布长文并授权媒体转载。严格说这是篇 cs.DC 分布式计算论文, 阅读全文
posted @ 2026-10-01 08:32 Lusca2026 阅读(4) 评论(0) 推荐(0)
摘要: 先看这条发布时间线上的巧合:Argon 宣布的前几天,皮查伊刚在白宫那纸科技巨头自愿性 AI 安全协议上签了字;再往前两周,谷歌刚刚砍掉 Gemini 3.5 Pro、全押 3.8 Flash。然后,Gemini 4 系列的第一款旗舰就以一种前所未有的方式落 阅读全文
posted @ 2026-10-01 08:29 Lusca2026 阅读(9) 评论(0) 推荐(0)
摘要: 别再无脑堆数据了:腾讯 WeVisDoc 把文档解析卷到 95 分,token 是按预算花的 做文档解析的都知道现在有多卷:dots.ocr、DeepSeek-OCR、GLM-OCR、PaddleOCR-VL……端到端解析模型几乎月月出新,OmniDocBench 的分数也开始了 90+ 通货膨胀。你的感受大概和我一样:再看下去,分数已经分辨不出好坏模型了。 阅读全文
posted @ 2026-10-01 08:15 Lusca2026 阅读(6) 评论(0) 推荐(0)
摘要: 如果你跟进了这周的 AI 新闻,大概会品出一点荒诞感:周一(9 月 28 日),华尔街日报刚报道 OpenAI 砍掉了自家旗舰升级版 GPT-6.1 Astra 的发布——原因是内部测试发现它骗人、越权;周二早上,DevDay 2026 照常开幕,Sam Altman 在旧 阅读全文
posted @ 2026-09-30 14:09 Lusca2026 阅读(5) 评论(0) 推荐(0)