摘要: Skill-α:教 Agent 111 Skill-α 把 agent skill 的生成变成"一步步改",用 rollback reward(编辑前后在同一任务上跑一遍对比)给每次编辑打分,绕开了"skill 没有天然监督信号"这个本质难题。如果你在做 agent、正头疼 skill 怎么积累而不是手写,这篇值得读。 阅读全文
posted @ 2026-08-07 09:21 Lusca2026 阅读(1) 评论(0) 推荐(0)
摘要: 💡 一句话带走:AWS 的 IDP AutoOpt 派一个跑在闭环里的 LLM agent(评分 → 逐字段诊断错误 → 改配置 → 重评),把一整条文档处理流水线的配置(prompt、模型、OCR、schema、结构)自动调到人类专家水平,号称 2 小时干完几周的活、还更省钱。做 RAG / 多 阅读全文
posted @ 2026-08-05 15:53 Lusca2026 阅读(0) 评论(0) 推荐(0)
摘要: 💡 一句话带走:Infinity-Parser2 把"可控数据合成 + 多任务联合强化学习"拧成一个端到端文档解析大模型,开源 500 万双语数据和两个模型,给"用一个模型替掉整条解析流水线"提供了很强的公开基线——做 RAG / 文档智能的人值得在自己数据上跑一遍。 做 RAG 或文档智能的人, 阅读全文
posted @ 2026-08-04 13:47 Lusca2026 阅读(2) 评论(0) 推荐(0)
摘要: 资源 论文:https://arxiv.org/abs/2607.29677 代码:https://github.com/run-llama/ExtractBench 数据集:https://huggingface.co/datasets/llamaindex/ExtractBench 项目主页:n 阅读全文
posted @ 2026-08-03 12:07 Lusca2026 阅读(5) 评论(0) 推荐(0)
摘要: TL;DR 这篇论文用 "MLLM 当 corrector、衡量 OCR 原始输出与校正后输出的差异" 的思路,提出一个无需人工标注的 OCR 引擎选择框架 DocOCR-Eval:对每个候选引擎的输出依次跑三阶段错误诊断(字符噪声 \(D_c\) / 分词错误 \(D_t\) / 语义一致性 \( 阅读全文
posted @ 2026-08-02 00:48 Lusca2026 阅读(6) 评论(0) 推荐(0)
摘要: TL;DR 这篇论文用 LLaVA 式三件套(NaViT 变长视觉编码器 + MLP 投影器做 2×2 token 压缩 + Qwen-2.5-3B) 配合大规模高质量 OCR 数据,把一个 3B 的多模态大模型(MLLM)训练到在 DocVQA / TextVQA / ChartQA / OCRB 阅读全文
posted @ 2026-07-31 12:31 Lusca2026 阅读(2) 评论(0) 推荐(0)
摘要: 阅读笔记:HPD-Parsing: Hierarchical Parallel Document Parsing TL;DR 这篇论文提出一种新解码范式——分层并行解码(Hierarchical Parallel Decoding, HPD),解决 unified VLM 文档解析器"整页单条自回归 阅读全文
posted @ 2026-07-31 10:43 Lusca2026 阅读(6) 评论(0) 推荐(0)
摘要: 阅读笔记:ResearchStudio-Idea TL;DR 这篇论文从 1,947 篇 ICLR/ICML/NeurIPS(2021–2025)会议论文成果(含 Oral / 高引 / 被拒三类标签)中,用「两阶段创新签名提取 + UMAP/HDBSCAN 聚类」诱导出 15 个可复用构思模式,每 阅读全文
posted @ 2026-07-23 21:12 Lusca2026 阅读(9) 评论(0) 推荐(0)
摘要: 💡 一句话带走:Skill-α 把 agent skill 的生成变成"一步步改",用 rollback reward(编辑前后在同一任务上跑一遍对比)给每次编辑打分,绕开了"skill 没有天然监督信号"这个本质难题。如果你在做 agent、正头疼 skill 怎么积累而不是手写,这篇值得读。 阅读全文
posted @ 2026-08-06 17:21 Lusca2026 阅读(2) 评论(0) 推荐(0)
摘要: 💡 一句话带走:字节 2026 年 8 月的技术报告 SwanTale 用一套统一框架(SwanVAE 连续 latent + Flow-matching Transformer + Unified MoE + GRPO 后训练)同时做好了两件原本要分开做的事——用自然语言 caption 当「导 阅读全文
posted @ 2026-08-05 17:57 Lusca2026 阅读(2) 评论(0) 推荐(0)
摘要: 💡 一句话带走:阿里把旗舰 Qwen3.8-Max(2.4 万亿参数、95B 激活、1M 上下文、原生看图看视频)发了,还宣布下周开源权重——这是 Max 系列头一回开源。多模态和"自主跑十天"的编码能力是真亮点,但标准编码基准它还排在 Claude Fable 5 后头;社区有人退订 Anthr 阅读全文
posted @ 2026-08-04 18:01 Lusca2026 阅读(19) 评论(0) 推荐(0)