会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
Xu_Lin
Do more; Learn more; Be more
博客园
首页
新随笔
联系
订阅
管理
1
2
3
4
5
···
8
下一页
[置顶]
博客导航
摘要: | 本站链接 | 标签 | 归档 | 笔记 | 随笔 | 杂的文 | 留言板 | 相册 | :postbox:关于 | | : : | : : | : : | : : | : : | : : | : : | : : | : : | | Code | modelscope | huggingface
阅读全文
posted @ 2021-01-20 16:03 Xu_Lin
阅读(174)
评论(0)
推荐(1)
2026年7月14日
SparkLM 192M 公平性修正消融实验报告
摘要: SparkLM 192M 公平性修正消融实验报告 生成时间: 2026-07-14 完成度: 36/36 组实验全部完成(12 配置 × 3 seeds) 训练规模: ~113M 参数级(Attention 110-134M / MoE 142-150M) 数据集: TinyStories 中英文合
阅读全文
posted @ 2026-07-14 10:54 Xu_Lin
阅读(10)
评论(0)
推荐(0)
2026年7月9日
SparkLM 31M → 192M 规模化验证深度报告
摘要: SparkLM 31M → 192M 规模化验证深度报告 生成时间:2026-07-09 训练规模:31M(2000 steps × 35 configs)→ 192M(5000 steps × 12 configs) 实际参数量:31M 级(27-49M)→ 192M 级(110-362M) 数据
阅读全文
posted @ 2026-07-09 11:48 Xu_Lin
阅读(5)
评论(0)
推荐(0)
2026年7月7日
SparkLM 完整技术报告:创新贡献、源码架构与消融实验
摘要: SparkLM 完整技术报告:创新贡献、源码架构与消融实验 ~49K LOC · 620 tests · 31M–34B 多尺度预设 · 35 配置消融实验 · 2026-07-06 目录 项目全景概览 原始创新模块(5 项) 工程系统贡献(6 项) 核心源码架构分析 模型架构图解 31M 全配置消
阅读全文
posted @ 2026-07-07 17:52 Xu_Lin
阅读(10)
评论(0)
推荐(0)
SparkLM 模型架构文档
摘要: SparkLM 模型架构文档 SparkLM-31M · Dense + MoE + MTP + MLA/GQA/SAHA + ECKVC + CRS 全组件架构总览 目录 图 1 · 整体架构总览 图 2 · MLA (Multi-head Latent Attention) 内部结构 图 3 ·
阅读全文
posted @ 2026-07-07 02:05 Xu_Lin
阅读(6)
评论(0)
推荐(0)
2026年7月6日
SparkLM 31M 全配置消融实验深度分析报告
摘要: SparkLM 31M 全配置消融实验深度分析报告 数据集:TinyStories 中英文混合 (1.6 GB, ~1.6B tokens) | Tokenizer:SimpleTokenizer (byte-fallback 中文支持) 训练:2000 steps × batch=32 × seq
阅读全文
posted @ 2026-07-06 23:52 Xu_Lin
阅读(8)
评论(0)
推荐(0)
2026年7月5日
OpenSeek-100B 预训练数据集分布分析报告
摘要: OpenSeek-100B 预训练数据集分布分析报告 数据集: BAAI/OpenSeek-Pretrain-100B 版本: v1.0 基础来源: CCI4.0-M2 v1 报告日期: 2025-07-05 数据规模: 79 个条目 | 109.73B Tokens | 11 大 Domain 目
阅读全文
posted @ 2026-07-05 19:09 Xu_Lin
阅读(16)
评论(0)
推荐(0)
The Cauldron 数据集分布分析报告
摘要: The Cauldron 数据集分布分析报告 数据集: HuggingFaceM4/the_cauldron 用途: Idefics2 视觉-语言模型微调训练数据 报告日期: 2025-07-05 数据集规模: 50 个子数据集 | 1,880,992 样本 | 424.6 GB 目录 执行摘要 数
阅读全文
posted @ 2026-07-05 18:35 Xu_Lin
阅读(10)
评论(0)
推荐(0)
2026年5月29日
多模态 Agentic AI 深度专题调研报告 (2024-2026)
摘要: 原生 Native 多模态 Agentic AI 深度专题调研报告 (2024-2026) 1. 执行摘要 2024 至 2026 年,人工智能领域最深刻的架构变革之一,是多模态系统从"模块化拼接"向"原生一体化"的范式转移。原生多模态(Native Multimodal)Agentic AI 摒弃
阅读全文
posted @ 2026-05-29 15:37 Xu_Lin
阅读(402)
评论(0)
推荐(0)
2026年5月11日
Codex API安装与配置指南
摘要: Codex 安装与配置指南 OpenAI Codex 完整使用说明书 概述 本指南将引导您完成 Codex 的注册、安装与配置全流程,分为以下三个主要步骤: 注册账号并获取 API 密钥 安装 Codex 命令行工具 配置 Codex 连接自定义服务 ⚠️ 提示:如果您已安装 Codex,可跳过第二
阅读全文
posted @ 2026-05-11 23:58 Xu_Lin
阅读(2085)
评论(0)
推荐(0)
2026年4月28日
YOLO十年进化:从速度与激情到未来与前沿
摘要: YOLO十年进化:从速度与激情到未来与前沿 YOLO十年进化:从速度与激情到未来与前沿 一、YOLO十年进化全景速览 自2015年YOLOv1横空出世,将目标检测重塑为单一的回归问题并首次实现真正的实时性能以来,YOLO系列模型开启了一段持续十年、波澜壮阔的技术演进之旅。这段旅程并非简单的版本迭加,
阅读全文
posted @ 2026-04-28 16:33 Xu_Lin
阅读(218)
评论(0)
推荐(1)
PEFT高效微调方法深度对比:LoRA、LoHA、DoRA、AdaLoRA及衍生变体
摘要: 在参数高效微调(PEFT)领域,LoRA 及其衍生方法通过低秩矩阵分解大幅降低了大模型微调成本。LoRA 是基础方法,以低秩乘积逼近权重更新,简单高效;LoHA 与 LoKr 分别利用 Hadamard 积与 Kronecker 积重构更新矩阵,在相同参数量下获得更高的理论秩;DoRA 将权重分解为
阅读全文
posted @ 2026-04-28 16:16 Xu_Lin
阅读(222)
评论(0)
推荐(0)
2026年4月24日
从DeekSeek V3到V4:技术路线演进、性能提升与创新突破
摘要: 从DeekSeek V3到V4:技术路线演进、性能提升与创新突破 一、DeepSeek-V3 核心架构与训练策略 DeepSeek-V3 是一个拥有 671B(6710亿) 总参数的混合专家(MoE)模型,其核心设计遵循 高总参、低激活 的经济高效原则,每个 Token 仅激活 37B(370亿)
阅读全文
posted @ 2026-04-24 15:41 Xu_Lin
阅读(201)
评论(0)
推荐(0)
2026年1月1日
goodbye2025,一个AI工程师的年终总结
摘要: 其他 待更新 LLamafactory贡献 https://github.com/hiyouga/LlamaFactory/releases/tag/v0.9.4 以上
阅读全文
posted @ 2026-01-01 00:49 Xu_Lin
阅读(64)
评论(0)
推荐(0)
2025年10月11日
【vLLM】使用vLLM部署Qwen3-VL-30B-A3B-Instruct
摘要: 环境与设备配置:H20*8(96G) MODEL_ID=Qwen/Qwen3-VL-30B-A3B-Instruct MODEL_NAME=Qwen3-VL-30B-A3B-Instruct python3 -m vllm.entrypoints.openai.api_server \ --mode
阅读全文
posted @ 2025-10-11 18:29 Xu_Lin
阅读(2828)
评论(3)
推荐(0)
2025年8月13日
强化学习相关框架汇总
摘要: 1、https://github.com/yaof20/Flash-RL 🔗 GitHub:https://github.com/yaof20/Flash-RL 🔗 Blog:https://fengyao.notion.site/flash-rl 2、verl by 字节:https://gi
阅读全文
posted @ 2025-08-13 15:55 Xu_Lin
阅读(278)
评论(0)
推荐(0)
2025年8月6日
【VLMEvalKit】使用VLMEvalKit进行多模态大语言模型的评测
摘要: 项目快速启动 1.运行环境 首先,确保你的开发环境已安装 Git 和 Python 3.7 及以上版本。接下来,通过以下命令克隆安装项目: 建议Python使用3.7及以上,这里用的是3.11; 建议预先安装Pytorch、Transformers、flash-attn等基础Python库,避免冲突
阅读全文
posted @ 2025-08-06 00:00 Xu_Lin
阅读(1035)
评论(0)
推荐(0)
2025年8月1日
【vibe coding】AI IDE配置(更新中)
摘要: 【vibe coding】AI IDE配置 Cursor windsurf Trae codeBunny Argument Claude-code gemini-cli qwen-code iflow cursor windsurf trae codebunny gemini-cli qwen if
阅读全文
posted @ 2025-08-01 17:54 Xu_Lin
阅读(128)
评论(0)
推荐(0)
2025年7月31日
多模态相关问题详解
摘要: 1. 对于不具备多模态能力的大模型,有哪些方式可以让之得到多模态感知能力?哪一种效果最好? 常见方式有: Adapter/Prompt Tuning(适配器/提示微调) 在原有大模型(如LLM)前面加上专门的多模态适配器(如视觉编码器),将图片、音频等模态的信息编码为文本token或embeddin
阅读全文
posted @ 2025-07-31 19:49 Xu_Lin
阅读(682)
评论(0)
推荐(0)
2025年6月27日
openseek-学习与复现记录
摘要: OpenSeek 致力于联合全球开源社区,推动算法、数据和系统方面的协作创新,目标是开发超越 DeepSeek 的下一代模型。 📌 项目概况 OpenSeek 是由北京人工智能研究院 (BAAI) 发起的开源项目,旨在联合全球开源社区,推动算法、数据和系统方面的协作创新,开发超越 DeepSeek
阅读全文
posted @ 2025-06-27 16:09 Xu_Lin
阅读(171)
评论(0)
推荐(0)
2025年6月20日
视觉语言模型vlm-2025:更好、更快、更强
摘要: 视觉语言模型 2025:更好、更快、更强 动机 视觉语言模型(VLMs)已成为当今人工智能领域的热门话题。自2024年4月的前一篇博客文章以来,该领域发生了巨大变化。模型变得更小但更强大,出现了新的架构和能力(推理、代理、长视频理解等)。与此同时,诸如多模态检索增强生成(RAG)和多模态代理等全新范
阅读全文
posted @ 2025-06-20 17:34 Xu_Lin
阅读(3076)
评论(0)
推荐(1)
1
2
3
4
5
···
8
下一页
公告