0

Happy-LLM 学习笔记 07:从预训练到 LoRA,训练流程要先看数据和成本

第五章是手写一个小 LLM,第六章的重点则变成:真正做训练时,为什么大家通常不会一直停留在手写训练循环里。答案很现实,模型结构、数据处理、分布式训练、checkpoint 恢复、日志监控和参数高效微调,每一项单独看都不难,合在一起却很容易把实验搞乱。 这一章给我的最大启发是:训练流程不是“模型 fo ...

Hazy_star 发布于 2026-07-25 15:05 评论(0) 阅读(4)
1

在 JetBrains IDE 中接入 OpenCode 并配置自定义模型

OpenCode 是一款开源 AI 编程代理,目前在 GitHub 上拥有超过 16 万颗 Star,月活开发者超过 750 万。它支持终端、桌面应用和 IDE 扩展等多种使用方式,并且由于隐私优先的设计——不存储你的代码和上下文数据——在对隐私敏感的开发环境中也能放心使用。 OpenCode 的一 ...

SharpCJ 发布于 2026-07-25 14:29 评论(2) 阅读(83)
0

15天学会AI应用开发(十六)LangChain实现对话记忆功能

​模型本身是无状态的,也就是不具备记忆功能,单次对话无法留存上下文信息,多轮交互中会遗忘历史对话内容。用户之所以感觉AI工具拥有记忆,是因为AI工具给大模型封装了一层记忆。 LangChain作为主流的大模型应用开发框架,内置完善的记忆模块(Memory模块),能够高效管理对话历史记录,让AI实现逻 ...

aqi00 发布于 2026-07-25 11:50 评论(0) 阅读(74)
0

中文内容创作者,必装的 10 个 Skill

中文内容创作者,必装的 10 个 Skill在 AI 辅助创作的时代,工具的选择决定了内容的上限。与其让 AI 泛泛而谈,不如用专业的 Skill 把它变成你的专属编辑、设计师和研究员。以下为你精选了 10 个能显著提升中文内容创作效率与质量的 Skill,覆盖了从选题、写作、润色到视觉包装的全流程 ...

PetterLiu 发布于 2026-07-24 22:27 评论(0) 阅读(4)
0

面向智能体的入门指南

本文档面向希望通过 AI 智能体(Agent)接入阿里云向量检索服务 DashVector 的开发者,提供 LLM 可消费的 API 文档结构和快速入门指导。 ...

DashVector 发布于 2026-07-24 10:56 评论(0) 阅读(111)
0

把GEO托管做成可审计状态机:超级语言GEO的五类交付记录

企业不只需要监测账号和批量发稿,而应验收测量基线、事实证据、当前动作、公开回执和同条件复测。本文用TypeScript状态机说明品牌级GEO持续托管如何落地。 ...

超级语言 发布于 2026-07-23 17:36 评论(0) 阅读(10)
0

Happy-LLM 学习笔记 06:动手搭建一个小 LLM,最值得盯住哪些模块

这一章最有价值的地方,不是把一个完整的大模型“抄出来”,而是把一个小 LLM 从骨架、入口和训练三层拆开看。以前我总会先盯参数量和显卡,后来才发现,真正决定能不能跑通的,往往是模块之间的接口是否统一。 先把模型骨架搭对 k_model.py 里最先出现的是 ModelConfig。这件事看起来平常, ...

Hazy_star 发布于 2026-07-23 16:34 评论(0) 阅读(23)
0

低成本代码生成新范式:多模型协作能否媲美Claude Fable 5

【技术干货】低成本代码生成新范式:多模型协作能否媲美Claude Fable 5?在AI代码生成领域,高昂的模型费用与性能瓶颈始终是开发者心中的痛点。近期,一种“LongCat主写+Kimi/DeepSeek/小米Mimo等模型审查”的多模型协作方案引发热议,宣称效果堪比行业标杆Claude Fab ...

PetterLiu 发布于 2026-07-23 11:21 评论(0) 阅读(13)
0

Agent 工程思考:从 ReAct 到 Agent Harness

从 ReAct 出发,文章讨论 Agent 工程如何从“模型循环”走向 Harness:通过前后端共享的 State Schema、运行事实和 UI 边界,让模型行为变成可交互、可恢复、可控制、可追溯的产品能力。 ...

vivo互联网技术 发布于 2026-07-23 10:51 评论(0) 阅读(22)
0

Happy-LLM 学习笔记 05:LLM 的能力从哪里来,Pretrain、SFT、RLHF 各负责什么

读大模型训练流程时,我以前会把 Pretrain、SFT、RLHF 都笼统理解成“继续训练模型”。看完 Happy-LLM 第四章后,才真正把三者拆开:它们虽然都在更新参数,但解决的不是同一个问题。Pretrain 主要建立知识和语言能力,SFT 教模型理解并执行指令,RLHF 再把输出往人类偏好的 ...

Hazy_star 发布于 2026-07-23 10:51 评论(0) 阅读(17)
0

重磅发布 19 个视觉分析模型,涉及厂区消防安全、人员作业合规、工业设备与管线巡检、电子精密质检和农业种植监测等 10 大主流场景

iNeuOS_Vision平台模型适配食品加工、电力运维、油气管道、钢铁冶金、矿山煤炭、机械焊接、电子制造、园区安防、农业种植、车载安全十大主流行业,企业也可基于平台自主标注、训练专属行业检测模型,快速搭建轻量化、可落地的机器视觉智能管控系统。 ...

iNeuOS工业互联网系统 发布于 2026-07-23 09:56 评论(0) 阅读(115)
0

Happy-LLM 学习笔记 04:BERT、T5、GPT 到 LLaMA,预训练模型谱系怎么串起来

学完 Transformer 的基本结构后,再看预训练语言模型的发展,会发现很多模型名字并不是彼此割裂的。BERT、T5、GPT、LLaMA 看起来像不同时代的代表,底层其实都在回答同一个问题:我该使用 Transformer 的哪一部分,配什么预训练任务,才能把大量无标注文本转化成可迁移的语言能力 ...

Hazy_star 发布于 2026-07-22 20:40 评论(0) 阅读(26)
1

实测 Doubao-Seed-Evolving:把 Windows 桌面图标做成一个会自己运转的小世界

豆包 Seed 又更新了:一张永远“最新”的模型卡 这次豆包推出的不是一个过段时间就会落后的固定版本,而是 Doubao-Seed-Evolving:一个专门面向 Coding 和 Agent 场景的 latest 分支。Evolving 的核心就是按周持续更新。开发者不用隔一段时间追一次新模型,使 ...

努力的小雨 发布于 2026-07-22 17:36 评论(1) 阅读(172)
0

RAG初探:让 AIOps Agent 学会查询历史故障

LLM 并不了解企业内部系统,更不知道刚刚发生过的历史故障。本文将使用 Python 从零实现一个最简 RAG,通过关键词检索、Top-K 筛选和 Prompt 拼装,把运维知识库接入 AIOps Agent;并进一步讲清楚文档切分、Chunk 和向量检索的基本原理,让 Agent 的故障分析有据可... ...

it排球君 发布于 2026-07-22 10:38 评论(2) 阅读(114)
0

Happy-LLM 学习笔记 03:从 Embedding 到 Encoder-Decoder,手拆 Transformer

读完 Attention 之后,再看完整 Transformer,我最大的变化是:不再把它当成一张复杂结构图,而是把它拆成一条清晰的数据流。文本先被 tokenizer 变成 token id,再经过 Embedding 变成向量;向量加上位置编码后进入一层层 Encoder 和 Decoder;每 ...

Hazy_star 发布于 2026-07-22 10:36 评论(0) 阅读(28)
1

Hermes Agent 完全指南:比 Claude Code 更自由的开源 AI Agent,从安装配置到多 Agent 协作

Claude Code 好用,但模型锁死 Anthropic、月费不低、扩展能力有限。Hermes Agent 是 Nous Research 出品的开源 AI Agent 框架,模型随便换、完全本地运行,而且有一整套 Claude Code 没有的架构——Skill 自进化系统、Kanban 多 ... ...

不吃紫菜 发布于 2026-07-21 22:27 评论(0) 阅读(274)
0

Happy-LLM 学习笔记 02:把 Attention 看成可学习的信息路由

读第二章时,我最大的感受是:Attention 不是一个神秘模块,而是把“谁该看谁、看多少”这件事显式写进了模型。RNN 依赖顺序传递信息,长依赖和并行性都不理想;Attention 则把序列里每个 token 之间的关系一次性算出来,再让模型按相关性取信息。这个变化看起来只是计算方式不同,实际上却 ...

Hazy_star 发布于 2026-07-21 20:50 评论(0) 阅读(26)
0

麻了!我的 Claude 老账号也被封了…

大家好,我是R哥。 最近 Claude Code 又开始作妖了,又开始大规模封号了,我的陈年老号也被封了。。。 自从 Claude 出来就一直用这个账号,经历过 N 次大规模封号潮,从来没有出过事,这次真的逃不掉了…… 大家可能以为和 IP 啥的有关系,其实不是,我这个账号什么乱七八糟的 IP 都用 ...

Java技术栈 发布于 2026-07-21 15:14 评论(0) 阅读(40)
0

Happy-LLM 学习笔记 01:NLP 基础不是前置废话,而是理解 LLM 的地基

很多人第一次接触大模型时,都会把注意力直接放在 Transformer、Prompt、RAG 和 Agent 上。这样当然能很快看到结果,但一旦模型效果不稳定,或者检索、分词、上下文拼接出问题,就会发现自己缺的不是新概念,而是对 NLP 基础链路的理解。 这篇笔记记录我读 Happy-LLM 第一章 ...

Hazy_star 发布于 2026-07-21 10:33 评论(0) 阅读(40)
0

用一条安装回读路径区分 Letta Code 和 legacy server

Letta 的文档和仓库现在至少有三个需要分开的对象:Letta Code CLI、Letta Agent SDK,以及本仓库的 legacy Python server。先把对象分清,后面的版本、命令和故障才有意义。 当前 CLI 路径是 Node.js 22.19+ 加全局安装: node -- ...

weigangwin 发布于 2026-07-21 08:24 评论(0) 阅读(6)