会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
第七子007
博客园
首页
新随笔
联系
订阅
管理
上一页
1
2
3
4
5
6
···
22
下一页
2025年5月29日
LLM大模型:Absolute Zero: Reinforced Self-play Reasoning with Zero Data 0数据做post train RL
摘要: RL的领域越来越炸裂了,近期又有团队开源了 Zero Data 做reinforcement learning的方法:在post train阶段,做RL时 Absolute Zero data,听名字是不是很炸裂啊!先来回顾一下LLM领域做RL的历史阶段: 最早是PPO/DPO等方式,需要人工标注数
阅读全文
posted @ 2025-05-29 18:07 第七子007
阅读(339)
评论(0)
推荐(0)
2025年5月27日
SHAP:以bitcoin price预测为例的机器学习算法可视化解析
摘要: 1、传统机器学习按照目标划分,无非就是两种:分类、回归;不论是哪种,对于业务部门来说都有一大“硬伤”:可解释性!本人以前在某厂数据运营部做数据相关工作,平日里一大痛点:需要给业务人员做各种解释!比如使用xgboost发现某个账号被盗用的风险较大,提交运营人员后,别人会反问:为啥这个账号风险大?总要给
阅读全文
posted @ 2025-05-27 22:54 第七子007
阅读(363)
评论(0)
推荐(0)
2025年5月6日
LLM大模型:Qwen3解析
摘要: 5.1除了deepseek-prover-v2发布,Qwen也发布了3版本,官方展示的性能对比测试如下: 既然是官方发布的,效果肯定比友商的好,否则没必要发布出来了!那么灵魂拷问又来了:这么好的性能是怎么来的?大模型性能决定要素: 算力:迭代次数多,性能明显好 数据:互联网高质量数据筛选 网络架构:
阅读全文
posted @ 2025-05-06 22:47 第七子007
阅读(2745)
评论(0)
推荐(0)
2025年5月2日
LLM大模型: DeepSeek-Prover-V2浅析
摘要: 1、5.1假期,deepseek又整活了,不过这次并不是万众期待的R2通用推理模型,而是Prover-V2,主打 formal theorem proving in Lean 4,简单理解就是数学定理的证明,在几大数据集的测试结果如下: 所以现在大家最关心的是:这么好的效果,都是怎么做到的? 这次开
阅读全文
posted @ 2025-05-02 21:46 第七子007
阅读(451)
评论(0)
推荐(0)
2025年4月28日
LLM大模型:TTRL: Test-Time Reinforcement Learning分析
摘要: 1、现在大模型在pre-train完成后,肯定还要做post-train,主要目的是学会chat,并且对齐人类的偏好,主要方式就是SFT和RL,详见:https://www.cnblogs.com/theseventhson/p/18760256;做LLM,有三大要素:算力、算法、token数据了!
阅读全文
posted @ 2025-04-28 15:53 第七子007
阅读(761)
评论(0)
推荐(0)
2025年4月18日
抖音推荐算法部分模型概述
摘要: 抖音,一个世界级知名的app,全球拥有十亿级别的存量用户,其官方于近日发布了最核心的技术之一:推荐算法的部分模型,详见:https://95152.douyin.com/article/15358?enter_from=channel_page&channel=home 就其官方披露的信息看,抖音最
阅读全文
posted @ 2025-04-18 15:28 第七子007
阅读(730)
评论(0)
推荐(1)
2025年4月11日
LLM大模型:推荐系统应用-HLLM实战&DSIN
摘要: LLM在NLP领域独领风骚,一战成名!和NLP相比,推荐领域也有类似的业务场景:都是时序数据!既然LLM能在NLP大放异彩,在推荐领域是不是也能尝试一下了? 1、先简单总结一下推荐系统的发展历史 协同过滤 Collaborative Filtering:userCF、ItemCF;原理是根据user
阅读全文
posted @ 2025-04-11 17:38 第七子007
阅读(1097)
评论(3)
推荐(0)
2025年3月24日
LLM大模型:post-train实战 - 使用GRPO微调LLM
摘要: deepseek带火了GRPO,更带火了reinforcement learning,让研究人员发现RL能在pre-train的基础上较大提升LLM的逻辑推理能力!当前,互联网高速发展二十多年产生的优质数据已经使用殆尽,所以更大规模的LLM一直难产(GPT-5现在都还没发布,优质token耗尽是核心
阅读全文
posted @ 2025-03-24 22:30 第七子007
阅读(3979)
评论(1)
推荐(1)
2025年3月15日
LLM大模型:OpenManus原理
摘要: 继deepseek之后,武汉一个开发monica的团队又开发了manus,号称是全球第一个通用的agent!各路自媒体企图复刻下一个deepseek,疯狂报道!然而manus发布后不久,metaGPT团队5个工程师号称耗时3小时就搞定了一个demo版本的manus,取名openManus,才几天时间
阅读全文
posted @ 2025-03-15 23:40 第七子007
阅读(2760)
评论(0)
推荐(2)
2025年3月9日
LLM大模型:post-training方法概述
摘要: 现目前市面上主流大模型都是分步骤训练出来的: pre-train:让LLM具备初步的存储、记忆和理解知识的能力(目前互联网的优质token已经被耗尽,pre-train几乎走到了尽头,后续就看post-train了!) post-train:让LLM更精准、聪明,能适配某些垂直领域的特定任务!pos
阅读全文
posted @ 2025-03-09 11:40 第七子007
阅读(2649)
评论(0)
推荐(0)
上一页
1
2
3
4
5
6
···
22
下一页
公告