会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
第七子007
博客园
首页
新随笔
联系
订阅
管理
上一页
1
2
3
4
5
6
7
8
···
22
下一页
2024年12月4日
LLM大模型: CV领域常见attention思路变种及其作用(二)
摘要: attention机制的效果非凡,但本身也是有缺陷的:Q*K矩阵的复杂度高达O(n^2);如果用在CV领域,还涉及到如下问题: 局部性、全局性 稀疏性 多尺度问题 为了更好地把attention机制应用于CV,上述的几个问题是需要解决的! 1、DilateFormer: Multi-Scale Di
阅读全文
posted @ 2024-12-04 11:45 第七子007
阅读(372)
评论(0)
推荐(0)
2024年11月29日
LLM大模型: CV领域常见attention思路变种及其作用(一)
摘要: 多年前做传统的机器学习,主要用的是LR、SVM、bayes、浅层nerual network、decision tree、random forest、GBDT等,这些分类或回归模型要想AUC、ROC等指标高,最核心的就是构造特征了!为此还专门诞生了一个细分领域:feather enginering,
阅读全文
posted @ 2024-11-29 15:19 第七子007
阅读(442)
评论(0)
推荐(1)
2024年11月4日
LLM大模型: Segment Anything Model原理详解
摘要: meta在2023.4.5又发了image sematic segmentation的文章,名字就叫Segment Anything;学术圈有个潜规则:title越简单,事情越大,比如7年前的那篇 attention is all you need,直接提升了nlp的层次!这次的Segment An
阅读全文
posted @ 2024-11-04 11:44 第七子007
阅读(4334)
评论(0)
推荐(0)
2024年10月30日
LLM大模型: Maskformer/Mask2Former语义分割原理详解
摘要: 1、自动驾驶、机器人、电商、监控等行业都涉及到image的sematic segmentation,传统的方式:per-pixel classification,每个像素点都要分类;如果进一步做 instance-level segmentation,可能还要改network architure后重
阅读全文
posted @ 2024-10-30 17:36 第七子007
阅读(4081)
评论(0)
推荐(0)
2024年10月21日
LLM大模型: blip2/blip3多模态大模型原理
摘要: 截止目前,图片检索领域最出名的应该是openAI的clip了,分别用bert和vit对text和image做encoder,然后让配对的embedding接近,不配对的embedding拉远,通过这种方法达到text匹配(检索)image的目的!但这种方式只能检索,没法生成text啊(比如对imag
阅读全文
posted @ 2024-10-21 17:14 第七子007
阅读(4047)
评论(0)
推荐(1)
2024年10月1日
LLM大模型: diffusion transformer Dit原理和核心代码
摘要: 现阶段,主流文生图的思路就是DDPM了:先随机生成N~(0,1)的噪声图,然后逐步denoise,迭代1000次左右得到text指定的图;其中最核心的莫过于denoise时生成的noise图片:每次需要根据输入时间t、文本text和noise latent生成合适的noise图片。之前介绍了unet
阅读全文
posted @ 2024-10-01 20:01 第七子007
阅读(5225)
评论(0)
推荐(0)
2024年9月25日
LLM大模型: 生成式模型generative model SD和VAE的数学原理和prompt融入image
摘要: 1、(1)上文介绍了DDPM生成图片的原理和代码测试结果,训练时给样本图片加上gaussian noise,预测时也是预测gaussian noise; 这里为啥要用gaussian distribution?为啥不用其他的分布? 高斯分布相对比较简单,只有两个参数:均值和方差,容易控制; 为啥一张
阅读全文
posted @ 2024-09-25 17:09 第七子007
阅读(459)
评论(0)
推荐(0)
2024年9月23日
LLM大模型: Denoising Diffusion Probabilistic Models 原理解析与核心代码
摘要: 根据文本生成图片是AI的核心应用之一,2020年后主流的生成方式都是基于Denoising Diffusion Probabilistic Models原理的,逐渐替代了之前使用GAN的方式生成图片!那么DDPM为啥能取代GAN了?其优势在哪?或者说GAN的劣势在哪? 1、CLIP模型都知道吧? t
阅读全文
posted @ 2024-09-23 15:57 第七子007
阅读(847)
评论(0)
推荐(0)
2024年9月17日
GNN图神经网络原理解析
摘要: 以前搞机器学习、数据挖掘,主要是针对文本、图像和结构化的数据。但在现实的物理世界中,还有一类非常重要的数据结构:图(不是图片Image,而是graph)!最常见的graph结构: 社交网络了:比如微信、qq这种好友关系的无向图;又比如weibo、x这种关注关系的有向图; google搜索引擎早期排序
阅读全文
posted @ 2024-09-17 12:23 第七子007
阅读(739)
评论(0)
推荐(0)
2024年8月8日
LLM大模型:LLaVa多模态图片检索原理
摘要: 训练安全垂直领域的LLM,会用到很多著名安全论坛(52pojie\kanxue\xianzhi\freebuf等)、博客的数据,这些数据100%都有很多图片(文不如图嘛,图片比文字更直观,更容易表达业务意义),之前微调LLM只能使用文字,图片只能丢弃,非常可惜,需要利用多模态的技术充分提取图片信息!
阅读全文
posted @ 2024-08-08 17:32 第七子007
阅读(4410)
评论(1)
推荐(2)
上一页
1
2
3
4
5
6
7
8
···
22
下一页
公告