摘要: 目前限于时间原因,只在 Github Pages 上托管了。 之后有时间会托管到 pythonanywhere 上,因为 Github Pages 是在太慢了。 阅读全文
posted @ 2024-03-10 11:40 jeefy 阅读(207) 评论(2) 推荐(2)
该文被密码保护。 阅读全文
posted @ 2023-08-27 12:15 jeefy 阅读(32) 评论(0) 推荐(0)
摘要: Verilog 简明教程 0. 心智模型(先建立,再学语法) Verilog 代码分两类,物理上必须分开: 设计代码(可综合):描述电路结构,进 FPGA; 测试代码(不可综合):产生输入、观察输出,只活在仿真器里。 判断标准:这句话能不能翻译成真实硬件(门、触发器、连线)? 电路 = 一张依赖图 阅读全文
posted @ 2026-09-28 09:35 jeefy 阅读(6) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: Completed-Q 算子 Completed-Q 其实就是把 MCTS 搜索后"不完整、跨节点不可比"的回溯价值 \(Q\),先做缺失补全与局部归一化,再作为 logit 奖励以乘法方式注入先验策略 \(\pi_\theta\),完成一步 soft 阅读全文
posted @ 2026-09-27 20:24 jeefy 阅读(3) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: FloQ 所以 floq 其实就是将 FQL 中的 Q network 变成了用 flow-matching “多步推理” 的密集监督的网络。 核心建模 其核心的建模就是: \[Q(s, a) = z(0) + \frac 1 K \sum_{i = 阅读全文
posted @ 2026-09-27 20:24 jeefy 阅读(6) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: 持续学习综述 A Comprehensive Survey of Continual Learning: Theory, Method and Application \(\Delta\) 将持续学习视为智能系统在整个生命周期中增量获取、更新、积累和利 阅读全文
posted @ 2026-09-26 21:16 jeefy 阅读(4) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: MMedAgent-RL 整体设计: GP --> specialist --> GP 训练的部分是前后的 GP 在 LLM 的强化学习中利用 GRPO 是比较合理的想法,所以这篇关于多智能体的 RL 也是用了 GRPO 作为一个组件。 由于存在 “难 阅读全文
posted @ 2026-09-26 21:06 jeefy 阅读(3) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: MuMA-ToM ToM (Theory of Mind) 是一种推测他人意图、情绪、目的等心智状态的能力。 ToM 被用于评估 AI 在多智能体、多模态社交互动中的推理能力。 该 benchmark 分为 3 类子问题: belief inferen 阅读全文
posted @ 2026-09-26 21:06 jeefy 阅读(4) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: GAM-Agent 在答案聚合这一块,一般的做法是平均聚合、投票选优之类的,在推理、视觉层面的信息交换是不充分的,所以,需要对于聚合阶段采取一个较好的框架性方案。 GAM-Agent 采用一种基于博弈的思路,加上一些可以量化的指标,完成了该论文。 说是 阅读全文
posted @ 2026-09-26 21:05 jeefy 阅读(3) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: 常用函数 logit \[{\rm logit}(p) = \log \left(\frac p {1 - p} \right) \] sigmoid \[\sigma(x) = \frac 1 { 1 + e^{-x}} \]与 logit 函数互为 阅读全文
posted @ 2026-09-26 21:05 jeefy 阅读(2) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: 卷积神经网络 一层输出特征映射来源于该层的所有核与全部输入特征映射。 \[{\mathcal X} \in {\mathcal R}^{M \times N \times D}, {\mathcal Y} \in {\mathcal R}^{M' \t 阅读全文
posted @ 2026-09-26 21:05 jeefy 阅读(3) 评论(0) 推荐(0)
摘要: 可能更好的阅读体验 Jeefy's Blog: Lyapunov 从纯数学角度,Lyapunov 优化(Lyapunov Optimization)的建模可以形式化为一个离散时间随机控制问题。以下是严格的数学框架: 1. 基本系统模型 考虑离散时间动态系统,时间索引为 \(t \in \{0, 1, 阅读全文
posted @ 2026-09-26 21:05 jeefy 阅读(6) 评论(0) 推荐(0)