链接:https://pintia.cn/problem-sets/2043859722891493376/exam/overview 这里主要针对天梯赛,其他比赛不太适用,为了自己也为了帮助他人复习以及更稳的备赛,我就做了一个简单的题解。 基础题部分 这一场的 \(L1\)-\(L7\) 我就不写 ...
0.引入 块状链表就是一个链表,每个节点指向一个空间大小为 \(L\) 的数组。一个链表长度为 \(M\),数组空间大小为 \(L\) 的块状链表能装至多 \(ML\) 个元素。 给定参数 \(M\) 和 \(L\),在块状链表中查找一个元素的复杂度是 \(O(M)\),朴素插入和删除一个元素的复杂 ...
为什么要写作本文? 以为自己已经学会了串串[1],结果在摩卡串被创飞才发现自己似乎连最基础的 KMP 都没有学懂,遂写此文。 因此本文不仅是一篇介绍字符串的博客,更是学习的过程。 子曰:「温故而知新,可以为师矣。」这种学习方法也叫费曼学习法。 所以读者在品鉴完本文后还可以去教别人,并告诉他这是一种高 ...
1. 基础概念 根据图论里的知识,我们已经知道了邻接矩阵 \(A\) 的定义。如果是有向图,那么边 \(u_i\to v_i\) 只需要在 \(A_{u_i, v_i}\) 处加上 \(w_i\) 即可;如果是无向图,那么边 \(u_i\leftrightarrow v_i\) 只需要在 \(A_{ ...
赛事信息 题目链接:https://codeforces.com/gym/105992 赛事榜单:https://board.xcpcio.com/provincial-contest/2025/shanghai?group=official 这场打的有点倒闭,只出了3道题,感觉心态还是比较炸,唉, ...
动态规划——背包问题全总结 关于动态规划的背包问题,可分为: 0/1 背包问题 分组背包问题 多重背包问题 完全背包问题 1 0/1背包问题 问题描述 有 \(N\) 件物品和一个容量是 \(V\) 的背包。每件物品只能使用一次。 第 \(i\) 件物品的体积是 \(v_i\),价值是 \(w_i\ ...
赛事信息 题目链接:https://codeforces.com/gym/105911 赛事榜单:https://board.xcpcio.com/icpc/50th/nanchang-invitational 这场 vp 出了 7 道题,整体难度偏简单,下面先把我能补的+赛场上写的写一下。 A. ...
并查集的区间染色 并查集作为一种高级数据结构,可以高效地维护元素与元素,元素与集合之间的关系。 在一些涉及到区间染色的题中,并查集可以很好地维护块的大小,块的边界和块的合并。 以例题来做具体解释。 [CF356A Knight Toumament](Problem - A - Codeforces) ...
天梯赛L1-064 已被打败 题目描述 ai处理字符串规则是: •无论用户说什么,首先把对方说的话在一行中原样打印出来; •消除原文中多余空格:把相邻单词间的多个空格换成 1 个空格,把行首尾的空格全部删掉,把标点符号前面的空格删掉; •把原文中所有大写英文字母变成小写,除了 I; •把原文中所 ...
OS:TEP MLFQ 策略 前言 其实, 我学 Linux 内核的时候, 并不只是阅读 LKD 和翻阅源码. 我同时还在阅读 OS:TEP(Operating System: Three Easy Pieces), 对, 就那本讲操作系统的书. 每一个部分看完之后, 我就立马阅读 LKD 的对应部 ...
单调栈 题目 定义:一个下标 $i$ 是序列 $a$ 的后缀最大值下标当且仅当对于所有的 $i < j \le |a| $ ,都有 $a_i>a_j$。其中 $|a|$ 表示序列 $a$ 的长度。给出整数 $n$ 和一个长为 $n$ 的序列 $a$,对于每个 $1 \le i \le n$ ,输出 ...
背景 昨日写题的时候,偶遇一道神奇的构造题,题目是这样的: 构造一个长度为\(2^n\)的序列\(p_0,p_1,…,p_{2^n−1}\),使得相邻两项异或值之和最小。 这道题很容易就可以看出,如果要构造一个使得相邻两项异或值之和最小的序列,就要保证每个元素与相邻元素间在二进制下仅有一位的差距,而 ...
KMP算法是由D.E. Knuth、J.H. Morris和V.R. Pratt(其中Knuth和Pratt共同研究, Mor-ris独立研究)发表一个模式匹配算法,KMP算法的最大特点使得它在处理大量文本匹配的问题时,比暴力枚举算法有更好的性能。
关于字符串匹配,是字符串很重要的知识点,也是面试笔... ...
目录 逆序对简介 逆序对能做什么 一些逆序对杂题 总结 逆序对简介 逆序对定义 给定一个序列 \(a\),存在有序对 \((i,j)\),满足 \(i<j\) 且 \(a_i > a_j\),则称 \((i,j)\) 为一个逆序对。 如何求序列逆序对对数 根据定义:对于一个下标 \(i\),它能产生 ...
PPO并非“万能增强器”,而是精准解决模型“行为偏好错位”的工具:当模型“会但总选错”(如安全拒答生硬、风格不稳、高风险下过度自信)时,PPO通过人类偏好反馈重塑其选择倾向;若问题本质是“不会”,则PPO无效甚至有害。用对场景,事半功倍。 ...
PPO实战难点不在算法理解,而在系统性不确定:动态数据、不稳reward、多目标冲突。关键在于明确对齐目标、用SFT模型起步、必备reference、设计偏好型reward、聚焦policy更新、善用KL系数调控风险,并以行为变化而非loss曲线评估进展——耐心跑通最小闭环,才是成功核心。 ...
参数一多,微调就变成了一场“看不见赔率的赌博” 如果你做过几次大模型微调,大概率会有一种非常熟悉的体验。 第一次跑通微调之后,你开始觉得这件事“好像也没那么难”。模型能训起来,loss 能降,输出也确实有点变化。接下来,你自然会做一件事:开始调参数。 学习率小一点? batch size 大一点? ...
LoRA 确实解决了很多现实问题,这一点没有任何争议。但问题在于,LoRA 被过度神话了。很多人把它当成了一种“几乎没有代价的微调方式”,仿佛只要挂上 LoRA,就能放心大胆地训练。而真实工程里,LoRA 带来的,从来不是“没有代价”,而是代价被换了一种形式 ...
在工程实践中,真正成熟的团队,并不是“什么都敢调”,而是知道什么时候该收手。微调是一种非常强的工具,但正因为它强,才更需要克制。很多时候,你不微调,并不是因为你不会,而是因为你足够清楚——现在不是它该出场的时候。 ...
为什么大家突然开始“只谈 DPO,不谈 PPO” 如果你最近在刷技术社区、看分享或者听内部讨论,很容易产生一种感觉: PPO 好像有点“过时”了,DPO 才是新一代对齐方案。 很多文章在反复强调: DPO 不需要 reward model DPO 更稳定 DPO 更简单 DPO 是对 PPO 的“降 ...