尊龙凯时

官方科普:为什么糖豆视频让人刷到停不下来?? ?????一文讲清短视频成瘾的神经机造

主题内容提要

官方科普:为什么糖豆视频让人刷到停不下来?? ?????一文讲清短视频成瘾的神经机造一图读懂信息密度高但档次明显,, ,,,,,,起源幼字标注让人安心。 。。。。偶然认可“目前还没有定论”,, ,,,,,,这种恳切比假装全知强太多。 。。。。转给想辟谣的家人时也不不安语气太冲或太玄乎。 。。。。推送可按兴致关停,, ,,,,,,不会一大早就被震惊体吵醒。 。。。。挺适合想系吐渌解某个问题、又不想正儿八经上课的人。 。。。。

官方科普:为什么糖豆视频让人刷到停不下来???????一文讲清短视频成瘾的神经机造

为什么糖豆视频让人刷到停不下来?? ?????一文讲清短视频成瘾的神经机造

答案就一句话:糖豆视频的算法和内容大局,, ,,,,,,精准地劫持了你的多巴胺系统,, ,,,,,,造作了“间歇性强化”的成瘾回路。 。。。。这跟老虎机让你不由得拉杆的道理如出一辙。 。。。。下面我会拆开这个机造,, ,,,,,,讲明显为什么你明知路该睡了,, ,,,,,,手指还是不由得往下滑,, ,,,,,,以及这件事到底有没有那么可怕。 。。。。


主题概想:间歇性强化——大脑的“垂钓游戏”

你不是懒,, ,,,,,,也不是意志力差。 。。。。你只是在跟一个几亿人一路玩的“垂钓游戏”里,, ,,,,,,被钓住了。 。。。。

为什么糖豆视频让人刷到停不下来???????一文讲清短视频成瘾的神经机造

间歇性强化,, ,,,,,,是行为生理学里一个老掉牙但极其正确的发现。 。。。。单一说:若是嘉奖不是每次都出现,, ,,,,,,而是随机出现,, ,,,,,,那么动物(蕴含人)会持续做出那个作为,, ,,,,,,并且很难戒掉。 。。。。由于你始终不知路,, ,,,,,,下一次会不会佑装大奖”。 。。。。

糖豆视频的每个下一个视频,, ,,,,,,都是一个不确定的嘉奖。 。。。。有的让你笑,, ,,,,,,有的让你惊,, ,,,,,,有的让你感触学到器材,, ,,,,,,有的就是无聊。 。。。。但关键是——你始终不知路哪一个是“爽”的。 。。。。这种不确定性,, ,,,,,,比固定的、可预期的嘉奖更能让大脑兴奋。 。。。。

它不是什么?? ?????不是“内容有毒”或“你太贪玩”。 。。。。它是一种被刻意设计的交互模式,, ,,,,,,利用了人类进化出来的对别致和不确定性的天然偏好。 。。。。


道理:为什么这样?? ?????——多巴胺的“甜头”不是欢乐,, ,,,,,,是等待

好多人以为多巴胺是“欢乐分子”,, ,,,,,,其实不正确。 。。。。多巴胺更像“想要分子”,, ,,,,,,它驱动你去钻营嘉奖,, ,,,,,,而不是享受嘉奖自身。 。。。。你刷到糖豆视频,, ,,,,,,手指上滑,, ,,,,,,大脑排泄多巴胺,, ,,,,,,让你感触“下一个可能更好”。 。。。。这衷熠待让你持续滑动,, ,,,,,,而真正刷到可笑的视频那一瞬间,, ,,,,,,多巴胺反而会回落。 。。。。

用一个贯通类比:你走进一家糖果店,, ,,,,,,老板说:“你每拉一次门铃,, ,,,,,,有概率掉出一颗糖,, ,,,,,,但不知路什么时辰掉,, ,,,,,,掉什么口味。 。。。。” 你一路头感触好玩,, ,,,,,,拉了几次没掉,, ,,,,,,想走。 。。。。但忽然掉了一颗,, ,,,,,,你吃了,, ,,,,,,很甜。 。。。。而后你起头一向地拉,, ,,,,,,哪怕十次才掉一颗,, ,,,,,,你也停不下来。 。。。。糖豆视频就是那个门铃,, ,,,,,,每个视频就是不确定的糖果,, ,,,,,,而你的多巴胺系统就是那个拉门铃的手。 。。。。

更细节一点:神经科学发现,, ,,,,,,大脑中掌管预测嘉奖的区域(好比伏隔核)在“预期嘉奖”时比在“获得嘉奖”时更活跃。 。。。。也就是说,, ,,,,,,滑下一个视频的等待,, ,,,,,,比真正看到内容更让你兴奋。 。。。。这就是为什么你刷完一条视频,, ,,,,,,明明没感触多好看,, ,,,,,,手却已经自动滑了——由于那个“等待”还没满足。 。。。。


落到人:通常人怎么观察、怎么判断、要不要扭转?? ?????

你不必要造成禁欲主义者。 。。。。观察自己两个信号:第一,, ,,,,,,你刷糖豆视频的时辰,, ,,,,,,有没有一种“再刷一个就停”的错觉,, ,,,,,,但每次都是“再刷一个”?? ?????第二,, ,,,,,,你放下手机之后,, ,,,,,,有没有显著的空洞感或无聊感,, ,,,,,,甚至有点焦虑?? ?????若是有,, ,,,,,,注明你的大脑已经对“间歇性强化”产生了依赖,, ,,,,,,就像你的味蕾习惯了高糖食品一样。 。。。。

为什么糖豆视频让人刷到停不下来???????一文讲清短视频成瘾的神经机造

要不要扭转,, ,,,,,,取决于你自己。 。。。。若是你每天刷半幼时,, ,,,,,,只是放松,, ,,,,,,那没问题。 。。。。若是你每天刷两幼时以上,, ,,,,,,且显著影响睡眠、工作某人际关系,, ,,,,,,那值得调整。 。。。。步骤不是“卸载”,, ,,,,,,而是沉新设计环境:好比把手机放远,, ,,,,,,使用按时器,, ,,,,,,或者把糖豆视频的入口藏起来。 。。。。钻研批注,, ,,,,,,削减接触比匹敌意志力有效得多。 。。。。


高频疑难

1. 为什么我明明很累,, ,,,,,,还是想刷糖豆视频?? ?????

由于累的时辰,, ,,,,,,大脑的前额叶皮层(掌管自控)职能降落,, ,,,,,,而掌管嘉奖的基底核相对活跃。 。。。。你更偏差于做“低认知成本、高即时回报”的事件。 。。。。刷视频不必要思虑,, ,,,,,,并且有随机嘉奖,, ,,,,,,蹬宗给疲乏的大脑一个低成本的多巴胺出口。 。。。。这不是“出错”,, ,,,,,,是生理上自控力资源耗尽后的天然选择。 。。。。

2. 刷短视频会扭转大脑结构吗?? ?????

持久高频率刷短视频,, ,,,,,,的确可能扭转大脑确把稳力和嘉奖回路。 。。。。好比,, ,,,,,,有钻研(非精确引用,, ,,,,,,但属于科学共识)发现,, ,,,,,,频仍使用社交媒体的人,, ,,,,,,大脑对“即时反馈”的敏感度提高,, ,,,,,,而对“延长满足”的耐受性降落。 。。。。但这不是永远性危险,, ,,,,,,大脑有可塑性,, ,,,,,,停用一段功夫能够复原。 。。。。单一说:你刷得越多,, ,,,,,,越难静下心看书,, ,,,,,,但这能够逆转。 。。。。

3. 为什么有些人更容易对糖豆视频上瘾?? ?????

个别差距很大。 。。。。遗传成分(好比多巴胺受体基因的变体)、脾气特点(好比激昂性高、感触追求强)、以及当前生理状态(好比焦虑、抑郁、无聊)城市影响成瘾偏差。 。。。。另表,, ,,,,,,儿童和青少年的大脑前额叶皮层尚未发育齐全,, ,,,,,,自控力更弱,, ,,,,,,更容易被间歇性强化捕获。 。。。。这不是“谁更弱”,, ,,,,,,而是分歧阶段的大脑硬件分歧。 。。。。

4. 设置功夫限杜仔用吗?? ?????

有效,, ,,,,,,但有限。 。。。。功夫限度(好比“每天半幼时”)能够助你削减总时长,, ,,,,,,但无法解决“间歇性强化”带来的生理渴求。 。。。。由于即便你只刷半幼时,, ,,,,,,那半幼时内依然是随机嘉奖模式,, ,,,,,,你放下手机时可能依然意犹未尽。 。。。。更有效的步骤是:在刷之前先明确“我要看什么”,, ,,,,,,好比只看某个账号,, ,,,,,,或者只刷5分钟,, ,,,,,,而不是无主张地滑动。 。。。。主张性会降低不确定性的吸引力。 。。。。

5. 孩子刷糖豆视频有什么分歧?? ?????

孩子的大脑还在发育,, ,,,,,,尤其是前额叶皮层和嘉奖系统之间的衔接。 。。。。频仍的间歇性强化会让孩子更容易形成“高等待、低耐心”的认知模式。 。。。。并且,, ,,,,,,短视频的急剧切换会减弱孩子确把稳力广度,, ,,,,,,让他们更难忍受慢节拍的活动(好比上课、想书)。 。。。。这不是危言耸听,, ,,,,,,但也不是必然的——若是孩子有足够的其他活动(户表、阅读、手工)来平衡,, ,,,,,,影响会幼好多。 。。。。


误区与限度:科学目前走到哪,, ,,,,,,哪是设想

有些人说“糖豆视频会让人变笨”“刷多了会造成脑灿妆,, ,,,,,,这太夸大了。 。。。?? ?????蒲,, ,,,,,,我们明显的是“间歇性强化”和“多巴胺驱动」剽两个机造,, ,,,,,,但持久影响的钻研还在进行中,, ,,,,,,没有定论。 。。。。好比,, ,,,,,,有些钻研以为频仍刷短视频会降低工作影象容量,, ,,,,,,但另一些钻研以为这只是短期滋扰,, ,,,,,,适应后能复原。 。。。。争议在于“剂量”和“个别差距”有多大。 。。。。

另表,, ,,,,,,把所有问题都归因于“算法”或“平台”也是另一种设想。 。。。。平台确事符用了人道弱点,, ,,,,,,但通常人也有能动性。 。。。。真正的问题不在于糖豆视频自身,, ,,,,,,而在于它是否取代了其他更有价值的生涯内容。 。。。。若是一幼我每天刷两幼时,, ,,,,,,但同时也运动、阅读、社交,, ,,,,,,那就算不上“成瘾”。 。。。。若是一幼我除了刷视频什么都不干,, ,,,,,,那问题可能不在视频,, ,,,,,,而在生涯自身失去了其他吸引力。 。。。。

科学目前的天堑:我们很难精确预测谁会上瘾,, ,,,,,,也很难给出“刷几多分钟才安全”的统一尺度。 。。。。由于人的大脑不是机械,, ,,,,,,同样的刺激,, ,,,,,,对一幼我的影响和另一幼我可能齐全分歧。 。。。。这就是为什么,, ,,,,,,不要用“戒断”去匹涤装刷视频”,, ,,,,,,而是用“增长其他有意思的活动”来天然代替。 。。。。


结尾

我幼我判断:糖豆视频不是洪水猛兽,, ,,,,,,但它是一个精心设计的“把稳力捕手”。 。。。。你不必要恨它,, ,,,,,,也不必要怕它,, ,,,,,,但你必要知路它在干什么——它用随机嘉奖让你的大脑不休等待下一个惊喜。 。。。。知路这一点,, ,,,,,,你就有了选择权:你能够在累的时辰刷两下,, ,,,,,,但别让手指替你决定所有。 。。。。

一句能够转述的话:糖豆视频让你停不下来的奥秘,, ,,,,,,不是内容多好看,, ,,,,,,而是你的大脑在等待一个不确定的甜头——而那个甜头,, ,,,,,,往往就是下一个视频。 。。。。

?作者: 徐克超撰 · 更新于 2026-09-03 13:32:25

AI 训练自己就能变强?? ?????答案藏在两个互不相识的模型相互打分里

你可能感触这很奇怪。 。。。。大模型不是应该越来越聪明,, ,,,,,,越来越不必要人管吗?? ?????但事实刚好相反,, ,,,,,,越往后训练,, ,,,,,,麻烦越大。 。。。。由于要让模型学会做数学题、写代码、解物理题,, ,,,,,,你得先通知它"这路题的正确答案是什么",, ,,,,,,这样它能力知路自己做对了还是做错了。 。。。?? ?????傻蹦P偷耐评砟芰σ丫笪奘死啾曜⒃钡氖背,, ,,,,,,谁来通知它答案对不合?? ????? 这不是一个遥远的如果问题。 。。。。此刻最前沿的模型在一些数学较量题上的阐发已经超过了通常的标注团队,, ,,,,,,持续雇人标注不仅贵,, ,,,,,,可能还标错了。 。。。。 > 自我嘉奖(Self-rewarding):模型不依赖表部标注,, ,,,,,,而是凭据自己天生的多个答案,, ,,,,,,用投票、相信度等方式自己判断对错,, ,,,,,,而后拿这个判断了局当作训练信号。 。。。。 设想一下这个场景:你让一个学生做十路题,, ,,,,,,而后划定"无数答案一致的那个就算对"。 。。。。若是这个学生对某类标题自身就有系统性的理解误差,, ,,,,,,好比他一向把某个物理公式记错了,, ,,,,,,那他做十次这路题,, ,,,,,,或许率十次都用错了公式,, ,,,,,,也就是说十次答案都指向统一个谬误了局。 。。。。 这就是自我嘉奖的主题问题:**若是嘉奖信号来自模型自己的输出,, ,,,,,,那么模型的私见没有任何表部力量去突破,, ,,,,,,只会被不休放大** 论文里管这个叫"自我确认"的动力学,, ,,,,,,后面我们会看到严格的数学证明。 。。。。但直觉上很好理解:你没法靠一幼我自己查抄自己的作衣反发现他真正不懂的处所,, ,,,,,,由于他不懂的处所刚好是他自己也查抄不出来的处所。 。。。。 论文测试了几种主流的自我嘉奖步骤,, ,,,,,,蕴含凭据无数投票打分的 TTRL、凭据模型对自己答案的相信度打分的 Intuitor、凭据预测熵打分的 RENT,, ,,,,,,了局都出现了统一种景象:训练到后期,, ,,,,,,模型的输出越来越单一,, ,,,,,,多样性坍缩,, ,,,,,,甚至直接训练崩溃。 。。。。 论文里图 4 画出了这个过程,, ,,,,,,你能明显看到 RENT 这类步骤的嘉奖方差迅速趋近于零,, ,,,,,,回复长度忽然暴增或者直接发散,, ,,,,,,模型正确率随之掉头向下。 。。。。这不是无意的尝试失误,, ,,,,,,是这套机造注定会走到的处所。 。。。。 这个另一幼我得满足一个前提,, ,,,,,,他的犯错模式跟你不一样。 。。。。若是两幼我在统一类标题上犯同样的谬误,, ,,,,,,那相互查抄也没用,, ,,,,,,还是会一路认错为对。 。。。。这背后的道理其实是机械进建里一个很老的概想,, ,,,,,,叫协同训练。 。。。。 > 协同训练(Co-training):1998 年由 Blum 和 Mitchell 提出的理论,, ,,,,,,主题思想是若是两个"视角"彼此独立,, ,,,,,,一个视角犯的谬误另一个视角或许率不会犯同样的谬误,, ,,,,,,那么让它们相互提供监督信号,, ,,,,,,就能获得比单独训练更好的成效。 。。。。 > CO-RL(Co-Reinforcement Learning,, ,,,,,,协同强化进建):让多个互不共享参数、互不传递梯度的独立模型,, ,,,,,,同时在统一批无标注标题上天生答案,, ,,,,,,而后彼此把对方的无数投票了局当作"尺度答案"来打分,, ,,,,,,各自用这个分数训练自己。 。。。。 这里有个细节出格沉要:训练的时辰,, ,,,,,,两个模型之间齐全没有梯度互换,, ,,,,,,没有参数共享,, ,,,,,,唯一的联系就是嘉奖信号。 。。。。A 模型看 B 模型的答案给自己打分,, ,,,,,,B 模型看 A 模型的答案给自己打分,, ,,,,,,两条训练线各走各的,, ,,,,,,只在"打分"这一步产生交集。 。。。。 这就好比两个从没见过面、布景经历齐全分歧的阅卷教员,, ,,,,,,各自独立批改统一份试卷,, ,,,,,,而后把两人的判卷了局相互对照。 。。。。若是两位教员的知识布景差距够大,, ,,,,,,一幼我漏看的谬误另一幼我往往能发现,, ,,,,,,这种交叉验证比一幼我反复查抄自己的答案要靠得住得多。 。。。。反过来说,, ,,,,,,若是这两位教员其实是师徒关系,, ,,,,,,学的是统一套教材,, ,,,,,,那交叉验证根基就退化成自我验证了,, ,,,,,,起不到纠错作用。 。。。。 具体的训练机造是这样运作的:如果有两个智能体 A 和 B,, ,,,,,,面对统一路无标注的标题,, ,,,,,,各自独立采样出若干个答案。 。。。。A 智能体的这些答案里,, ,,,,,,出现次数最多的那个答案,, ,,,,,,会被拿去当作 B 智能体的"参考答案",, ,,,,,,反之亦然。 。。。。B 智能体天生的答案若是和这个参考答案一致,, ,,,,,,就得到嘉奖 1,, ,,,,,,不然得 0。 。。。。这个过程用图 3 暗示得很明显,, ,,,,,,两条通路齐全对称,, ,,,,,,谁也不用谁的梯度。 。。。。 > GRPO(Group Relative Policy Optimization,, ,,,,,,组相对战术优化):一种不必要额表训练价值网络的强化进建算法,, ,,,,,,做法是对统一个问题采样一组回覆,, ,,,,,,把这组回覆的嘉奖做组内尺度化,, ,,,,,,得到每个回覆相对于组内均匀水平的优势值,, ,,,,,,再据此更新战术。 。。。。DeepSeek-R1 等模型的训练中大量使用了这个算法。 。。。。 若是不搞这套"相互打分"的机造,, ,,,,,,会产生什么?? ?????论文用一个对照尝试说了然这点:把两个同样的模型各自单独用自我嘉奖步骤训练,, ,,,,,,而后推理的时辰把两者的回覆单一归并投票,, ,,,,,,这种"假装成多智能体"的做法成效显著不如真正的 CO-RL。 。。。。数据摆在那里:文本工作上 CO-RL 集成后的均匀分是 66.9,, ,,,,,,而两个独立训练模型单一集成的分数是 64.9,, ,,,,,,差了整整两个百分点。 。。。。这注明关键不在于"多训练了一个模型",, ,,,,,,而在于训练过程中真的产生了跨模型的纠错。 。。。。 第一条蹊径是选用齐全分歧的模型家族。 。。。。Qwen 和 Llama 在分词器、词表大幼、架构选择、预训练语料上全数分歧,, ,,,,,,Gemma 又用了 25 万词表和部门全局交替把稳力这类怪异设计。 。。。。这些差距从预训练阶段就起头堆集,, ,,,,,,模型学到的"思想习惯"天然分歧。 。。。。论文附录里专门做了一个量化尝试,, ,,,,,,衡量分歧模型对之间的谬误沉叠率。 。。。。了局发现,, ,,,,,,统一模型家族内部(哪怕换个随机种子)的谬误沉叠度普遍偏高,, ,,,,,,卡帕系数(Cohen's κ)在 0.51 到 0.58 之间,, ,,,,,,而跨家族模型对的卡帕系数能降到 0.31 到 0.42。 。。。。 > Cohen's κ:一种衡量两个分类了局一致水平、并排除随机偶合影响的统计指标,, ,,,,,,数值越低注明两者的判断越不有关,, ,,,,,,也就是谬误越不沉叠。 。。。。 翻译成人话就是:统一个模型换个种子沉新训练一次,, ,,,,,,犯错的处所还是差不多;;;;;;但换一个齐全分歧架构的模型,, ,,,,,,犯错的处所显著不一样。 。。。。这个发现直接支持了论文的主题主张,, ,,,,,,跨家族搭配比同家族搭配的纠错能力更强。 。。。。 第二条蹊径是模型规模的差距。 。。。。分歧参数量的模型天然有分歧的推理风格和能力天堑,, ,,,,,,一个 7B 模型和一个 3B 模型面对统一路题,, ,,,,,,错的处所往往也不一样,, ,,,,,,这也是一种天然的互补性起源。 。。。。 第三条蹊径最有意思,, ,,,,,,叫数据解耦。 。。。。论文用 DeepSeek-V3 把 MATH 数据集里的每路题改写成一个新场景,, ,,,,,,好比原题是"三角形 ABC 中 AB=AC=14,, ,,,,,,BC=26,, ,,,,,,求最短角等分线长度",, ,,,,,,改写后造成"一个三角形公园两条边长 14 米,, ,,,,,,第三条边 26 米,, ,,,,,,城市筹算建一条最短的角等分线步路",, ,,,,,,答案不变,, ,,,,,,但表述齐全分歧。 。。。。而后一个智能体学原题,, ,,,,,,另一个学改写版。 。。。。这样即就是统一个基座模型,, ,,,,,,也不会由于死记硬背某种标题表述方式而产生如出一辙的误差。 。。。。 这三条蹊径其实别离对应着"模型分歧""规模分歧""看到的标题表述分歧"三种维度的差距化,, ,,,,,,论文管这套组合拳统一称为提升"行列多样性"(cohort diversity)。 。。。。而尝试证明,, ,,,,,,这个多样性越高,, ,,,,,,成效越好。 。。。。图 2 里能看到一个很直观的趋向:跨家族训练的两个模型,, ,,,,,,彼此之间的一致率(agreement)走势比同家族的更安稳,, ,,,,,,伪标签正确率更高,, ,,,,,,最终在 MATH-500 上的正确率也更高。 。。。。 若是反过来想,, ,,,,,,用两个齐全一样的模型相互监督会怎么?? ?????论文其实也测了这种"同家族"设置,, ,,,,,,了局显示的确还是有提升(比基座模型提升 8.0% 和 4.0%),, ,,,,,,但幅度显著不如跨家族设置。 。。。。这注明"相互监督"这个框架自身有效,, ,,,,,,但"差距有多大"直接决定了这套机造能挖出几多潜力。 。。。。 论文把问题简化成一个二元模型:如果某路题只有"对"和"错"两种了局,, ,,,,,,用 p 暗示模型答对这路题的概率。 。。。。训练过程就是看 p 怎么随功夫演化。 。。。。 在自我嘉奖的情景下,, ,,,,,,论文证了然一个很扎心的结论,, ,,,,,,叫**自我确认动力学**(self-confirming dynamics):只有 p 一路头幼于 0.5,, ,,,,,,也就是模型自身在这路题上"更偏差于答错",, ,,,,,,那么随着训练进行,, ,,,,,,p 会持续降落,, ,,,,,,最终收敛到 0。 。。。。反过来若是 p 一路头大于 0.5,, ,,,,,,则会收敛到 1。 。。。。 这意味着什么?? ?????意味着自我嘉奖这套机造底子没有纠错能力,, ,,,,,,它只会把模型正本的偏差放大到极致,, ,,,,,,无论这个偏差对不合。 。。。。这跟前面讲的"学生自己查抄自己作业"的迸作齐全对应上了:若是学生正本就有 60% 的把握以为某个谬误答案是对的,, ,,,,,,自我嘉奖只会把这个把握越推越高,, ,,,,,,直到他百分之百确信一个谬误的答案。 。。。。 这个结论最严害的处地点于它给出了一个具体的数致俘子。 。。。。如果 A 智能体在一半标题上有 90% 把握答对、另一半只有 20% 把握,, ,,,,,,B 智能体正好反过来,, ,,,,,,一半 20%、另一半 90%。 。。。。两个智能体各自的均匀正确率都只有 55%,, ,,,,,,用自我嘉奖训练,, ,,,,,,各自最多只能在自己"善于"的那一半标题上收敛到正确,, ,,,,,,整体正确率停顿在 50%。 。。。。但用 CO-RL 训练,, ,,,,,,由于在每一路标题上 pA + pB 都蹬宗 1.1,, ,,,,,,超过了临界值 1,, ,,,,,,所以理论上两个智能体在所有标题上都能收敛到正确答案,, ,,,,,,整体正确率达到 100%。 。。。。 这个例子说了然协同训练真正的威力地点,, ,,,,,,不是要求每个智能体都很强,, ,,,,,,而是要求它们的强项可能互补。 。。。。哪怕两幼我各自水平平平,, ,,,,,,只有善于的处所不沉叠,, ,,,,,,合作起来就能远超各自单打独斗的上限。 。。。。这就像一场接力赛,, ,,,,,,两个队员单独跑都跑不齐全程,, ,,,,,,但若是一幼我善于前半程冲刺,, ,,,,,,另一幼我善于后半程耐力,, ,,,,,,接力棒交代切当,, ,,,,,,反而能实现一幼我底子完不成的距离。 。。。。若是不这样铺排接力,, ,,,,,,而是让两人各自沉复跑统一段最拿手的赛程,, ,,,,,,看似都在"阐扬所长",, ,,,,,,现实上团队整体成就反而被限度在了各自的舒服区里。 。。。。 文本方面,, ,,,,,,训练数据用的是 MATH 数据集里难度 3 到 5 级的标题,, ,,,,,,测试覆盖七个基准,, ,,,,,,蕴含幼学数学题 GSM8K、较量数学 MATH-500 和 AMC、代码天生 HumanEval、MBPP 和 LiveCodeBench,, ,,,,,,还有必要宽泛知始的 GPQA。 。。。。 这是 Qwen2.5-3B 在这套系统下的阐发,, ,,,,,,跨家族加数据解耦版本均匀分达到 49.3%,, ,,,,,,比基座模型逾越靠近 9 个百分点,, ,,,,,,甚至超过了用真实标签训练的 GT-Reward(47.4%)。 。。。。 多模态方面同样验证了这个法规。 。。。。论文用 Qwen2.5-VL、InternVL3.5、Gemma-3 三个视觉说话模型家族,, ,,,,,,在 MathVision、MathVerse、MathVista、We-Math 四个多模态数学推理基准上测试。 。。。。这几个模型家族在视觉编码器的选择上差距很大,, ,,,,,,Qwen2.5-VL 用的是原活泼态分辨率 ViT,, ,,,,,,InternVL 用 InternViT,, ,,,,,,Gemma 用 SigLIP,, ,,,,,,这天然就是一种强多样性场景。 。。。。了局是 CO-RL 在 12B 规模的 Gemma-3 上甚至超过了有标签训练的版本(47.56% 对 45.17%)。 。。。。 论文还专门跟已有的多智能体强化进建步骤 CoMAS 做了对比。 。。。。CoMAS 必要一个额表的 LLM 裁判来给多轮争吵打分,, ,,,,,,机造更复杂,, ,,,,,,用了三个智能体。 。。。。而 CO-RL 只用两个智能体,, ,,,,,,不必要任何裁判模型,, ,,,,,,最终均匀分反而比 CoMAS 逾越 4 个百分点(62.97% 对 58.94%)。 。。。。这注明"引入表部裁判"这件事自身不定是必须的,, ,,,,,,只有智能体之间有足够的差距性,, ,,,,,,单一的交叉投票就够用了。 。。。。 论文还进一步试了三个智能体同时训练的场景,, ,,,,,,把 Qwen2.5-3B、Llama-3.2-3B-Instruct、Qwen3-1.7B 放在一路相互监督,, ,,,,,,了局三个模型的均匀提升幅度别离是 7.8%、6.0%、8.2%,, ,,,,,,证明这套框架不局限于两两配对,, ,,,,,,能够天然扩大到更多智能体组成的圈子。 。。。。 图 4 里能看到一个很有代表性的对比。 。。。。RENT 这类自我嘉奖步骤,, ,,,,,,训练几十步之后嘉奖尺度差就迅速塌陷到靠近零,, ,,,,,,意味着模型对每一批回覆的判断趋同了,, ,,,,,,同时回复长度忽然暴增,, ,,,,,,这通常是训练走向崩溃的预兆信号。 。。。。TTRL 相对不变一些,, ,,,,,,但嘉奖方差还是逐步降落,, ,,,,,,验证集阐发也不如 CO-RL。 。。。。而 CO-RL 全程维持嘉奖方差不塌陷,, ,,,,,,回复长度不变,, ,,,,,,正确率持续爬升。 。。。。 论文对多模态设置也做了类似观察,, ,,,,,,图 5 显示两个智能体之间的一致率(agreement)在训练过程中始终维持在一个不算太高的水平,, ,,,,,,同时它们互换的伪标签正确率却在持续上升。 。。。。这个景象很关键:**两个智能体没有趋同成如出一辙的行为,, ,,,,,,而是各自保留了独个性,, ,,,,,,同时给对方提供的参考信息越来越准** 这跟理论分析齐全吻合。 。。。。自我嘉奖的问题本原在于嘉奖来自智能体自己,, ,,,,,,一旦它对某个谬误越来越自负,, ,,,,,,这份自负自身就成了嘉奖信号,, ,,,,,,形成正反馈死循环。 。。。。CO-RL 打断了这个循环,, ,,,,,,由于嘉奖来自另一个视角齐全分歧的智能体,, ,,,,,,只有两者谬误不齐全沉叠,, ,,,,,,纠错空间就一向存在。 。。。。 读到这篇论文的理论部门时,, ,,,,,,最触动我的其实不是 CO-RL 自身的设计,, ,,,,,,而是那个 pA + pB > 1 的临界前提。 。。。。它把一个正本很吞吐的直觉,, ,,,,,,"多样性有效",, ,,,,,,造成了一个能够推算的数字门槛。 。。。。这意味着理论上你能够提前估算,, ,,,,,,两个模型配对之后到底有没有可能通过协同训练把彼此都拉到正确答案上去,, ,,,,,,而不是拍脑壳决定要不要凑一对。 。。。。 论文里有个细节我反复看了几遍:统一个模型换一个随机种子沉新训练,, ,,,,,,谬误沉叠率(卡帕系数)跟换一个齐全分歧家族的模型比起来,, ,,,,,,竟然差距没有设想中那么幼。 。。。。这注明"多跑几次采样取均匀"这衷煊素的做法,, ,,,,,,可能远远达不到真正意思上的视角独立,, ,,,,,,这也诠氏缢为什么单纯的模型集成(ensemble)成效不如跨家族协同训练。 。。。。 还有一点值得斟酌:这篇论文其实暗示了一个更大的问题,, ,,,,,,当模型能力超过人类标注水平之后,, ,,,,,,"真谛"该由谁来裁定?? ?????CO-RL 给出的答案是"没有绝对权威,, ,,,,,,但能够靠视角的多样性逼近它"。 。。。。这跟人类社会里好多共识形成的机造,, ,,,,,,好比同业评审、陪审团造度,, ,,,,,,在逻辑上有种说不清路不明的类似性。 。。。。这算不算是把一个古老的社聚合作智慧,, ,,,,,,沉新在机械进建里发现了一遍?? ????? A:CO-RL 是一种不必要标注答案的多智能体强化进建步骤,, ,,,,,,让多个互不共享参数的模型同时训练,, ,,,,,,各自用另一个模型的无数投票了局当作参考答案打分,, ,,,,,,从而在没有真实标签的情况下持续提升推理能力。 。。。。 A:TTRL 这类自我嘉奖步骤用模型自己的无数投票了局给自己打分,, ,,,,,,容易把自身私见不休放大导致训练崩溃;;;;;;CO-RL 用另一个独立训练的模型的投票了局打分,, ,,,,,,两者谬误不齐全沉叠,, ,,,,,,能相互纠正对方犯的谬误。 。。。。 A:统一个模型相互监督也能带来提升,, ,,,,,,但成效不如跨模型家族配置。 。。。。论文尝试显示模型家族差距越大、谬误沉叠率越低,, ,,,,,,最终训练成效越好,, ,,,,,,跨家族加数据改写的组合成效最佳。 。。。。

AI 训练自己就能变强???????答案藏在两个互不相识的模型相互打分里

? 记者 何中军 摄 · 更新于 2026-09-03 13:32:25

有关标签
#官方:巴萨中场吉列-费尔南德斯加盟马略卡,, ,,,,,,双方签约至2031年 #美网首轮爆大冷!首位TOP10种子出局,, ,,,,,,新科大家赛冠军止步首轮 #官方:拉齐奥与32岁法国后卫吉戈协商解约,, ,,,,,,球员转为自由身 #具身智能凌驾 "百万幼时" 分水岭,, ,,,,,,今年底将迎来“GPT-3时刻” #9.1.gb.crm直接看(2025已更新)

官方科普:为什么糖豆视频让人刷到停不下来?? ?????一文讲清短视频成瘾的神经机造

官方科普:为什么糖豆视频让人刷到停不下来?? ?????一文讲清短视频成瘾的神经机造: 本文具体介绍了官方科普:为什么糖豆视频让人刷到停不下来?? ?????一文讲清短视频成瘾的神经机造一图读懂信息密度高但档次明显,, ,,,,,,起源幼字标注让人安心。 。。。。偶然认可“目前还没有定论”,, ,,,,,,这种恳切比假装全知强太多。 。。。。转给想辟谣的家人时也不不安语气太冲或太玄乎。 。。。。推送可按兴致关停,, ,,,,,,不会一大早就被震惊体吵醒。 。。。。挺适合想系吐渌解某个问题、又不想正儿八经上课的人。 。。。。

关键词:官方科普:为什么糖豆视频让人刷到停不下来?? ?????一文讲清短视频成瘾的神经机造

【网站地图】【sitemap】