• 首页
  • 国内
  • 国际
  • 军事
  • 财经
  • 房产
  • 汽车
  • 体育
  • 娱乐
  • 教育
  • 科技
  • 社会
  • 当前位置:我的网站主页 > 我的网站国内 >

    {主关键词}

    黄飞鸿

    最新!俄罗斯:限他于一周内离境;俄副外长称不排除降低与美外交关系级别的可能......_我的网站

    整蛊专家

    A |     

    据央视新闻,当地时间5月17日,塔斯社报道称,俄罗斯外交部副部长里亚布科夫表示,俄方不排除在某些情况下,降低与美国外交关系级别的可能。    这项研究来自复旦大学与上海财经大学的联合团队,论文以预印本形式于2026年7月9日在arXiv公开发表,编号为arXiv:2607.08688,感兴趣的读者可通过该编号查阅完整论文。         你有没有想过,当一辆自动驾驶汽车行驶在繁忙的十字路口时,它的"眼睛"需要同时盯住多少个目标?行人、自行车、公交车、出租车、路边突然跑出来的小狗……每一个都不能漏掉,而且要实时、毫不迟疑地判断每个目标的位置和边界。这不是科幻场景,而是现代计算机视觉系统正在努力攻克的真实难题。复旦大学的研究团队最近拿出了一套名叫SAM-MT的新方案,在这个问题上迈出了关键的一步。

    B |

    另据参考消息,俄新社5月16日报道,俄罗斯外交部在官网上发布公告,宣布英国驻俄使馆武官阿德里安·科格希尔为不受欢迎的人,以报复伦敦之前的类似举措。公告称:“作为对(伦敦)决定的回应,限他于一周内离开俄联邦领土。”
    俄罗斯总统府 克里姆林宫参议院(图片来源:每经特约记者 张小婕 摄 图文无关)
    当地时间5月17日,塔斯社报道称,俄罗斯外交部副部长里亚布科夫表示,俄方不排除在某些情况下,降低与美国外交关系级别的可能。
    里亚布科夫表示,美国在对俄关系上已陷入无法控制的崩溃危机中,美国当局的政策不允许就战略稳定问题继续举行相关会晤。
    里亚布科夫还表示,北约正处于与俄罗斯发生直接武装冲突的边缘。俄方并不信任北约,但有关俄罗斯计划攻击北约国家的言论是荒谬的。
    据参考消息, 俄新社5月16日报道,俄罗斯外交部在官网上发布公告,宣布英国驻俄使馆武官阿德里安·科格希尔为不受欢迎的人,以报复伦敦之前的类似举措。
    公告称:“作为对(伦敦)决定的回应,英国驻莫斯科使馆武官科格希尔被宣布为不受欢迎的人。         当前业界最强的视频目标分割工具——比如大名鼎鼎的SAM2(Segment Anything 2,由Meta AI开发)——虽然能够精准地在视频里"圈出"某个物体并持续追踪它,但有一个致命的弱点:每多追踪一个目标,系统就要多跑一遍完整的计算流程,就好像一个厨师,无论做几道菜,都必须把整个厨房从头收拾一遍才能下锅。追踪1个目标时,SAM2能跑到每秒37帧的流畅速度;但追踪3个目标时,速度就跌到17.8帧;追踪5个目标,更是只剩12.4帧——画面已经开始出现明显卡顿。如果目标再多,整个系统几乎就跑不动了。

    C | 限他于一周内离开俄联邦领土。”

    据央视新闻,英国媒体5月8日报道,英国内政部宣布驱逐一名俄罗斯驻英武官。

    D | 英国内政大臣詹姆斯·克莱弗利当天对英国议会下院表示,将驱逐这名俄罗斯驻英国武官。         SAM-MT的核心思路,就是彻底改变这种"追一个、算一遍"的低效模式,让系统无论面对多少个目标,计算量都几乎保持不变。此外,克莱弗利表示,英国将取消俄罗斯在英国拥有的几处房产的外交馆舍地位。结果相当令人印象深刻:追踪10个目标时,SAM-MT仍然能跑到36帧以上的实时速度,与追踪单个目标时几乎无异,是SAM2在同等条件下的6倍速度。

    E |

    克莱弗利还说,英国正在对俄罗斯公民获取外交签证实施新的限制,包括限制俄外交官在英国停留的时间。
    俄外交部召见了英国使馆代表,宣布了俄方决定。俄方向此人提出抗议,认为英国的举动是仇俄的体现,并对双边关系造成了无法弥补的损害。
    俄外交部还提到,对伦敦5月初宣布的不友好举动的报复并未完结。

    F |

    报道称,俄外交部发言人扎哈罗娃指出,英国在未提供证据或具体事实的情况下,以伦敦郊区商业仓库失火有所谓的“俄罗斯痕迹”为由,采取了上述措施。
    俄外交部第二欧洲司司长别利亚耶夫此前说,俄英关系正在经历史上最严重的危机之一。
    。与此同时,它在六个主流视频分割基准测试上的准确率,依然与SAM2的最强版本旗鼓相当,甚至在部分场景下略有超越。         一、多目标追踪的老大难:为什么加一个目标就慢这么多          要理解SAM-MT解决了什么问题,得先搞清楚传统方法是怎么运转的,以及它在哪里卡了壳。         视频目标分割,通俗地说,就是在视频的每一帧里,把你指定的那个东西(比如一只猫、一辆红色轿车)精确地"涂出来",并且随着视频播放,这个"涂色区域"要始终跟着目标走,不跑偏、不认错。这个任务背后最流行的技术框架叫做"时空记忆网络"(STM范式),核心思路是给每个被追踪的目标建一个专属的"记忆本",记录这个目标历史上长什么样、在哪里出现过,然后在新的一帧里,把当前画面和记忆本做比对,找到目标的位置,再精确地把它圈出来。         这个记忆本是非常"厚重"的——它存储的是像素级别的特征图,一张高清图片里有数千个像素点,每个点都要记录一套复杂的特征描述。追踪一个目标,维护一本记忆本;追踪两个目标,就得同时维护两本——不仅如此,每处理一帧新画面,所有的比对、更新、解码操作都得对每本记忆本各做一遍。

    G | 这就像一个办公室职员,每多接手一个客户案例,他就要把整套接待流程完整地走一遍,客户越多,他就越忙,而且是线性地越来越忙,没有尽头。         后来出现了STCN、XMem、Cutie等改进方案,它们做了一个聪明的优化:提取图像特征这一步,可以所有目标共享,只算一次。这确实减少了一部分重复计算,但问题的根源没有被触动——每个目标的"专属记忆匹配"和"专属掩码解码",仍然需要独立地跑一遍。打个比方,这就像多个厨师共用一台打蛋机来打蛋液,但每人还是要独立地完成切菜、炒锅、摆盘全套流程。共用的那台机器省了点时间,但整体的忙碌程度仍然随人数线性增长。         还有一种听起来聪明、实则行不通的方法:干脆把所有目标合并成一个大目标来追踪。比如同时追踪三辆车,就把三辆车的轮廓合并成一个奇形怪状的大轮廓,当成一个目标来处理。这样确实只用算一遍,但代价是失去了"谁是谁"的身份信息——你不再知道这是第一辆车还是第三辆车——而且这个合并出来的怪形状,在现实世界中根本不存在,AI模型是用真实物体的图片训练出来的,它根本认不出这个东西,很快就会追丢。论文里专门做了实验验证这一点:让SAM2追踪三辆合并后的"超级车",很快就彻底失去了目标。         二、SAM-MT的核心思路:用"通缉令"代替"全程录像"          SAM-MT的解法,可以用一个侦探团队办案的比喻来理解。         传统方法就像这样:团队里有10个嫌疑人需要监视,就派10个侦探,每人全程跟踪一个嫌疑人,各自记录详细的行动录像,互不干扰,但人手成本随嫌疑人数量线性增长。         SAM-MT换了一种玩法:整个团队共享一套城市监控系统(这是"全局上下文"),掌握所有嫌疑人所在区域的大环境信息;同时,每个嫌疑人只有一张精简的"通缉令"(这就是"目标查询",target query),上面记录了这个人的关键特征。侦探们用共享的监控系统扫描全局环境,同时拿着各自的通缉令在里面找对应的人,一次扫描,所有人同时完成比对。新增再多嫌疑人,也只是多几张通缉令而已,监控系统本身不需要重新跑一遍。         在技术层面,SAM-MT在SAM2的架构基础上做了以下几项关键改造,每一项都至关重要,共同构成了这套系统的完整解法。         三、解耦掩码注意力:让"通缉令"彼此不干扰          多目标同时处理的最大风险是"串台"——追踪猫的那套特征,和追踪狗的那套特征,可能会相互影响,导致AI搞混了谁是谁。

    H |          SAM-MT用一个叫做"解耦掩码注意力"(Decoupled Masked Attention)的机制来解决这个问题。在AI的注意力计算中,有一种操作叫"自注意力",让所有的"查询"(queries)互相交流信息、相互参考。在多目标场景里,如果来自不同目标的查询可以随意交流,那么A目标的信息就会流入B目标的描述里,最终导致身份混乱。         SAM-MT的做法是在这个交流过程中加一张"隔离屏障":不同目标的专属查询之间,交流被直接屏蔽,设置为负无穷(相当于"对方根本不存在");但所有目标的专属查询,都可以自由地与代表全局环境的"全局查询"交流。用侦探比喻来说:各位侦探拿着自己的通缉令,不能互相分享内容、以免混淆嫌疑人特征,但他们都可以查阅公共的城市地图和监控档案,了解大环境。这样,每个目标既保持了自己的独立身份,又都能感知到整个场景的全局信息,二者不再是非此即彼的选择。         数学层面上,这个隔离屏障用一个注意力掩码矩阵M来实现:矩阵里,全局查询与所有查询之间的位置填0(允许交流),同一目标的查询彼此之间填0(允许交流),不同目标的查询之间填负无穷(完全阻断)。这个设计精巧地同时实现了两个目标:保护身份的独立性,同时共享全局上下文。         研究团队通过消融实验验证了这个设计的必要性。如果去掉隔离屏障,让所有目标的查询自由混合,准确率(J&F指标)会从43.0骤降到37.5,足足跌了5.5个百分点;反过来,如果把隔离做得过头,连全局查询也被隔离,准确率则降到39.3,跌了3.7个百分点。只有"解耦"这个恰到好处的中间状态,才能同时保住身份和上下文。         四、查询聚合:把多个"线索"压缩成一张"通缉令"          在用户第一次指定目标时,可以对同一个目标点多个点(正点击表示"这里是我要追踪的",负点击表示"这里不是"),提供更精确的初始描述。这些多个点会产生多个初始查询。         SAM-MT用一个轻量级的"加权头"(MLP-based weighting head)把这些多个查询合并成一个单一的"目标查询":系统会自动评估每个点的重要性,给重要的点更高的权重,然后加权平均,得到一个最具代表性的单一向量。这个单一向量就是后续帧中代表这个目标的"通缉令"。         从第二帧开始,每个目标只有一个查询在流转,既简洁,又携带了最关键的身份信息。这个设计把初始帧"点多个点"的灵活性,与后续帧"单一查询"的高效性,优雅地衔接在了一起。         五、稀疏记忆:用"关键词档案"替代"全程录像带"          SAM2的记忆系统非常"重":它存储的是每一帧图像的像素级特征图,一帧图像大约有4096个特征"像素点",每个点都有一套完整的特征描述。如果为每个目标单独维护这样一套记忆,随着目标数量增加,内存占用会急剧膨胀。         SAM-MT的应对方案是引入"基于查询的稀疏记忆"(Query-based Sparse Memory)。核心思路是:不再给每个目标存储完整的像素级记忆,而是只存储那个经过聚合的"目标查询"——一个目标,一帧,只有一个向量。         这个设计的压缩效率极高。用数字来说,传统方法每帧每目标需要存储4096个特征点,而SAM-MT只需要1个查询向量。这意味着同样的内存,SAM-MT可以往记忆库里存放多得多的历史帧,从而让系统"记住"更长时间跨度里目标的变化。这对于处理目标被遮挡后重新出现的场景尤为重要——记忆越长,就越不容易在目标消失一段时间后把它认错。         实验数据印证了这一点:在长序列基准测试LVOSv2和LVOSv1上,SAM-MT比SAM2.1-B+分别高出了2.0和2.3个百分点,而这两个数据集正是专门考验长时序追踪能力的。内存占用方面,追踪20个目标时,SAM2.1-B+需要8585MB显存,SAM-MT只需要3785MB,相差悬殊。         在稀疏记忆的具体组织上,SAM-MT采用先进先出(FIFO)的滑动窗口策略:始终保留第一帧的目标查询(因为那是用户初始指定的"基准形象"),以及最近T-1帧的目标查询。论文实验测试了不同窗口大小(8、12、16、32帧)的效果,最终选定16帧作为速度与精度的最佳平衡点。         六、身份变换器:确保"通缉令"随时间自动更新          目标不是静止的,它们会运动、旋转、被遮挡、改变姿态。一张在视频开头拍的"通缉令",到了视频后半段可能已经不太准确了。SAM-MT用"身份变换器"(Identity Transformer)来解决这个问题。         在每一帧处理结束后,当前帧的目标查询会被存入稀疏记忆。

    I | 在处理下一帧时,身份变换器会让上一帧的目标查询,去"查阅"稀疏记忆里这个目标的所有历史查询,通过注意力机制综合参考历史信息,对当前查询进行更新和校正。这就像侦探每天下班前,会把今天观察到的新线索与历史档案对比,更新对嫌疑人最新状态的判断,让明天的追踪更精准。         身份变换器同样引入了一个"身份感知掩码":每个目标的查询只能查阅自己历史档案里的记录,不能跨目标查阅,从而杜绝了历史记忆层面的"串档"风险。消融实验表明,去掉这个掩码后,J&F指标会下降3.9个百分点。此外,研究团队测试了不同深度(1层、3层、5层)的变换器,最终选择3层,以在精度和速度之间取得平衡。         七、训练策略:让模型学会应对现实的复杂性          一个好的模型框架,还需要配套合理的训练策略才能发挥出应有的潜力。SAM-MT在训练上采取了几个有针对性的设计。         训练分为两个阶段:第一阶段在静态图片上训练,确保模型能够准确地从点击信号出发,一次性完成多目标的图像分割;第二阶段在视频序列上训练,强化跨帧的身份一致性。这个"先学静态、再学动态"的课程式学习策略,让基础打得更扎实。实验表明,去掉图像预训练阶段,准确率会下降2.7个百分点。         帧采样策略也经过精心设计。

    J | 传统方法通常采样相邻的连续帧,这对于应对快速运动有好处,但对于"目标消失后重新出现"这种长时间跨度的事件,相邻帧的训练几乎没有帮助。SAM-MT采用"跨步采样":每次训练取8帧,其中一部分是连续帧(捕捉短期运动),另一部分是间隔4帧的跨步采样(覆盖更长的时间窗口,最多跨越32帧)。去掉跨步采样后,准确率下降1.3个百分点,而且在目标重新出现的场景中,系统会频繁认错目标。         重叠惩罚损失函数是另一个关键设计。在多目标场景中,如果两个目标的预测掩码出现重叠(即同一个像素被判定属于两个不同目标),就意味着身份出现了混乱。SAM-MT在损失函数里加入了一项专门的惩罚项:对于目标i的预测概率图,计算它与所有其他目标概率图的逐元素乘积,取平均值作为惩罚项,鼓励模型尽量输出互不重叠的掩码。这在羊群、车队等密集场景里效果尤为明显,能显著减少同一像素被多个目标"抢占"的混乱情况。         八、实验结果:数字背后的真实表现          SAM-MT在六个主流视频分割基准测试上进行了全面评估,每一个都代表了不同的真实挑战场景。         MOSEv2和MOSEv1是专门收录了频繁遮挡、快速运动、低光照、目标密集等极端场景的数据集。SAM-MT在MOSEv2上达到43.0分(J&F指标),超过了之前最好的结果Cutie的42.8分和SAM2.1-B+的41.1分。值得注意的是,SAM-MT和SAM2.1-B+都使用点击初始化,而其他方法使用的是更为"作弊"的真实标注掩码初始化,这意味着SAM-MT在更弱的初始条件下取得了更好的结果。         LVOSv2和LVOSv1是专注于长时序追踪的数据集,视频更长,目标会长时间消失后重新出现。

    K | 这正是稀疏记忆设计的主场,SAM-MT的优势也最为突出:在LVOSv2上达到76.6分,比SAM2.1-B+的74.6高出2.0分;在LVOSv1上达到73.6分,比SAM2.1-B+的71.3高出2.3分。         SA-V val和SA-V test是包含大量遮挡和局部目标(如只露出头的人)的数据集,SAM-MT同样与SAM2.1-B+持平,在val上分别为66.1对65.6,在test上并列于66.4对66.1。         速度方面的对比最为直观。研究团队专门构建了一个合成基准测试,包含20个视频序列,目标数量从1个到20个分布,每个序列100帧,用来测量不同方法在不同目标密度下的帧率变化。在单目标时,SAM-MT和SAM2.1-B+的帧率相同,都是37.2帧/秒。但随着目标数量增加,SAM2.1-B+的帧率急剧下滑:3个目标时17.8帧,5个目标时12.4帧,9个目标时7.8帧,20个目标时只剩3.7帧。SAM-MT的帧率曲线则近乎水平:3个目标36.8帧,9个目标36.3帧,20个目标35.4帧,几乎感受不到任何差异。         在真实的视频数据集上,这种差距同样显著。以MOSEv2数据集中包含5个以上并发目标的子集为例,SAM-MT的帧率从整体的36.9帧仅轻微下降到35.8帧,而SAM2.1-B+从32.1帧骤跌至11.5帧,Cutie(1024p分辨率)从21.3帧跌至10.2帧。

    L |          九、真实场景中的表现:密集、相似、遮挡          研究团队还做了一系列定性实验,在真实视频里直观展示了SAM-MT的效果。         在高密度场景中,包括马戏表演(多个演员持续交叉移动)、鸭群(大量外观相似的鸭子)、团体健身课(十几个动作相似的参与者),SAM-MT都能为每个指定目标维持精确、稳定的分割轮廓,不同目标的颜色标记清晰分明,几乎没有出现混淆或丢失目标的情况。         在身份模糊场景中(如多只熊猫在草地上玩耍、多辆公交车在站台前停靠、台球游戏中多个颜色相近的球),SAM2.1-B+的表现是:开始时追踪正常,但过了一段时间后,要么丢失了某个目标,要么把两个目标的身份搞混,用错误的颜色标记了目标。

    M | SAM-MT则全程保持了正确的身份标记,多只外观相近的目标始终被用不同颜色准确区分。         这背后的原理差异在于:SAM-MT通过解耦掩码注意力,让全局上下文信息在所有目标之间共享,这使得系统在做判断时,知道场景里还有其他目标存在,可以利用"这个区域已经被另一个目标占据了"这样的信息来辅助判断;而SAM2每个目标完全独立处理,对其他目标的存在一无所知,更容易被相似的干扰物迷惑。

    N |          说到底,SAM-MT做的事情并不神秘——它就是把"追踪多个目标"这个问题,从"一个接一个地串行处理"变成了"一次全部并行处理",同时通过精巧的隔离机制确保不同目标的信息互不干扰。

    o | 这种思路的转变,让速度和效率的提升几乎是量级上的。

    p |          对普通人而言,这项研究意味着:未来的视频监控系统、自动驾驶视觉模块、运动分析工具,在处理密集多目标场景时,不再需要在"追踪精度"和"实时速度"之间艰难取舍。当然,SAM-MT目前仍然是纯视觉的系统,它看的懂画面,却不理解画面的语义——比如它能把一只猫精确圈出来,但它不知道这只猫正在捉弄它旁边的那只狗。研究团队也指出,将这套高效的多目标追踪框架与多模态大模型结合,是下一步值得探索的方向。         有兴趣深入了解技术细节的读者,可以通过arXiv编号2607.08688查阅完整论文,代码也已在GitHub的FudanCVL/SAM-MT仓库开源。         ---          Q&A          Q1:SAM-MT追踪多个目标为什么比SAM2快这么多?          A:SAM2追踪多个目标时,每新增一个目标就要完整重跑一遍记忆匹配和掩码解码,速度随目标数量线性下降。SAM-MT用轻量级"目标查询"代替了每个目标的完整像素级记忆,所有目标共享一套图像处理流程并行处理,增加目标只是多了几个查询向量,计算量几乎不变,所以追踪10个目标的速度依然能达到36帧以上。         Q2:SAM-MT是怎么避免追踪多个目标时把身份搞混的?          A:SAM-MT设计了"解耦掩码注意力"机制:不同目标的专属查询之间被完全隔离,不能相互参考,避免了特征污染;但所有目标都可以访问代表全局场景的公共查询,保持对整体环境的感知。同时,身份变换器在更新每个目标的查询时,也严格限制每个目标只查阅自己的历史档案,从根本上切断了跨目标的"串台"路径。         Q3:SAM-MT在哪些实际场景里能用上?          A:SAM-MT适合任何需要实时追踪多个物体的场景。自动驾驶需要同时追踪周围所有行人和车辆;体育分析需要实时标记场上所有球员的运动轨迹;视频监控需要持续识别多个嫌疑目标;机器人导航需要同时感知多个障碍物。

    q | 这套方案在目标密集时仍能保持实时速度,正好满足这类场景对"快"和"多"的双重需求。

    Current article:http://kqzxl.wengsengzhanhuangu.cyou/news/20260826_64714.html

    Published on:00:00:00


  • 上一篇:How China's new environmental code translates national ecological goals into everyday rules
  • 下一篇:惹了中国,灭亡不远了!盯着打!追着打!坚决摧毁!

    我的网站热门国内

  • 8136036塔城彩民收获 刮刮乐“囍”100万元一等奖
  • 3201951风从黄海来!亚洲首个柔直海上风电项目清洁电力输出迈上新台阶
  • 3940072China imposes anti-dumping tariffs of up to 54.3 % on US, Mexican pecans in form of deposits: MOFCOM
  • 571全球俱乐部品牌价值排行榜出炉:皇马连续第3年排行第一;中国足球俱乐部方面,北京国安排名第一
  • 700511望海满族乡:葡萄产业“亮晶晶”
  • 8008488中信期货:乙二醇市场情绪出现极致反转,短期高点已现
  • 830650怎么选择南昌西站酒店适配不同出行场景
  • 75835देश के हर हिस्से में पहुंची PNG, विभिन्न राज्यों में प्राकृतिक गैस की कीमत में अंतर इसके विस्तार में बड़ी बाधा
  • 172小因:丢球不是比塞克一个人的错;正确分析输球能成冲刺动力
  • 35764145-year-old giant panda Bao Li celebrates birthday in the U.S.
  • 7689420A股三大指数集体低开,新股N高凯上市首日高开240.61%
  • 7130927google unqualified:要求通话记录和短信息权限的应用程序如果不合格将被取消
  • 45787Datong's agricultural trade surpasses 250 mln yuan in H1
  • 767137TA:维拉就引进科法内与勒沃库森接洽,但药厂不愿放人
  • 1460614《征召15:黑行动4》正式宣布“吃鸡”模式17天免费。
  • 1784855公示!“闽超”拟新增2名台胞球员
  • 902973沿着总书记的足迹 | 从采煤沉陷区到宜居乐园 东华园社区的华丽蜕变
  • 873536市委举行学习贯彻习近平新时代中国特色社会主义思想读书班暨市委理论学习中心组学习会议
  • 56771One dead 9 injured after ceiling of a building collapses in Delhi
  • 11418终极对决!西班牙VS阿根廷,谁能夺冠?
  • 69284China issues red alert as Typhoon Dolphin approaches
  • 3017全市规划资源系统迎战强降雨做好地灾防范
  • Copyright @ 2016-2017 我的网站 版权所有