一个看似简单的计算机视觉问题正在获得更通用的答案
现代 AI 系统可以为图像生成说明、识别对象并提取文字,但计数仍然是最难泛化的视觉任务之一。一个在人群中表现良好的模型,可能在显微镜下的细胞或卫星图像中的车辆上表现失败。这种差距很重要,因为计数不是玩具问题。它出现在医学影像、农业、交通分析和对精度要求很高的科学工作中。
一个名为 Count Anything 的新研究系统旨在通过将对象计数变成通用能力来解决这一限制。根据来源材料,该模型可以仅凭文本提示,在非常不同类型的图像中对对象进行计数并加标签。其目标是构建一个单一系统,可以被要求统计人头、汽车、细胞或细菌菌落,而不需要为每个领域单独训练一个专门模型。
这正是这项工作值得注意的原因。难点不只是检测,而是在处理对象尺度、尺寸和场景密度截然不同的情况下,避免计数系统常见的重复计数和歧义问题。
两种计数方法,被组合进同一个系统
Count Anything 的核心设计是混合式的。来源称,该模型结合了两种互补方法。其中一种基于区域,最适合较大且清晰可见的对象,会为其画出边界框。另一种基于像素,针对更小或更密集的目标,使用点而不是框。系统会把两种输出合并为最终的计数对象集合。
这种方法解决了视觉 AI 的一个常见失败模式。大型对象和紧密堆叠的小对象往往需要不同的处理方式。人群计数器可能擅长密集的人头统计,却不擅长较大且分散的物体。为框检测训练的模型可能会漏掉密集的微小目标。研究人员试图通过把任务拆分再整合输出来同时覆盖两端。

整合步骤和双模型设置同样重要。根据来源,当两种方法都标记到同一目标时,一个简单的置信度规则会决定保留哪一个预测,从而防止重复计数。这是一个非常实用的问题的实用解法:如果两个独立计数器看到的是同一个物体,系统就需要一种方式把它合并成一个答案。
建立在 Meta 的 SAM3 之上
研究人员并没有从零开始构建整个模型。该系统以 Meta 预训练的 SAM3 为基础,利用其同时处理图像和文本的能力。团队没有重新训练整个网络,而是为计数任务添加了更小的适配器组件。
这一选择符合 AI 开发中的一个更广泛趋势。研究人员越来越多地不是为每个新用例重建通用多模态模型,而是从一个有能力的基础模型出发,添加任务特定的层或模块。好处显而易见:训练成本更低、实验更快,也更有可能在不同领域之间迁移知识。
在这里,迁移目标格外广泛。该模型旨在适用于卫星图像、医学扫描、实验室照片和日常图片。如果这种方法能够扩展,就意味着计数可以不再被视为一堆彼此独立的垂直任务,而是一个通用的视觉推理功能。
定制数据集和强劲的基准结果
来源称,Count Anything 使用名为 CLOC 的定制数据集训练,并在测试中优于多种竞争系统。这样的性能主张很重要,因为如果泛化是以准确率为代价,那就没有意义。计数系统的生死取决于它们在场景变得混乱、拥挤或领域迁移时,是否还能保持精度。

与此同时,这份报道也谨慎地没有夸大结果。模型在含义模糊的术语和极其密集的场景中仍然会遇到困难。这些限制很关键,因为它们指出了问题尚未解决的部分。即使是人类,在语言含糊或场景视觉上过于杂乱时,也可能对到底该数什么意见不一。比如“数一下车辆”听起来很简单,直到遇到玩具车、部分遮挡,或远处无法完全分辨的形状。
密集图像是另一个持续性挑战。当对象严重重叠或几乎难以区分时,计数就更像统计估计,而不像标准检测。一个能很好处理某种密度的系统,仍可能在另一种密度下失效。这也是为什么这种混合设计值得关注,尽管它还没有完全解决边缘情况。
为什么通用计数很重要
如果 Count Anything 或类似系统成熟起来,其影响可能远超基准榜单。在医学中,可靠的计数可以支持基于图像的分析,帮助临床医生估计细胞、病灶或其他可见目标的数量。在农业中,统计植物或作物特征有助于产量评估。在交通和城市规划中,统计汽车或行人可以为交通管理提供依据。在科学研究中,对密集图像中的微小结构进行计数是一项常见但繁琐的要求。
基于提示词的系统之所以有吸引力,是因为它降低了用户意图和机器输出之间的门槛。用户不必为单一类别选择狭窄工具,而是可以用语言指定对象,然后得到计数结果以及说明包含了哪些对象的视觉标记。这样的可解释性很有价值,因为用户可以检查系统数对了什么,而不仅仅是它给出了一个看似合理的总数。
这项研究没有消除计数中的难点,但它重新定义了这些难点。它不再把计数视为一系列孤立的小众任务,而是把它视为一个具有领域差异的共享多模态问题。这是一个更雄心勃勃的目标,而根据来源,初步结果已经强到值得继续密切关注。
本文基于 The Decoder 的报道。阅读原文。
Originally published on the-decoder.com


