一片森林里有多少只鸟,现在靠“听”就能数出来

图片

各位同学,给森林挂上几台录音器,连续录上几周,再把海量音频交给 AI,研究者就能得到一张“谁在什么时候叫过”的清单。听起来像给鸟类做人口普查,但答案先说:AI 可以大规模识别声音事件和物种出现线索,却不是把树上的每只鸟逐一数清。

这套方法叫被动声学监测(passive acoustic monitoring,PAM):不追鸟、不播放诱声,只把录音器放在那里,安静地收集环境声音。AI 负责从“几千小时没人想听完的录音”里,捞出值得研究的片段。

图片

第一步:把森林的声音变成一张“声谱图”

录音器收到的不是“鸟名”,只是空气振动的波形。模型通常先把长录音切成一小段一小段;BirdNET 的经典版本使用 3 秒音频片段。接着,系统把每段声音转换成声谱图:横轴是时间,纵轴是频率,颜色或明暗表示某个频率在某一刻有多强。

你可以把它想成把一段音乐变成“声音的指纹图”。鸟叫里的音高变化、节奏、持续时间和谐波,会在图上留下不同的纹路。不同鸟种的叫声,往往有各自的纹路组合;风声、雨声、汽车声和昆虫声,也会留下另一套纹路。

图片


BirdNET 这类系统使用卷积神经网络(CNN)扫描声谱图。CNN 最初不会被告知“这一条弯线代表什么”,它要在大量带标签的鸟声样本中,逐层学出哪些局部纹理和时间组合更常与某个物种一起出现。原始 BirdNET 论文用大规模鸟声数据训练了一个可分类数百种鸟的模型,并用独立录音和真实声景检验它。

模型学的不是鸟语,而是在复杂图案里寻找统计上熟悉的形状。输入是声音,输出则是一串物种候选和相应分数。

第二步:AI 不是在数鸟,而是在数“可检测到的声音事件”

假设一段录音里出现了一个候选结果:灰色字体的“某某鸟,0.83”。这句话应该读成:模型认为,这段音频里出现该物种声音的可能性较高。它不是鸟的身份证,也不是“这片林子里有 83 只”的百分比。

一只鸟可能连续叫十次,于是录音里出现十个声音事件;十只鸟也可能同时叫成一团,模型反而只抓住其中几个。还有一些鸟当时安静、离录音器太远,或者叫声被风雨盖住,它们就会在数据里“隐身”。相反,昆虫、机械噪声和别的鸟,也可能制造假阳性——听起来像目标物种,但其实不是。

因此软件导出的“检测次数”更接近候选片段数量,而不是个体数量;置信度分数也只是判断强弱的信号,不能直接翻译成识别正确率,更不能当成鸟群规模。研究者还要保留原始音频、时间、地点和阈值,抽样人工复核。

第三步:从“听见”走到“估算数量”,中间还隔着生态学

如果问题只是“这个地点有没有记录到某种鸟”,模型候选经过复核后,可以帮助建立出现/未出现的数据。把多个地点、多个日期和多次录音放在一起,还可以分析物种丰富度、季节变化或不同栖息地的差异。

但如果问题变成“这里到底有多少只”,就不能只把声音事件加起来。一个更严谨的思路是先估计叫声率:平均每只鸟在单位时间内会发出多少次可检测的叫声,再结合录音器的有效范围、声音传播距离和抽样设计,把“听见多少声”换算成“可能有多少只”。叫声率会随物种、季节、天气、繁殖状态和个体差异改变,不是一个永远固定的换算常数。

研究者还要统一录音器数量、摆放位置、每天录多久、采样覆盖多大范围,并考虑“没听见”到底是鸟不存在,还是它刚好没叫。关于被动声学调查的研究显示,录音时长、空间覆盖和群落中稀有物种的比例,都会改变最终观察到的物种数。听到的不是森林的全部,而是森林在特定时间、特定距离和特定噪声条件下露出来的那一部分。

图片

AI 最擅长的,是把“听不完”变成“查得过来”

在 BirdNET 的原始研究中,模型在较干净的单一物种录音上表现明显好于复杂声景;在那项特定的标注声景测试中,报告的 F0.5 为 0.414。这里的 F0.5 是偏重精确率的综合指标,不等于“识别正确率 41.4%”,也不是所有森林、所有物种都通用的固定数字。但它清楚提醒我们:实验室里清楚的一声鸟叫,和森林里风、雨、昆虫、多种鸟声混在一起的现实录音,不是同一道题。

AI 的价值因此不只是“替人耳朵打分”,而是把分析流程扩大到人类无法逐段听完的规模:先生成候选片段,再按地点和日期筛选,抽样人工检查,最后由生态学模型回答“哪些物种持续出现、哪些地点正在变化”。下游的生态结论,来自模型候选、抽样设计、人工验证和统计分析的共同链条,而不是来自某一次自动识别的弹窗。

很多人会先想到:

AI 在一小时录音里识别出 1000 次鸟叫,就说明森林里有 1000 只鸟。

但更准确地说:

1000 次通常只是 1000 个候选声音事件;同一只鸟可以贡献很多次叫声,多只鸟也可能重叠或完全没有被录到。要估算个体数量,还需要叫声率、检测范围、重复采样和误检校准,不能直接把检测次数当成鸟的数量。

所以,“靠听数鸟”真正改变的,不是把 AI 变成一台神奇点名机,而是把生态调查的瓶颈从“人类听不完”换成“如何设计好采样、校准好模型、解释好不确定性”。AI 先告诉你哪里可能有鸟,科学方法再决定这条线索能不能成为结论。

如果你也想把一段自然声音变成可检验的数据,欢迎在留言区写下你最想监测的场景。