CMYNetwork 红
海洋剖面资料已经公开,为什么下载后仍要读质量标记和处理阶段
开放海洋资料库解决的是取得问题,不会替研究者决定哪些数值适合进入分析。本文以 Argo 文件结构和 IOOS 实时温盐质控手册为依据,说明怎样区分实时值、调整值、质量标记、误差与填充值,并把筛选决定写成可复核记录。
同一批海洋温盐剖面可以顺利下载、正常打开,也能在几分钟内画成看似平滑的曲线。真正危险的情况不是文件报错,而是图形太像“已经可以使用”。分析脚本可能把原始温度、调整盐度、估计位置和缺测占位值放进同一张表,再用一条趋势线把差异压平。公开资料库已经解决了访问问题,却不会替使用者判断每一个数值是否适合回答眼前的科学问题。
Argo Program 的文件使用指南把这个差别写得很清楚。Argo 实时剖面通常在浮标完成观测后 12 至 24 小时公开,自动测试主要发现明显错误。这样的速度对业务监测、航行参考和快速查看海况很重要,但快速公开不可能同时完成所有漂移判断、交叉校准和长期一致性审查。因此,下载成功只能证明资料已经送到使用者手上,不能证明每个变量都到达最终处理阶段。
实时文件解决速度,延迟文件处理精度
实时模式的价值是真实的。海上观测若必须等一年才能出现,就无法支持当天或当周的监测。Argo 的实时文件会保存仪器测得的参数,并让每个参数带有对应的质量标记。自动测试会检查明显超出范围、尖峰、位置或其他可以及时判定的问题。IOOS 的 QARTOD 温盐手册也把实时质控拆成 13 项测试,并分成必做、强烈建议和建议三层。这套层级承认不同平台与观测计划不可能使用完全相同的测试组合。
但是,实时测试的能力有明确边界。传感器缓慢漂移可能让每一次变化都很小,小到不会触发尖峰或变化率检查;经过数月后,累积偏差却足以影响长期趋势。岸边固定站、移动平台和深海剖面仪面对的水团、采样间隔和运动方式也不同,同一阈值不可能在所有环境中表达相同含义。QARTOD 因而要求经营者依计划需求与历史知识选择阈值,并把阈值和质控过程写进元数据,而不是把示例数字当成普遍真理。
延迟模式处理的是另一种问题。Argo 核心延迟模式常在观测后一至两年形成,并提供调整值、调整后质量标记与调整误差。海洋学专家会查看较长时间序列,并以高质量船测 CTD 资料和气候参照判断盐度偏差。等待换来的不是形式上的“复核章”,而是实时阶段无法取得的时间背景、外部比较和不确定度估计。传感器漂移和微小偏差要靠更长时间序列、外部参照与专家审查才能判断,因此实时 QC 与延迟校正解决不同问题。
这不表示实时资料都是坏资料。若任务是确认某海域是否出现大幅异常,十二小时后的初步剖面可能比一年后的精细校正更有行动价值。若任务是计算全球海洋热含量、混合层深度或十年盐度变化,微小系统偏差会累积到足以改变结论,此时未经调整的实时值就可能不合适。实时资料适合强调时效的业务判断,延迟调整资料更适合对微小偏差敏感的长期趋势;两者不是好资料与坏资料的简单对立。
原始变量与调整变量不能凭空互换
打开 netCDF 文件后,最容易犯的错误是只找名称最短的那一列。Argo 文件会同时保留原始参数和带有 ADJUSTED 后缀的调整参数。核心文件中,DATA_MODE 为 R 代表没有调整资料,此时只能使用原始参数;DATA_MODE 为 A 或 D,则应使用对应的调整参数。若脚本总是取 TEMP 或 PSAL,不检查模式,它会在调整结果已经存在时仍抓取原始值。若脚本无条件取 ADJUSTED,又可能把尚未调整的空栏当成数值。
生物地球化学剖面还多一层复杂性。氧、硝酸盐、叶绿素等参数可能在不同时间完成校正,一个文件级状态不足以表达每个参数的处理阶段。Argo 指南要求查看 PARAMETER_DATA_MODE,再决定某个参数应取原始值还是调整值。这意味着“这一份文件是延迟文件”也不是完整的筛选条件;真正进入分析的是变量,处理状态也必须跟着变量走。
把两种变量混在一起的后果不一定立即显眼。若多数剖面是调整值,少数早期剖面仍是原始值,图上可能只出现很小的折线变化。可是在计算区域平均、年际差异或阈值事件时,这些小差异会被误认成海洋变化。正确做法不是看到 ADJUSTED 就一律覆盖原始栏,而是把选择规则写进读取程序,并统计每种模式实际保留了多少观测。
质量标记不是一个万能的及格线
质量标记也不是简单的“零代表失败、一代表通过”。Argo 的定义中,0 表示没有执行质控,1 表示良好,2 表示可能良好,3 表示资料有问题但可能修正,4 表示坏资料。8 表示估计值,9 表示缺测。调整后的不确定度另存于 PARAM_ADJUSTED_ERROR。由此可见,一个旗标数字不能同时回答资料是否经过调整、调整幅度有多大、误差是否符合研究需求,以及位置是否为估计值。
旗标 8 特别容易被误读。冰下剖面的时间或位置可能经过估计;估计并不等于随意编造,它可能是唯一可用的空间信息。但若研究问题对精确位置很敏感,估计位置就需要单独处理。相反,研究大尺度水团分布时,合理估计的位置或许仍有价值。旗标 9 则是缺测占位,绝不能作为普通数值参与平均。若资料库以极大负数表示填充值,而脚本漏掉属性中的缺测定义,整个区域平均会被一个占位值拖垮。
旗标 3 与 4 的区别同样重要。前者表示坏资料仍可能经科学修正,后者表示坏且不可调整。在研究者没有完成相应修正时,两者都不应悄悄进入正式统计;但保存旗标 3 的记录,有助于之后重新处理。把所有异常列直接删除,会丢掉资料为何被排除、是否可能修复以及排除集中在哪些年份的线索。

QARTOD 的实时旗标使用另一套具体定义:通过、未评估、可疑或高度关注、失败与缺测。它强调“通过”是通过关键实时检查并可作为初步资料,不是对所有未来用途的终身认证。把不同系统的旗标数字直接合并尤其危险;相同数字在不同规范中可能不是同一含义。跨资料库分析必须先把各自定义映射成明确状态,再决定共同筛选规则。
自动测试为什么抓不到所有偏差
实时质控擅长找出可以马上描述的异常,例如语法损坏、位置不合理、数值超出物理范围、突刺、变化率过快或长时间不变。它不擅长判断一个缓慢漂移的传感器是否偏了几千分之一,也不能凭单次剖面知道水团边界是真实变化还是仪器响应。后者需要邻近观测、历史资料、回收后的校准或专家对整段时间序列的判断。
IOOS 手册明确把现场实时观测作为范围,事后处理和延迟模式不在这 13 项测试的任务内。这个限制不是缺陷,而是职责划分。若把每项延迟分析都塞进实时流程,资料会失去及时发布的意义;若把实时通过当成最终校正,使用者又会高估自动测试。两阶段并存,正是为了让速度和精度分别有可追踪的处理路径。
阈值也必须有环境背景。热带表层、极区冰下和河口锋面的正常变化幅度不同;固定站五分钟一次的时间序列,与漂流浮标十天一次的剖面,不应共享同一个变化率阈值。QARTOD 要求经营者公开阈值、例外和质控流程,原因就在这里。没有元数据的“通过”只剩一个结果,使用者无法判断测试是否适合自己的海域和尺度。
研究问题决定筛选严格度
若目标是建立最干净、最可比的长期资料集,Argo 建议优先选择延迟模式、质量标记 1 且调整误差较小的值。这是一个保守起点,不是所有研究都必须照抄的唯一规则。严格条件会提高一致性,也会减少样本;在高纬、冰下或早期资料稀少的区域,过度筛选可能造成新的空间偏差。
因此,筛选之前要写出研究能容忍什么。研究微小年际趋势,需要防止小偏差累积,应优先使用延迟调整值,并为误差设上限。研究极端事件是否发生,可能允许质量标记 2,但要做包含与排除该等级的敏感度比较。研究资料覆盖率,则不能把估计位置简单删除,因为估计本身就是观测限制的一部分。每一种放宽都应有问题驱动的理由,而不是为了让图上多几个点。
旗标 1 只表示通过相应质量检查,不能替代处理阶段、调整误差和研究尺度的判断。反过来,旗标不是 1 也不等于毫无价值。可疑资料可以用来发现传感器问题,缺测分布能显示观测盲区,调整前后差异可以研究校准效果。关键是不要让这些不同用途共用同一个未经说明的分析样本。
一个有用的控制比较,是用同一段程序分别建立严格集与扩展集。严格集只保留延迟调整、旗标 1 和较小误差;扩展集再纳入预先允许的旗标 2 或实时调整资料。若两者对趋势方向、季节峰值和空间格局给出相同结论,结果较稳健。若结论明显改变,报告中就必须把筛选敏感性当成主要结果,而不是把差异藏在附录。
从下载目录到可复核的资料清单
可靠分析需要留下比“资料来自 Argo”更具体的记录。每次取用都应保存资料快照或可定位的文件清单,并写明下载日期与档案中心。记录还要注明使用原始变量还是调整变量,以及对应的 DATA_MODE 或 PARAMETER_DATA_MODE。允许的质量标记、调整误差上限、估计值处理与缺测定义也不能省略。最后统计每一道条件排除了多少剖面和多少观测点。
建议把这些条件变成程序输出,而不是只写在研究笔记里。程序应产生一张筛选汇总表:起始剖面数、各模式数量、各旗标数量、填充值数量、误差条件排除数和最终保留数。若日后资料库把某个剖面从实时更新成延迟模式,重新运行时就能解释样本为何改变,而不是得到一条无从追查的新曲线。

还要保存空间与时间覆盖的变化。严格筛选若主要删除某一海区、某一季节或早期年份,最终样本可能比原资料更偏。此时应报告覆盖差异,必要时调整研究问题或增加敏感度分析。质量控制减少测量风险,却不能自动消除抽样偏差;把两者分开,才不会把“留下来的点更干净”误写成“留下来的点代表整个海洋”。
最低限度的复核记录可以浓缩成一句明确规则:保存文件名、下载日期、资料模式、所用变量、质量标记集合、误差阈值、填充值处理和排除数量。若使用者还保留脚本版本、资料中心镜像和运行日志,别人就能在资料更新后复现当时的样本边界。这样的记录不是行政负担,而是让开放资料真正可以被检验的条件。
公开是起点,不是质量结论
海洋观测资料的开放价值,在于让更多人可以检查、组合和重新分析观测,而不是替所有研究预先给出同一套筛选答案。实时发布让使用者及时看到海况,延迟模式让专家补上校准与不确定度,变量级状态避免不同参数被一刀切,质量标记则保存每项检查的结果。它们共同组成证据链,任何一个栏位都不能单独代表“科学上可用”。
最后的判断应回到研究尺度:问题需要多快的资料,能承受多大的偏差,是否依赖精确位置,是否会放大长期漂移。只要这些条件写得清楚,实时资料和延迟资料都能在适合的位置发挥价值。若条件没有留下,即使图形漂亮、资料完全公开,结论仍可能无法复核。
资料依据:Argo Program,《How to use Argo profile files》,页面内容核读于 2026-07-29。U.S. IOOS / NOAA,《QARTOD 实时温盐质量控制手册》,2.1 版,2020-03-24,全文核读于 2026-07-29。
资料来源
- Argo Program:《How to use Argo profile files》,发布或更新于 2024-01-01
- U.S. IOOS / NOAA:《Manual for Real-Time Quality Control of In-Situ Temperature and Salinity Data, Version 2.1》,发布或更新于 2020-03-24