2026 年 9 月 2 日,澳大利亚最大电信运营商 Telstra 公布 7 月 8 日全国移动网络大规模故障的外部调查结果。
独立调查机构 Technology Audit Partners(TAP)认定,事故由网络授时系统维护过程中出现的错误日期触发,但造成全国性故障的根本原因并非单一设备异常,而是 Telstra 长期没有将网络授时系统作为可能影响全网的关键能力进行管理。
此次事故一度影响 Telstra 约 45% 的移动电话和数据会话,语音、短信、移动数据以及部分 Triple Zero(000)紧急呼叫均出现异常,并波及 EFTPOS 支付以及新南威尔士州、维多利亚州部分铁路服务。
Telstra 拥有约 1100 万移动用户,是澳大利亚规模最大的电信运营商之一。
调查报告重新还原了事故发生的完整技术链条。
7 月 8 日凌晨,Telstra 工程人员在墨尔本对一套 Network Time Protocol(NTP)网络授时设备进行计划维护。
此次维护原本只是处理设备的备用电源故障,并更换相关机箱和电源组件。
设备重新启动后,其中一块负责获取 GPS 时间信息的授时卡出现异常,将日期重置为 2006 年,比实际时间倒退了整整 20 年。
这个错误日期随后通过网络授时系统向其他设备传播。
由于移动通信网络中的大量系统依赖统一而准确的时间信息进行身份验证、信令处理和网络协调,错误日期开始造成部分网络组件无法正常工作,最终演变成全国性移动网络故障。
TAP 调查发现,这次错误并不是完全不可预见。
出现问题的 GPS 卡此前没有安装一项必要的软件更新。
与此同时,Telstra 在 2025 年 10 月处理另一项授时故障时,曾对相关系统进行设计调整,但这项变化没有被完整记录进技术文档和后续维护流程。
因此,到 2026 年 7 月进行设备维护时,现场维护人员并不知道设备重新启动后可能出现这种行为。
Telstra CEO Vicki Brady 此前在澳大利亚参议院听证会上承认,如果相关软件更新已经完成,或者此前的设计变更得到正确记录并写入维护程序,这次事故可能不会发生。
更严重的问题出现在 Telstra 对授时系统的整体管理上。
TAP 将可能造成整个网络大范围中断的关键网络功能称为“sovereign function”。
调查认定,Telstra 并没有按照这一标准管理网络授时能力。
报告列出的主要问题包括:
1)授时系统没有足够清晰的责任归属;
2)相关架构经过多年调整,但缺少端到端管理;
3)掌握这一系统的专业技术人员数量不足;
4)变更管理、配置控制、事故管理、技术文档和问题跟踪等流程均存在缺陷。
人员配置也直接影响了事故发现速度。
调查显示,发生故障时,两名对该网络授时系统最熟悉的关键工程师正处于强制休息期,当班团队缺少能够快速识别 NTP 系统异常的专业人员。
与此同时,最早能够显示授时系统异常的部分告警只在正常工作时间由数量有限的人员监控。
故障发生在凌晨,因此这些告警没有立即得到处理。
TAP 认为,责任归属不清、系统可视性不足以及专业技术支持不足,共同延迟了 Telstra 对事故根因的识别。
最新调查还调整了事故时间线。
TAP 认定,网络异常从 7 月 8 日凌晨 2:50 左右已经开始。
Telstra 此前公开表示,其在大约凌晨 4:30 发现部分移动电话和数据服务出现问题。
网络中的异常已经存在一段时间后,才升级到运营团队能够明确识别的大规模服务故障。
实际上,Telstra 在事故发生前数月已经看到过授时系统的异常迹象。
2025 年 10 月,Telstra 位于墨尔本的一套 NTP 系统曾多次失去与悉尼授时源之间的连接,并触发 NTP 告警。当时系统甚至出现了异常的时间层级状态。
按照内部流程,相关问题本应创建一个“Network at Risk”工单,继续调查频繁失去悉尼时间源的真正原因,并将系统恢复到原有设计状态。
但调查发现,这个工单最终没有建立。相关技术人员虽然看到了异常,却没有充分理解其含义,也没有创建后续问题单继续追查。
Brady 在最新发布会上承认,Telstra 当时应该对这些异常保持更高警觉,并对问题继续追查。
TAP 因此将此次事故定性为一系列技术和管理问题长期累积后的结果,而不是简单的一次硬件故障。
从直接影响来看,故障高峰期间,Telstra 大约 45% 的移动电话和数据会话受到影响。多数电话和数据服务在当天上午恢复,到下午 4 点左右,最初的网络问题已经得到处理。部分企业客户的设备则需要现场重新配置,因此恢复时间更长。
Triple Zero 紧急呼叫受到的影响尤其受到监管部门关注。
Telstra 此前披露,事故期间共有 58,835 次 Triple Zero 呼叫成功接通,同时发现 604 次紧急呼叫没有正常连接,并针对这些号码启动福利检查。
TAP 最新调查又找到了此前没有被纳入统计的 8 次失败呼叫,使已确认的异常紧急呼叫数量进一步增加。
Telstra 表示,这新增的 8 次呼叫中,1 名用户随后通过另一家运营商网络接通,1 名用户通过其他方式成功联系紧急服务,5 次属于误拨或错误呼叫,还有 1 名呼叫者始终无法确认身份。Telstra 称,目前没有发现此次故障导致人员死亡或其他危及生命的后果。
事故影响还超出了普通手机用户。
网络中断导致部分商户的 EFTPOS 电子支付无法正常使用,新南威尔士州和维多利亚州部分铁路系统也受到影响,一些列车服务因此中断。
在 TAP 完成调查之前,Telstra 已经开始调整授时系统。
Telstra 表示,已经将三个站点的业务从此前使用的 NTP 服务器迁移到新的战略授时平台,并增加网络监控和告警能力,同时要求更多网络变更首先在实验室环境进行测试。
Telstra 还与设备供应商重新检查操作和变更流程,并建立公司级整改项目,统一监督事故整改和网络韧性提升。
接下来,Telstra 将把检查范围扩大到整个网络。
其中包括重新评估除授时系统以外其他可能导致大范围故障的关键网络功能,检查这些系统是否获得足够高的管理优先级;重新审查供应商告警处理流程;检查平台告警说明和服务保障机制,确保未来出现类似技术异常时,当班工程团队能够直接识别并处理。
Brady 表示,Telstra 接受 TAP 的全部调查结果,并承认此次事故“不应该发生”。
云头条声明:如以上内容有误或侵犯到你公司、机构、单位或个人权益,请联系我们说明理由,我们会配合,无条件删除处理。