展厅运维巡检清单与 SLA 怎么定?

2026-07-13

展厅交付那天风光,三个月后能不能还像交付时那样跑,全看运维。而运维不是”坏了再修”,是”每天例行看一眼、约定好出事多久必到”。这一看一约,就是巡检清单和 SLA。

从一次”开馆前十分钟发现黑屏”说起

某天重要接待,领导八点半到,你八点二十进馆例行开机,主展项那面大屏——黑的。这时候你才慌起来排查,投影灯泡烧了?信号没通?播控没起来?留给你的只有十分钟,而换灯泡、调信号哪样都不止十分钟。这种场面,八成不是运气差,是平时没巡检:如果头天日巡就发现这台投影亮度骤降、或播控有报错,你早换早修,根本轮不到开馆前抓瞎。展厅运维的全部意义,就是把”开馆前十分钟的惊魂”提前到”昨天下午的从容”。这篇给你一套能直接套用的巡检清单和 SLA 分级,让展厅交付后还能长期稳住。

一句话定义

展厅运维巡检是按固定周期检查展厅设备与内容是否正常运行的例行工作,SLA(服务等级协议)则是对故障响应与恢复时间的明确承诺——前者负责”提前发现问题”,后者负责”出事后多久必须解决”,两者一起构成展厅”持续可用”的保障。

这俩是一对搭档:巡检是主动出击的”体检”,趁问题还小、还没影响参观时就揪出来;SLA 是被动兜底的”急诊承诺”,万一真出事,约定好几级故障多久响应、多久恢复,谁都别扯皮。只做巡检不定 SLA,出了事没人知道该多急;只定 SLA 不巡检,天天等着救火、SLA 迟早被打爆。两条腿走路,展厅才立得住。

做了无人值守不代表不用巡检;恰恰相反,无人值守把日常开关交给系统后,没人天天在现场盯着了,巡检的重点就从”人看设备”转向”确认系统自己有没有出问题、有没有偷偷失灵”。系统替你干活,但系统本身也得有人查。

巡检清单(按周期分)

巡检不是拍脑袋想起来才做,得按周期固定下来。日、周、月三级,各管一层,频率越高的查得越快、越表层,频率越低的查得越深、越预防性:

周期检查项重点
每日各点位是否正常播放、画面 / 声音是否正常、设备在线状态开馆后快速巡一遍,10 分钟内
每周片源是否正确 / 最新、定时任务是否按计划执行、远程通道是否可用抽查联动场景、清理日志
每月设备温度 / 风扇除尘、线缆与接头、灯泡 / 光源寿命、备份与还原演练预防性维护,提前换易损件

日巡建议直接用中控 / 播控的集中状态监控远程看一遍,一屏看全馆在线状态和播放画面,省去逐点跑现场,十分钟能巡完的绝不用半小时。周巡要动手抽查几个联动场景(比如”讲解模式”一键推下去,灯、屏、音响是不是都听话),顺手清理堆积的日志。月巡是重头,要做预防性维护——开机柜除尘、量投影灯泡还剩多少寿命、把备份拿出来实际还原一次,别等真出事才发现备份根本恢复不了。

巡检要查什么(分层展开)

巡检不是”看一眼亮不亮”就完事,得分层确认,从眼睛能看见的往里查到看不见的:

  1. 显示层:投影 / 拼接屏 / LED 是否点亮,亮度、色彩正不正、有无黑屏花屏、融合拼缝是否对齐、有没有发虚重影。这是观众第一眼看到的,最不能出错。
  2. 内容层:播放的是不是当前正确版本,有没有播错、卡住、错位,多屏同步是否一致。展项内容偷偷播成了旧版、或某块屏卡在一帧,观众看得见你却没盯着,最尴尬。
  3. 控制层:中控面板 / 平板能否正常操作,一键场景是否生效,定时任务有没有按时跑。控制层瘫了,前面显示内容全好也白搭——没人能切换、没人能救场。
  4. 网络层:各点位在线状态,远程访问是否通畅,有无掉线。无人值守和远程运维全靠这层撑着,一断网你就成了睁眼瞎。
  5. 环境层:机柜温度、散热、防尘、供电是否稳定。这层是”慢性病”,短期看不出,长期不管设备寿命断崖式下跌,夏天机柜闷出高温死机最常见。

把这五层做成一张勾选表,每次巡检逐项打钩,既不漏项、又方便交接班——谁巡的、几点巡的、哪项异常,白纸黑字留痕。设备本身更细的健康检查可对照展厅设备验收 / 自检清单

SLA 怎么分级

巡检管”提前发现”,SLA 管”发现后多久必到”。SLA 的核心是按”故障影响”分级——不是所有故障都得连夜抢修,也不是都能拖到下周。给不同级别约定不同的响应与恢复时间,才既不过度投入、又不耽误大事。一个通用的三级模型:

级别典型场景建议响应时间建议恢复时间
P1 严重主展项黑屏 / 整馆无法开馆远程 ≤15 分钟当天恢复,必要时到场
P2 一般单点位异常、部分联动失效≤1 小时≤24 小时
P3 轻微个别细节问题、不影响参观≤1 工作日下次巡检随手处理

这里要分清响应时间恢复时间是两码事:响应是”多久内有人接手开始处理”,恢复是”多久内真正恢复正常”。P1 主展项黑屏,远程十五分钟内必须有人上线看,但恢复可能因为要换硬件而拖到当天——能快速响应不等于能快速恢复,两者得分开写清楚。

注:以上为通用参考,具体时长应结合场馆开放时间、是否重要接待、运维团队远程能力来约定。具备远程运维能力的项目,P1 的远程响应往往能压到几分钟内,因为不用等人跑到现场。

让巡检与 SLA 落地的三个要点

  • 能远程的优先远程:远程巡检 + 远程处理,是压缩响应时间、降低人力成本的关键。一个人在后台能看管好几个馆,比派人挨个跑现场高效太多。
  • 留痕可追溯:巡检勾选表、故障工单、处理记录都要留存。既方便复盘”这毛病上次什么时候出过”,也在甲乙方界定责任时说得清、不扯皮。
  • 预防优于救火:月度预防性维护(除尘、换易损件、备份演练)做到位,P1 故障自然变少。很多重大故障回头看,都是小隐患拖出来的——灯泡快到寿命不换、机柜积灰不清、备份从没验证过。

常见误区

  • “无人值守了就不用巡检”:正相反,没人在现场了更得靠巡检确认系统没偷偷失灵。
  • “日巡就是看看亮不亮”:亮着不等于对——版本可能播错、同步可能飘了、定时任务可能没跑,得分层查。
  • “SLA 写个恢复时间就行”:漏了响应时间就没法追”为什么两小时了还没人管”,响应和恢复必须分开约定。
  • “备份存着就安全”:没实际还原演练过的备份等于薛定谔的备份,月巡必须真跑一次还原。

常见问题

巡检多久做一次合适? 日巡 + 周巡 + 月巡的组合最常用:日巡确认在线与播放、周巡确认内容与任务、月巡做预防性维护。重要接待前应额外加一次专项巡检。

SLA 的响应时间和恢复时间有什么区别? 响应时间是”多久内有人接手处理”,恢复时间是”多久内恢复正常运行”。两者要分开约定——能快速响应不等于能快速恢复,比如硬件损坏需等备件。

没有专职运维,SLA 还有意义吗? 有。哪怕是甲方自管 + 集成商兜底,把”什么级别多久必须处理”白纸黑字写清楚,也能避免扯皮、明确各方责任,是后期不踩坑的基础(参考展厅设备选型避坑清单)。


想把展厅做到可远程巡检、SLA 可承诺?了解支持集中监控与远程运维的 SoftControl 展厅智能中控系统,或先看展厅无人值守怎么做远程运维主题

需要展厅软硬件方案或定制开发?