一、概述
电子数据取证的目标是在原始数据不被改变的前提下,把散落在介质上的技术痕迹还原成能回答案件问题的证据。三个限定是连在一起的,少一个就退化:数据不能被改,否则无法分辨看到的是原始状态还是被人处理过的状态;痕迹必须能定位,否则证据存在但拿不到;答案必须能被复核,否则技术结论在质证时一碰就碎。
同一套命令在两个场景下的正确用法可能正好相反。"我 U 盘删了照片帮我找回来"是数据恢复,允许多次尝试、允许写盘、追求成功率;"这台服务器疑似被入侵,帮我固定证据"是取证,一次都不能错,追求可辩护性。区分点落在这件事将来会不会上法庭:恢复做过的介质不能退回取证状态,而取证状态可以承接恢复需求。
这一层不在流程的任何一环里,它定义的是流程该长什么样。第三章那五步——确认授权 → 状态记录 → 建工作副本 → 分层分析 → 结论可复核——是全库所有文章共同的骨架,它上游没有依赖,它就是依赖本身。
五步各自要解决的问题不同。步骤 1 要求书面确认授权来源、目标范围(型号 + 序列号 + 容量)与时间边界,不接受"他所有电脑"这种无边界表述。步骤 2 按设备是否开机分流处置:普通用户设备内存采集优先或温和关机,服务器依委托方要求可能只能在线取证,涉案关键设备记录屏幕状态后直接断电。
步骤 3 让原始介质只读挂载或封存,所有分析在副本上进行。步骤 4 按全局 → 索引 → 定向 → 验证四层递进,每层的产出是下一层的输入。步骤 5 要求每条结论能说出具体工具、参数、文件偏移,有第二条独立证据,并能让同工具同参数重现同一结果。
电子数据的固有脆弱性可以拆成五条,每条派生一条技术要求。易被改写 → 采集必须只读 → 硬件写保护器。改写无痕 → 必须数学验证 → 哈希校验。易被复制 → 必须记录来源与流转 → 保管链文档。存储易失 → 在线设备优先断电 → 内存镜像。体积巨大 → 必须分层抽样 → 关键字加结构化分析。
三个法律形式(司法鉴定 / 公证 / 自行取证)的技术手段几乎相同,区不要在于是谁做的、以什么身份做的、要向谁负责。司法鉴定由有资质的鉴定机构或人员执行,服务对象是公安、检察、法院,产出鉴定意见书,可质证、可出庭。公证由公证机构执行,核心是在证据消失前把证据固定下来,产出公证书加证据保全记录。自行取证由当事人或其委托的技术人员执行,无固定格式,自担证明责任。
三类取证目标的证据价值互不替代。计算机取证提供行为链,主要风险是关机导致易失数据丢失。网络取证提供通信事实,保留期短,多数仅数天至数月。移动取证提供身份锚点,风险在锁屏、云端擦除、芯片级加密。只有单机数据难以证明"是谁",只有手机数据难以证明"做了什么"。
物理取证与逻辑取证的分野在采集内容。物理取证取整个介质的比特流,含未分配空间,体积等于介质容量,能恢复已删除数据与文件碎片,证据强度高。逻辑提取只拿特定文件、表、目录,只能拿到现存对象,受操作系统与工具限制,证据强度中。第五章案例里 30 分钟停机窗口逼出的"先在线固定、后窗口期物理镜像"就是这一原则的实例。
落到具体产物上,DigiForensics.dd 物理镜像等于介质容量,第五章用 dcfldd 的 conv=noerror,sync、bs=4M 参数制作,hashlog 落在案件目录。逻辑提取物是单个文件、数据库导出、配置目录。委托书是书面授权,第五章明确写着"允许 30 分钟停机窗口",没有它后面所有动作都缺一层合法性。
在线固定记录包括登录会话导出、关键日志导出、磁盘占用快照,各自带时间戳与 SHA-256。结论载体有鉴定意见书、公证书、自行取证记录三种,签署主体、服务对象、举证责任各不相同。第五章的结论不建立在单条日志上,而是"登录日志 + 内网主机向外传输 1.2 GB 的流量记录"两条独立来源的吻合。
2.1 那张表里"法学的约束力最强"说的是技术上能做不等于法律上能做。逻辑提取读文件不改文件的表象同样不等于无损:SQLite 在有活动连接时会写 journal/WAL,浏览器 profile 被读取时可能更新缓存。因此逻辑提取必须把 -wal、-shm、-journal 一并复制,提取前后各算一次目标哈希。四次哈希缺一不可:源介质、镜像、分析副本、分析后,四次一致才说明全程未被改动。
阴性发现必须带上未覆盖范围。第四章陷阱 12 的三段式写明范围、方法、结果与未覆盖范围,第五章检索 412 个 .xlsx/.xls/.csv 文件之后只写"未发现",并列出未覆盖的文件内容、1 个 .zip 归档内部、已删除且未恢复的残留。"未发现"在中文里天然被读作"不存在",三段式把它变成方法论陈述。技术门槛为零,"证据"这个词在法律语境下指的是能否被法庭采信的东西,而这一层给的是坐标系:后面 100 多篇各自在解决哪个问题。
二、核心原理
2.1 取证与其他学科的关系
一份 Windows 磁盘镜像交到你手上,你第一步做什么、结论能写到多细、这句话有没有人信——这三件事分别不由同一个学科决定。
| 来源学科 |
借用的东西 |
在取证中的体现 |
| 刑事诉讼法学 |
证据能力、证明标准、程序合法性 |
决定什么数据能被采信 |
| 计算机科学 |
文件系统、数据库、编译原理 |
决定数据"藏在哪里、怎么存的" |
| 密码学 |
哈希、对称/非对称加密 |
决定完整性验证与数据解密 |
| 磁盘 forensics |
扇区布局、SSD 磨损均衡 |
决定物理镜像读到什么 |
| 统计学 |
概率、基线分析 |
决定"什么算异常" |
| 认知心理学 |
记忆偏差、行为模式 |
决定如何解释人的痕迹 |
其中法学的约束力最强。技术上能做,不等于法律上能做;技术上证明了,不等于法庭上会被采信。这是电子数据取证区别于普通数据处理的核心特征。
2.2 电子数据的固有脆弱性
一份纸质合同撕了就没了。一份电子合同改个数字,用眼睛看完全一样——这就是电子证据唯一的根本弱点:可以被轻易复制、修改,且修改后看不出痕迹。
每一条弱点都对应一条技术要求:
| 弱点 |
派生要求 |
技术手段 |
| 易被改写 |
采集必须只读 |
硬件写保护器 |
| 改写无痕 |
必须数学验证 |
哈希校验 |
| 易被复制 |
必须记录来源与流转 |
保管链文档 |
| 存储易失 |
在线设备优先断电 |
内存镜像 |
| 体积巨大 |
必须分层抽样 |
关键字+结构化分析 |
2.3 三种法律形式
这一步最容易被讲错。三者技术手段几乎相同,区不要在于是谁做的、以什么身份做的、要向谁负责。
| 形式 |
执行主体 |
服务对象 |
结论形式 |
典型场景 |
| 司法鉴定 |
有资质的鉴定机构/人员 |
公安、检察、法院 |
鉴定意见书(可作为定案依据) |
刑事案件正式送检 |
| 公证 |
公证机构 |
保全方(多为权利人) |
公证书 + 证据保全记录 |
微信聊天记录、网页、邮件保全 |
| 自行取证 |
当事人或其委托的技术人员 |
自己 |
无固定格式,自担证明责任 |
企业内部事件、个人维权 |
三者的关键差不要在举证责任与可质证性:
- 司法鉴定由中立第三方作出,有完整的资质、检材交接、检验记录,可质证、可出庭;
- 公证的效力来自公证机构的公信力,核心是"在证据消失前把它固定下来";
- 自行取证的成本最低,但一旦对方质疑"数据被改过",没有第三方背书的一方通常承担更重的证明责任。
⚠️ 实务要点:企业做内部安全事件处置时,常见做法是"自行取证 + 主动引入第三方"。前者保证时效,后者保证效力。两者不是替代关系。
2.4 三类取证目标
| 目标类型 |
典型检材 |
核心问题 |
主要风险 |
| 计算机取证 |
桌面/笔记本/服务器磁盘 |
何时、由谁、做了什么 |
关机导致易失数据丢失 |
| 网络取证 |
流量包 PCAP、日志、路由表 |
谁在什么时候通信了什么 |
保留期短(多数仅数天至数月) |
| 移动设备取证 |
手机整机、应用沙盒、云端 |
现实身份与设备/账号的对应关系 |
锁屏、云端擦除、芯片级加密 |
三者的证据价值排序也不同:计算机取证提供行为链,移动取证提供身份锚点,网络取证提供通信事实。
只有单机数据,难以证明"是谁";只有手机数据,难以证明"做了什么"。
2.5 物理取证 vs 逻辑取证
| 维度 |
物理取证(Physical) |
逻辑取证(Logical) |
| 采集内容 |
整个介质的比特流,含未分配空间 |
特定文件/表/目录 |
| 恢复能力 |
可恢复已删除数据、文件碎片 |
只能拿到现存对象 |
| 体积 |
等于介质容量 |
通常小得多 |
| 通用性 |
高,任何工具可读 |
受操作系统与工具限制 |
| 证据强度 |
高(完整固定现场) |
中(依赖提取工具的可信度) |
核心原则:能用物理镜像就不用逻辑提取。逻辑提取是物理不可行时的妥协(如设备未拆机、服务器不允许停机、加密无法物理读取),而不是效率优先的选择。
三、操作步骤
步骤 1:确认任务性质与授权来源
动手前必须书面确认三件事,缺一不可:
1. 授权来源:委托人是谁,授权书/委托书/搜查证编号是什么
2. 目标范围:明确的设备清单(型号 + 序列号 + 容量),不接受"他所有电脑"
3. 时间边界:是否在关机状态,是否允许拆机
范围模糊是最大的风险来源。
"查这台机器"必须落到"查这块序列号为 XXX 的 NVMe"。
步骤 2:现场状态记录与封装
# 记录外包装状态(拍照是必须的,文字是补充)
# 1. 封装前:拍照 —— 封条、接口、开机状态、外观
# 2. 核对封条编号与委托书一致
# 3. 拆封时:双人在场,记录拆封时间
若设备处于开机或休眠状态,不要直接拔电。先评估:
- 是普通用户设备(内存数据价值高,但无休眠数据)→ 优先考虑内存采集或温和关机
- 是服务器(有服务连续性要求)→ 依委托方要求,可能只能做在线/远程取证
- 是涉案关键设备(无休眠文件风险)→ 记录屏幕状态后直接断电
步骤 3:建立工作副本
# 原则:原始介质只读挂载或封存,所有分析在副本上进行
# 1. 计算原始介质哈希(若条件允许,在挂载前完成)
sudo sha256sum /dev/sdX
# 2. 制作物理镜像(详见板块 2)
sudo dcfldd if=/dev/sdX of=/case/DigiForensics.dd \
hash=md5,sha256 hashlog=/case/DigiForensics.hashlog \
bs=4M conv=noerror,sync status=on
# 3. 校验:镜像哈希必须与原始一致
sha256sum /case/DigiForensics.dd
步骤 4:分层分析
按"大而全到小而精"的顺序推进:
第 1 层 全局:分区表、卷列表、文件数量、时间范围
第 2 层 索引:文件系统时间线、关键字搜索、已删除文件列表
第 3 层 定向:按案件假设(人/时间/行为)收敛到具体对象
第 4 层 验证:对每条结论做独立验证(实际打开、实际解密、实际连通)
步骤 5:结论必须可复核
每一条结论都要能回答三个问题:
| 问题 |
合格答案的标准 |
| 怎么得到的? |
能说出具体工具、参数、文件偏移 |
| 怎么确认不是误判? |
有第二条独立证据或实际验证 |
| 别人能重现吗? |
同工具同参数能得到同一结果 |
四、常见陷阱
本章按「任务性质与授权 → 采集方式与状态 → 分析与验证 → 结论表述」归组,每条给出:现象、为什么会误判、误判代价、正确做法。
★ 标记表示该操作会导致原始检材永久灭失或不可逆改变,执行前必须停下来确认。
4.1 任务性质与授权
陷阱 1:把数据恢复的处置方式用到取证上
现象:委托方说"这个 U 盘里的照片被误删了,帮忙找回来",分析员按恢复思路处理——挂载、多轮扫描、反复尝试修复文件系统。
原因:一概述把两者的目标函数说得很清楚——数据恢复追求成功率,允许多次写盘尝试;取证追求可辩护性,一次都不能错。
而"找回来"这个委托描述在日常语言里与取证完全一样,接收者无法从需求描述判断这是哪一类任务。真正的区分点是:这件事将来会不会上法庭。
影响:在恢复目标下失败的介质,送到取证目标下已不具备完整证据价值——因为恢复过程已经改变了它。
这条路是单向的。恢复做过的介质不能退回取证状态;取证状态可以承接恢复需求。
而分析员往往是在介质已经被改写之后才意识到这一点。
核查:动手前书面确认任务性质:
1. 授权来源:委托人是谁,委托书/授权书编号是什么
2. 目标范围:设备清单(型号 + 序列号 + 容量),不接受"他所有电脑"
3. 用途定性:仅供内部使用 / 拟用于诉讼 / 拟提交监管
4. 时间边界:是否在关机状态,是否允许拆机
第 3 项是分水岭。若答案涉及诉讼或监管,全程按取证标准执行;若纯内部恢复,可以协商空间。不确定时按高标准做——成本增加有限,事后无法补救。
已经在恢复路径上走了怎么办:立即停止并记录当前状态,明确写"该介质在本次操作前已有 <N> 次尝试写入记录"。这个事实必须进入报告,而不是省略——省略它意味着报告在这一点上不诚实。
陷阱 2:授权范围写成"他的电子设备"
现象:委托书写"查清该人员的电子设备内是否存在涉案数据",分析员据此把家里和办公室的设备都纳入。
原因:"电子设备"在授权文本里是一个没有边界的词——它可以指一台,也可以指全部。
而授权书的作用恰恰是划定边界。一个无边界的授权在实务中极易被挑战,而挑战的后果是整个取证工作的合法性受质疑。这条被单独列出,是因为它最容易在委托阶段被默认掉,又最难在事后补救。
影响:越界取证的全部产出都不能用。不是"部分可用",而是在超范围设备上发现的一切都要排除,连带上它与范围内设备之间的关联证据也难以主张。
这类问题的成本与工作量成正比。越晚发现,代价越大。
核查:范围必须落到可唯一识别的物理标识:
目标设备清单
- 设备 1:LENOVO ThinkPad,SN PF2XXXXX,1 TB NVMe
- 设备 2:SanDisk Ultra,SN 4C5300XXXXXX,128 GB
- 设备 3:Samsung SSD 860,SN S3ZXXXXX,500 GB
三个要素缺一不可:型号(易混淆)、序列号(唯一)、容量(验证用)。回到步骤 1 那句原话:"查这台机器"必须落到"查这块序列号为 XXX 的 NVMe"。
范围变更必须书面追加,不能靠口头补充:
范围变更记录
- 变更内容:新增设备 4(外接移动硬盘,SN WD-XXXX)
- 变更原因:设备 1 的浏览器记录中出现该硬盘的卷序列号
- 追加授权人 / 时间 / 方式(书面/邮件)
"为什么扩到这台设备"必须可追溯。案例中扩展目标的正当性来自证据线索,而"因为方便一起做了"不是理由。
陷阱 3:把自行取证的结论当成可直接用于诉讼的证据
现象:企业 IT 部门做了内部排查,导出一批日志和邮件形成报告,准备提交给监管或用于诉讼。
原因:三种法律形式的技术手段几乎相同,区不要在于是谁做的、以什么身份做的、要向谁负责(2.3 的开篇)。
企业自己的技术人员做出来的东西,在技术层面可能完全正确——而这恰恰是问题所在:它的外观与司法鉴定意见书没有区别,但它没有中立第三方的资质、检材交接记录与检验记录。技术正确性不解决可质证性。
影响:一旦进入争议程序,没有第三方背书的一方通常承担更重的证明责任(2.3 的原话)。对方只需质疑"数据被改过"且你自己无法证明没有,整份结论的证明力就下降了。
下降幅度往往超出预期,因为它是推定不可信,而非"存在疑问"。
核查:2.3 的实务要点就是正解——自行取证 + 主动引入第三方:
阶段一:企业内部快速固定(时效优先)
- 立即导出易失数据与关键日志,计算 SHA-256,记录导出时间与操作人
- 目的:防止数据消失,不是形成结论
阶段二:引入第三方(效力优先)
- 将已固定的检材移交鉴定机构,附阶段一的完整记录
- 由第三方独立检验并出具鉴定意见
阶段三:衔接
- 阶段一的操作记录作为阶段二的背景材料
- 结论一律以阶段二的鉴定意见书为准
关键点:阶段一的记录必须完整且不带结论。
记录"我们导出了什么、什么时候、哈希是多少",而不是"我们认为是谁干的"。前者是事实,后者是未经中立检验的判断——它会污染第三方独立检验的起点。
4.2 采集方式与状态
陷阱 4:用逻辑提取代