梳理每项操作和每类数据
列出原始媒体、麦克风音频流、临时音频、转录稿、时间戳、说话人分组、摘要、词汇、账户标识符、许可证数据、崩溃详情、分析事件、模型文件、日志和备份。对每一项记录其创建位置、传输去向、可访问人员、存在原因和删除时间。
同一产品可以同时拥有本地转录引擎,以及在线模型下载、激活、更新、支持或可选同步功能。如果分别说明,这些表述并不矛盾;将其一概归为“完全离线”才会造成误导。
测试实际行为,而不只看政策措辞
阅读供应商最新的隐私声明和技术文档。然后观察一次有代表性的安装、首次启动、模型获取、转录、导出、空闲时段、更新检查、报错和卸载。记录必需的连接目标、离线失败时的表现,以及会改变网络流量的任何控件。
仅观察网络无法证明加密流量的内容,仅审查源代码也未必能反映已部署的配置。请结合多种证据,并说明每种方法的局限。
本地文件仍需保护
检查默认保存目录、临时文件路径、自动保存、回收站、索引、缩略图、云同步文件夹、备份、多用户权限和卸载清理。本地保存的转录稿仍可能因设备丢失、共享 Windows 账户、远程支持工具、个人同步客户端或未加密备份而暴露。
请使用设备加密、受保护的账户、最小权限分享、明确的保留期限,以及适合存储技术和风险的安全删除方式。首先就应避免录制不必要的数据。
供应商应明确回答的问题
安装模型并断开网络后,核心任务能否运行?会连接哪些主机,原因是什么?遥测是否可选?源媒体是否用于训练模型?删除数据或卸载后还会留下什么?是否包括备份和崩溃附件?企业策略能否禁用在线功能?启用可选云端集成后会发生哪些变化?
注明日期并细化到操作层面的回答,比一个隐私徽章更持久可靠。重大版本发布后应重新核查,因为打包、激活、诊断和模型交付都可能改变数据流。
