Signal YCurated AI News
更新于 8/20 09:5261 个信源

SQLite 压缩文本历史原型

通用 AI8/10 06:05Simon Willison查看原文 ↗
摘要

Simon Willison 提出将文本全部历史版本放入压缩 JSON 数组存入 SQLite,并借助 GPT-5.6 Sol Pro 构建原型验证,压缩效果显著。

核心要点
  • 方案是在 SQLite 表中增加一个 BLOB 列,存放经 zlib 或 Zstandard 压缩的 JSON 字符串数组;另设一个未压缩的 Unix 时间戳 JSON 数组,无需压缩。
  • 原型测试显示:1,000 次模拟修订产生 20.4 MB 原始修订文本,经 Zstandard 压缩后仅 80.3 KB,压缩率约 254 倍。
  • 为免每次编辑都解压并重新压缩整个数组,系统将历史拆分为多行,每行最多包含 128 个修订或 3MB 未压缩 JSON。
  • 作者通过 ChatGPT iPhone 应用的新语音模式与 AI 讨论原型,语音转文字后由 GPT-5.6 Sol Pro 花费 38 分钟生成代码和实验文件。
  • 该方案依赖同一文档不同版本间的大量重复文本来实现高压缩,属于简单而有效的轻量级版本历史存储思路。
原文佐证
  • The approach works really well!
  • 1,000 simulated revisions to a document resulted in 20.4 MB of raw revision text that compressed to 80.3 KB as Zstandard-compressed JSON array.
  • To avoid the overhead of decompressing and recompressing the entire array on every edit Sol suggested breaking the history up into multiple rows, with each one containing a maximum of either 128 revisions or 3MB of uncompressed JSON.
AI 洞察
这不仅是存储技巧,更展示了'散步时产生想法、与 AI 语音讨论、自动生成原型'的新研究范式,AI 显著压缩了从创意到验证的周期。简单方案结合优秀压缩算法即可获得上千倍空间节省,可能让更多轻量应用直接内嵌版本历史功能而无需引入专用版本库。分块策略也提示,在追求压缩率时需兼顾增量更新的效率。