Stability AI
@StabilityAI
如果让基于视频的世界模型更小不仅仅是为了更好的压缩,而是为了让它们的表现更容易预测呢?
最近的视频生成方法探索从粗糙到精细的建筑场景。最初的几个符号捕捉了大的画面,就像一个人在弹吉他,而后来的符号逐渐增加了视觉细节。
我们的互动研究团队刚刚发布了SemanTok,它进一步扩展了这个想法。通过使这些早期标记在语义上更有意义,我们让模型更清楚地了解场景中发生的事情,使表示更容易预测,视频生成更高效。
结果是:使用SemanTok的模型的性能可以达到或超过其大小的三倍以上。
阅读全文:https://t.co/uBHxvEaAi9