LeanImg

如何免费将图像放大到4K?

4K是3840x2160。这是模型重建的内容,调整器插值的内容,您需要的源宽度以及决定其是否运行的硬件上限。

· Updated

4K意味着3840乘以2160像素。总共有8,294,400个。如果您的源是400乘以269的缩略图,您要求软件大约生成8.2百万个从未记录过的像素,模型会通过预测每个间隙中应该存在的内容来愉快地生成它们。调整器则做一些更简单的事情。它将您已有的像素平均分布在更大的网格上,完全不添加任何信息。

LeanImg的放大器在您的浏览器标签中运行Real-ESRGAN realesr-general-x4v3,当您的机器支持WebGPU时使用它。模型文件从我们自己的域名下载一次,您的像素保留在设备上。大多数免费的4K放大器则相反,上传您的文件并承诺在一两个小时内删除它。我们没有构建上传路径。这个代码库中没有可以接收上传的API路径。

4K在像素中实际上是什么意思?

消费者4K是UHD,分辨率为3840乘以2160,这是ITU-R BT.2020推荐中描述的超高清框架。影院4K更宽,为4096乘以2160,您只会在DCP工作中遇到它。对于壁纸、电视背景或YouTube上传,3840的宽度是重要的数字。将其除以我们的放大器提供的两个按钮,您将获得最低源宽度:4x按钮为960像素,2x为1920像素。没有3x。也没有输入3840的框,因此倍数是整个决策。

AI放大器是否添加了文件中不存在的细节?

它添加了细节。这些细节是否真实是另一个问题。Real-ESRGAN从退化和恢复的图像对中学习,因此它对砖块边缘、睫毛或织物纹理在更高分辨率下的外观有很强的先验知识,并在源只有模糊的地方绘制一个。我们的引擎以256像素的瓦片为单位,每侧有16像素的重叠。它保留每个结果的224像素核心,并丢弃重叠的接缝。

我们通过两个按钮运行了一个177.1 KB的400x269 PNG。4x通过返回了1600x1076,大小为2.7 MB。2x通过返回了800x538,大小为782.8 KB,这值得理解:模型仅生成4x输出,因此每个瓦片以4x生成,然后通过高质量平滑进行缩小。2x结果仍然保留了模型的重建。同一文件的双三次放大则没有。

400x269源和其1600x1076放大结果的分屏视图
4x运行:400x269输入,1600x1076输出。清晰,仍然比4K短2240像素。

我的源需要多大才能达到3840像素宽?

工具提供的两个倍数的缩放数学。只有第一行是测量运行。
2x输出4x输出达到3840宽?
400x269(测量运行)800x538,782.8 KB1600x1076,2.7 MB
960x5401920x10803840x2160是,4x时
1920x10803840x21607680x4320是,任意

第一行是真实的。400像素的缩略图在这里无法一次性达到4K,任何声称可以的工具要么是运行模型两次,要么是引用一个从未生成的数字。如果您的源使您超过3840(1920x1080行在4x时给您7680),请在调整器中完成,并将宽度拉回到正好3840。放大后的缩小成本低且效果好。

为什么我的放大文件是2.7 MB,而原始文件是177 KB?

放大器始终写入PNG。PNG是无损的,因此没有质量滑块来软化着陆,4x意味着进入一种精确存储每一个像素的格式的像素数量增加了16倍。大输出以真彩色PNG的形式逐带流式写入磁盘,这在文件本身超过任何标签可以容纳的大小时保持内存平稳。

之后压缩它。我们的压缩器在智能模式下将一个3840x2160的538.6 KB JPEG压缩到286.1 KB,减少了47%,而尺寸没有变化。推到WebP在滑块63时,同一文件输出为200.6 KB。AVIF达到186.9 KB,编码大约需要10到11秒,而JPEG和WebP编码是即时的。在压缩重要文件之前需要知道的一件事:压缩会删除所有元数据,包括EXIF、GPS和ICC。

我的浏览器实际上会运行4K放大吗?

这是决定您是否可以进行任何操作的上限。在WebGPU可用的情况下,4x路径接受大约32百万像素的输入。没有它,我们退回到单线程WebAssembly,输入上限降至大约1.1百万像素,这在开始前会拒绝一个2.07百万像素的1920x1080普通照片。首先检查caniuse。手机的上限更低:移动画布上限使4x作业的输入约为1百万像素,这在输出端仍然可以达到4K。每侧还有一个32,000像素的硬上限,工具一次处理一个文件,最大50 MB。

一次放大有多少次运行?

一个作业不是一次模型运行。它是一个由多个模型运行组成的网格,因为引擎以224像素核心工作。将您的源宽度除以224并向上取整,对高度做同样的操作并相乘:这就是模型运行的次数。960x540的源,达到4x时达到4K的最小源,是一个5乘以3的网格,因此是15次运行。1920x1080的源是9乘以5,因此是45次。它们一个接一个地发生,引擎在每次之间将控制权交还给浏览器,这就是为什么标签保持可用以及为什么报告的进度按瓦片而不是文件移动的原因。这也是为什么CPU回退不是一次慢,而是每个瓦片都慢一次。

为什么结果卡上的图片不是我下载的文件?

在某个输出大小以上,结果从未作为一个图像存在于内存中。在桌面WebGPU路径上,组装的画布上限为64百万像素,这意味着在4x时任何超过4百万像素的源和在2x时任何超过16的源。超过这个上限,引擎逐带写出PNG,并在其旁边构建一个单独的预览,最长边上限为1600像素。因此,在大作业中,您看到的图片是缩小版,下载的是实际输出。在打开文件后判断细节,而不是在卡上。如果预览步骤失败,您仍然会得到文件,因为一个花费数分钟完成的结果不会因为缩略图而被丢弃。

如果我的文件是HEIC或有透明度怎么办?

放大器接受JPG、PNG、WebP和AVIF。HEIC不在列表上,因此iPhone照片需要先在HEIC到PNG中转换。透明度也不会在运行中保留,因为模型仅为RGB,alpha在处理第一个瓦片之前被压平到白色。如果切割很重要,请保留原始文件,并在放大后运行背景移除,以便在最终分辨率生成alpha通道。模型能够干净分离的内容和不能分离的内容值得先阅读。

什么时候普通调整器是正确的工具?

当您在缩小,或当源已经接近目标时。调整器将工作交给浏览器画布,以高平滑质量进行处理,它平均相邻像素而不发明任何东西。它默认勾选“不要放大”,因此输入的宽度大于原始宽度时会直接被限制回原始宽度。社交预设是唯一的例外,因为选择一个命名的平台尺寸是一个有意的选择,它胜过限制。PNG输出在此保持无损,其他格式默认重新编码为质量90。从3000宽到3840,插值是可以的。从800开始,不行。两个工具逐行比较更深入地探讨了这种分裂。

我的图像会离开我的计算机吗?

不会。此应用没有API路径和服务器操作,因此没有端点可以接受文件,即使是意外的。在放大过程中唯一的网络请求是同源获取模型,并在第一次运行后缓存。打开开发者工具并在作业运行时查看网络标签,如果您更愿意看到而不是阅读。我们的隐私页面用更少的字描述了这一点,下载一次然后停止获取的OCR引擎是这里以相同方式构建的另一个工具。

下一步:打开放大器,使用至少960像素宽的源,选择4x并等待模型下载完成。当PNG到达时,将其发送到调整器,将宽度设置为3840,然后在压缩器中完成,以便您刚刚制作的4K壁纸不是一个多兆字节的PNG。