视觉人工智能指南

图像着色

图像着色使用人工智能为黑白照片和胶片添加合理、逼真的色彩。

阅读时间:2分钟最后更新

概述

It matters because it brings historical archives to life and restores faded or grayscale imagery without manual painting.

深入探讨

着色从根本上来说是一个不适定的问题:单个灰色像素可能有多种颜色,因为亮度本身并不能编码色调。现代系统将其视为预测,从数百万张人工转换为灰度的彩色照片中学习。卷积或变换器网络仅看到亮度通道并预测丢失的颜色通道,通常在 CIE Lab 颜色空间中,其中 L 保存亮度,a/b 保存颜色。由于草通常是绿色的,天空通常是蓝色的,因此该模型学习了强大的统计先验。张等人的里程碑式工作。 (2016) 将其定义为对颜色桶进行分类,以避免平均值褪色、饱和度降低。较新的扩散和基于示例的方法让用户可以通过提示或参考图像来引导颜色,以实现更好的控制。

技术洞察

大多数系统在实验室空间中运行:网络仅接收 L(亮度)通道并输出 a 和 b 色度通道,这些通道与原始 L 重新组合。将颜色预测视为对量化箱的分类,而不是回归精确值,可以防止模型将多个有效颜色平均为暗淡的棕灰色,从而产生更加生动、可信的结果。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

图像着色的未来

着色正在向交互式、可控工具发展,用户可以单击提示颜色,模型就会一致地传播它。扩散模型和语言提示(“让衣服变红”)增加了语义控制,而时间感知网络则为整部电影着色,而不会出现帧与帧之间的闪烁。预计与同时进行去噪、升级和着色的修复管道会更紧密地集成,加上更强有力的保护措施,标记颜色是人工智能推断的猜测而不是历史事实。

现实世界的实施

为博物馆和纪录片恢复二战时期和 19 世纪档案照片的彩色版本

将经典黑白电影和电视片段变为彩色以重新制作并重新发行

家庭照片应用程序(例如 MyHeritage 和 Google Photos)可自动为旧祖先快照着色

对灰度医学或科学扫描进行着色以突出显示结构并改善视觉解释

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Colorization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

SPADE语义图像合成

常见问题

What is Image Colorization?

图像着色使用人工智能为黑白照片和胶片添加合理、逼真的色彩。它很重要,因为它使历史档案栩栩如生,并且无需手动绘画即可恢复褪色或灰度图像。

为什么图像着色被认为是“不适定”问题?

亮度本身并不能决定色调,因此一个灰色像素可能是红色、蓝色或绿色,从而使答案变得模糊。

在流行的 Lab 色彩空间方法中,网络接收什么作为输入?

灰度图像为L通道;该模型预测缺失的 a 和 b 颜色通道,并将它们与 L 重新组合。

为什么张等人。框架颜色预测作为颜色“箱”的分类而不是直接回归?

回归单个值往往会将多种可能的颜色平均化为浑浊的棕灰色;分类到垃圾箱中可以保持颜色鲜艳。

模型如何在没有被告知的情况下了解物体应该是什么颜色?

对巨大数据集的训练告诉模型,草通常是绿色的,天空通常是蓝色的,肤色落在一定的范围内。

对视频而不是单张照片进行着色时的主要挑战是什么?

如果每个帧都独立着色,则同一对象可能会在帧之间改变色调,从而导致分散注意力的闪烁;时间模型解决了这个问题。