壹 前言
在複雜且低光源的環境中,人類的視覺往往會受到極大的限制,特別是在夜視監控場景或惡劣天候下,單純依賴可見光的影像系統難以發揮作用。為了解決這項挑戰,紅外線影像技術的整合已成為提升視覺感知能力的廣泛解決方案。紅外線影像技術的運作原理是藉由偵測周遭環境中的紅外線輻射來獲取溫度資訊,進而在複雜場景或低光源條件下,根據物體的熱特徵有效地辨識出目標。
這種強大的感知能力使得許多視覺任務(如物件偵測、目標追蹤以及自動駕駛)變得更加容易實現。然而,在實務應用中,要取得完美配對的可見光與紅外線影像資料集具有先天的困難度,這突顯了開發「可見光影像轉換為紅外線影像」(Visible-to-Infrared, V2IR)技術的迫切性與重要性。透過人工智慧與深度學習的輔助,我們能夠從既有的可見光影像中,生成高度擬真的紅外線影像,從而大幅降低資料蒐集的成本,並為後續的電腦視覺任務提供豐富的訓練素材。
貳 科技發展現況
一、 生成模型技術的演進
近期的V2IR 轉換學術研究主要採用下列三種網路架構:
1. GAN(Generative Adversarial Networks)架構:
在目前的影像轉換生成技術中,生成對抗網路(GAN)[1] 是 V2IR 轉換的主流技術,例如 Pix2Pix [2]、CycleGAN [3]、ThermalGAN [4] 與 InfraGAN [5] 等模型。GANs 包含一個生成器(Generator)與一個鑑別器(Discriminator),兩者在訓練過程中進行競爭與對抗。生成器的目標是將輸入影像轉換為逼真的目標影像以騙過鑑別器,而鑑別器則致力於區分真實影像與生成影像。為了解決跨模態轉換中的邊緣失真與細節遺失問題,近期的研究引入了多尺度融合特徵、知識蒸餾(Knowledge Distillation) [6]技術,甚至利用鑑別器來引導生成器重建更準確的紅外線特徵。
2. Transformer 架構:
為了解決傳統「卷積神經網路」 (CNN;Convolutional Neural Network)在捕捉全局上下文資訊方面的局限性,學界開始採用基於 Transformer [7] 的架構(如 Implicit Multi-spectral Transformer (IMT) [8]),能更有效地提取影像的全域上下文資訊、色彩感知與紋理特徵,這類模型透過色彩感知適配器與動態融合聚合模組,有效減少低光照或遮擋造成的資訊遺失,並大幅提升影像的紋理細節,並將其精準映射至紅外線潛在空間,顯著提升了生成的細節保真度。
3. 擴散模型(Diffusion Models):
擴散模型(Diffusion Models)[9]近期也被應用於 V2IR 任務中,並結合視覺-語言理解(Vision-Language Understanding)技術。這類模型透過文本與語義的輔助,能夠實現具備語義感知(Semantic-aware)的轉換,並有效處理紅外線成像中多樣化的波段輻射(如近紅外、短波、中波及長波紅外線)物理特性差異問題。
在過去的可見光轉紅外線任務中,許多研究採用了基於 Unet [10] 架構或殘差網路(ResNet [11])的模型。例如 ThermalGAN 採用 Unet 作為生成器架構,而 I-GANs (Infrared Generative Adversarial Networks;紅外線影像生成對抗網路) 則引入了 D-LinkNet [12] 並結合 ResNet34 (有34 層核心權重層的一種ResNet) 作為編碼器。此外,在缺乏配對影像的情況下,CycleGAN 也常被用來進行跨域的影像轉換。然而,傳統的 Unet 模型在進行紅外線影像轉換時面臨一些缺點,包含參數數量過多、計算複雜度高,以及在上採樣(upsampling)過程中容易產生網格狀的假影(grid-like outputs)等技術瓶頸。
為突破這些瓶頸,近期的研究提出了「Frequency-aware Axial-ShiftedNet (Freq-ShiftedNet) [13]」模型。該模型透過頻率感知技術與特徵拆解來保留影像細節,結合了 Haar 小波轉換(Haar wavelet transform) [14]來處理頻率資訊,能夠有效保留影像的細節與結構資訊。
二、 針對下游任務(Downstream Tasks)的聯合最佳化
早期的影像轉換往往只著重於生成影像的視覺逼真度,但產業界更關注生成的紅外線資料是否能實際提升下游系統的效能。目前的發展趨勢已轉向將「影像生成」與「下游任務」(如目標偵測、行人重辨識等後續應用任務)進行聯合訓練與最佳化。
1. 目標偵測與追蹤:例如為了解決自動駕駛或無人機(UAV)在夜間的行人與車輛偵測,V2IR 技術被用來生成訓練資料,以提高 YOLO [15] 等偵測模型在實際紅外線場景中的平均精度(mAP)。
2. 多模態模板匹配(Template Matching):最新的研究(如 TMGAN模型 [16])將影像匹配損失例如 NCC (Normalized Cross-Correlation;正規化互相關) 與 MP loss (Mean Perceptual Loss;平均感知損失)整合至生成網路的訓練過程中,使生成的紅外線影像不僅具備視覺真實性,還能在異質影像匹配任務中達到極高的可靠性,解決了過去 GAN 生成影像難以直接應用於精確匹配的爭議。
三、 大規模資料集的建置與基礎模型發展
V2IR 發展的另一大瓶頸在於缺乏大規模且多樣化的紅外線開源資料庫。雖然過去有 FLIR [17]、KAIST [18]、M3FD [19] 等資料集,但場景與視角仍受限。為此,學術界開始致力於建構整合性的大型資料集(例如包含 50 萬張紅外線影像的 IR-500K),涵蓋無人機空拍、自動駕駛、監控與手持設備等多種視角與複雜場景。這類資料基礎建設的完善,正推動著 V2IR 領域朝向訓練「大型視覺基礎模型(Foundation Models)」的目標邁進。
綜上所述,可見光轉紅外線技術正從單純的影像風格轉換,邁向結合 Transformer、擴散模型與語義理解的高階生成技術,並以解決實際產業的目標偵測、影像匹配與數據擴增需求為導向,展現出極大的應用潛力。
參 在智慧安防的應用
隨著全球城市化進程的加速與物聯網(IoT)基礎設施的普及,智慧安防產業在近年來經歷了爆發性的成長與技術革新。從早期的被動式錄影存證,到如今具備深度學習與邊緣運算能力的即時主動監控,安防系統的視覺感知能力已成為守護公共安全、智慧交通與居家防護的核心樞紐。然而,全天候、全天時的監控需求,使得傳統依賴可見光的攝影設備在夜間或濃霧、暴雨等視線不佳或低光照的環境下遭遇嚴峻挑戰。為解決此一痛點,紅外線(Infrared, IR)成像與可見光轉紅外線影像生成技術應運而生,並逐漸成為學術界與產業界競相投入的關鍵前瞻技術。
一、 智慧安防產業的演進:從傳統監控到 AI 視覺代理人
傳統的安防監控系統主要依賴人力監看,在海量數據與長時間運作下,極易造成人員疲勞與疏漏。隨著人工智慧(AI)技術的突破,推論式 AI 開始廣泛應用於安防領域,賦予了系統人臉辨識、車牌辨識及行為分析等功能,使監控具備即時警示的能力。現今,生成式 AI(AIGC)的崛起進一步推動了安防產業的升級,使系統從單純的「推論與識別」走向具備理解、推理及生成內容能力的「AI 視覺代理人(AI Visual Agent)」。這種進階形態的系統不僅能分析當下情境、預測潛在風險,還能提供目標對象的行為模式預測,實現高度主動的安防管理。
然而,要讓 AI 視覺代理人真正在全天候環境下發揮作用,首要條件是必須擁有清晰且高質量的影像來源。在日間光線充足時,可見光感測器能捕捉豐富的色彩與紋理細節;但在夜間或惡劣天候(如濃霧、暴雨)下,可見光設備的效能會大幅衰退。為此,業界廣泛採用了主動紅外線夜視技術與熱成像系統來填補夜間視覺的空白。主動紅外線技術利用 850nm 或 940nm 波長的紅外線 LED 作為補光光源,配合移除紅外截止濾鏡的感測器,在低光環境下生成清晰的黑白影像,這已成為目前行車紀錄器、居家監控與智慧門鈴中最具成本效益的標準配置。例如,安迅士(Axis)等大廠便透過最佳化的紅外線技術,使攝影機的紅外線照明角度能隨鏡頭視角自動調整,以極低的功耗提供均勻的夜間照明,並有效抑制影像雜訊。
儘管主動紅外線與熱成像技術解決了「夜間看不見」的問題,但它們生成的影像在視覺特徵上與可見光影像存在巨大的「模態差異(Modality Gap)」。熱成像僅反映物體的溫度分佈而缺乏表面紋理,主動紅外線影像則缺乏色彩資訊且常伴隨過曝或對比度不均的現象。這種差異使得原本在可見光數據上訓練良好的 AI 模型,在處理紅外線影像時效能大幅下降,成為智慧安防系統進一步升級的重大瓶頸。
二、 產業痛點:多光譜資料短缺與極端場景驗證
在智慧安防與 UAV 無人機的實際場景中,AI 視覺系統持續面臨複雜城市環境、動態物體遮蔽及惡劣天候等挑戰。其中,訓練資料的取得是一大關鍵瓶頸:長波紅外線(LWIR)與微光夜視(NVG)影像的現場採集不僅需耗費大量人力與時間,更須搭配精確的像素級標註(Pixel-level Annotation),致使整體資料建置成本極為高昂。尤其在極端氣候、高風險邊境或特殊犯罪場景等條件下,所需的多光譜訓練資料更常因法規與安全考量而難以合法取得,形成顯著的「多光譜資料短缺(Multi-spectral Data Shortage)」困境。
若系統缺乏足夠的紅外線影像進行訓練,AI 演算法在實戰中遭遇複雜的城市背景、偽隨機動態雜訊或容積氣象(如體積雲、濃霧造成的多光譜特徵非線性破壞)時,其目標鑑別率將會急遽崩潰。雖然產業界已經開始利用 3D 虛擬合成環境(Synthetic Environment)來大規模生成基於物理特性的熱成像與光學訓練數據,以進行閉環訓練與硬體在環(HIL)驗證,但虛擬生成的數據與真實世界的感測器雜訊分佈仍存在差距。這促使學界與產業界轉向尋求另一種高效的解決方案——利用龐大且易於取得的真實可見光影像,透過深度學習技術,直接「轉換」或「生成」高保真的真實紅外線影像。
三、 V2IR 技術於智慧安防的應用優勢
可見光轉紅外線影像生成(Visible-to-Infrared Image Translation)技術,旨在建立一個跨模態的映射函數,將可見光影像中的場景結構、物件語意與紋理特徵,合理且真實地轉換為紅外線感測器所呈現的視覺特徵。這項技術在安防產業中具有無可取代的戰略價值:
1. 擴充夜間安防數據庫:
透過影像生成技術,安防企業可以直接利用既有的日間可見光監控畫面,批量生成對應的夜間紅外線影像。這不僅大幅降低了夜間數據採集與人工標註的成本,還能確保同一個場景與目標(如特定嫌疑犯的衣著輪廓、特定車輛的車型)在不同模態下擁有完全對齊的配對資料,為訓練高精度的跨模態行人重識別(Cross-modality Person ReID [20])模型奠定基礎。
2. 提升 AI 視覺代理人的環境適應力:
結合生成式 AI(如 Diffusion Models 擴散模型或先進的 GAN 架構),可見光轉紅外線技術能夠模擬不同溫濕度、不同紅外線 LED 補光強度(如 850nm 與 940nm 的差異)下的成像效果。甚至能模擬極端天候對紅外線訊噪比的破壞 ,藉此對 AI 演算法進行壓力測試,確保 AI 視覺代理人在面臨真實世界的不可控變數時,依然能做出準確的自主判斷與決策。
3. 隱蔽監控與夜間目標追蹤:
在軍工、邊防或高階安防應用中,往往需要使用完全不可見的 940nm 紅外線照明或無源熱成像來進行隱蔽監控。這類影像對於人類操作員而言極難判讀細節。透過可見光與紅外線的雙向轉換或特徵融合技術,系統可以在保持隱蔽性的同時,在後台將紅外線特徵重建為近似可見光的清晰影像,或利用生成技術強化紅外線影像中的物體邊緣與輪廓,輔助人類決策或提升機器視覺的追蹤穩定度。
四、 智慧安防系統可獲得以下幾點顯著提升
1. 全天候周界防護:
利用轉換技術擴充紅外線訓練資料集,可以訓練出更強健的 AI 辨識模型。即使在完全無光的夜晚,安防系統也能精準識別入侵者的熱訊號,降低誤報與漏報率。
2. 隱蔽監控與搜救:
在警政與搜救任務中,紅外線影像能穿透部分遮蔽物(如煙霧或稀疏樹林)偵測人體體溫。將白天蒐集到的可見光場景預先轉換為紅外線特徵圖,有助於搜救無人機或安防機器人進行地形比對與任務規劃。
3. 低成本系統升級:
實體的軍規高解析度紅外線熱像儀造價昂貴。藉由 Freq-ShiftedNet 等高效能的影像轉換模型,我們可以在邊緣運算設備上,將普通監視器捕捉到的微弱可見光影像即時強化並轉換為具有熱特徵參考價值的影像,大幅降低安防系統的硬體建置成本。
五、 技術瓶頸與挑戰
儘管可見光轉紅外線影像生成技術前景廣闊,但在實際落地於智慧安防產業時,仍面臨諸多嚴峻挑戰。首先是「語意一致性(Semantic Consistency)」的維持。可見光反映的是物體表面的反射率與色彩,而紅外線(尤其是熱成像)反映的是物體的熱輻射與發射率。在轉換過程中,模型極易產生「幻覺(Hallucination)」,例如將可見光中的黑色衣服錯誤生成為紅外線影像中的高溫(亮白色)區域,這種不符合物理特性的轉換將對安防辨識造成致命的誤導。
其次是「邊緣細節與雜訊分佈」的擬真度。真實的安防紅外線攝影機在低光下不可避免地會產生特定的熱噪(Thermal Noise)與光學模糊。若生成的紅外線影像過於平滑完美,AI 模型將學到錯誤的特徵分佈,導致其在真實佈署時發生嚴重的過擬合(Overfitting)與目標丟失。最後,高解析度(如 4K 監控影像)的跨模態生成需要龐大的運算資源,如何設計出輕量化且能即時運算的模型,以適應邊緣運算設備(Edge Computing)的硬體限制,是目前產業界急需克服的難題。
六、 未來展望
綜上所述,智慧安防產業正處於從單一模態、被動辨識向多光譜、主動式「AI 視覺代理人」演進的關鍵十字路口。面對夜間監控的多光譜數據匱乏 以及可見光與紅外線影像之間的巨大模態鴻溝,可見光轉紅外線影像生成技術展現出了不可估量的產業價值與應用潛力。然而,如何確保生成影像的物理合理性、特徵一致性以及對下游安防辨識任務的實質助益,仍是當前學術界亟欲突破的技術天花板。
面對上述挑戰,當前學術界與產業界正積極探索跨模態影像生成技術在智慧安防與無人載具領域的落地應用。現有研究聚焦於語意對齊與紋理特徵的改善,目標是為安防系統提供高保真、具物理合理性的紅外線影像資料,以強化全天候的多光譜感知能力。
肆 結語
總結來說,可見光轉紅外線影像生成技術在近年來取得了顯著的進展,模型架構從早期的基礎生成對抗網路(GAN),逐步演進至結合 Transformer 與擴散模型(Diffusion Models)的先進技術。這些創新大幅提升了跨模態影像轉換的視覺品質。然而,要將此技術真正落地並廣泛應用於嚴苛的現實場景,仍需克服諸多技術瓶頸,包含影像邊緣失真、熱輻射物理特徵的細節遺失、跨模態轉換間的語意不一致(Semantic Consistency),以及高解析度生成在邊緣運算設備(Edge Computing)上所面臨的龐大算力負荷。未來,其在智慧安防領域的應用持續扮演關鍵角色,相關研究和突破將更上層樓。
伍 參考文獻
[1] I. J. Goodfellow, J. Pouget-Abadie, M. Mirza, B. Xu, D. Warde-Farley, S. Ozair, A. Courville, and Y. Bengio, "Generative adversarial nets," in Proc. Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 27, 2014.
[2] P. Isola, J.-Y. Zhu, T. Zhou, and A. A. Efros, "Image-to-image translation with conditional adversarial networks," in Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR), 2017, pp. 1125-1134.
[3] J.-Y. Zhu, T. Park, P. Isola, and A. A. Efros, "Unpaired image-to-image translation using cycle-consistent adversarial networks," in Proc. IEEE Int. Conf. Comput. Vis. (ICCV), 2017, pp. 2223-2232.
[4] V. V. Kniaz, V. A. Knyaz, J. Hladuvka, W. G. Kropatsch, and V. Mizginov, "ThermalGAN: Multimodal color-to-thermal image translation for person re-identification in multispectral dataset," in Proc. Eur. Conf. Comput. Vis. Workshops (ECCVW), 2018, pp. 582-596.
[5] M. A. Ozkanoglu and S. Ozer, "InfraGAN: A GAN architecture to transfer visible images to infrared domain," Pattern Recognit. Lett., vol. 155, pp. 69-76, 2022.
[6] G. Hinton, O. Vinyals, and J. Dean, "Distilling the knowledge in a neural network," in Proc. NIPS 2014 Deep Learn. Workshop, 2014.
[7] A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, L. Kaiser, and I. Polosukhin, "Attention is all you need," in Proc. Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 30, 2017.
[8] Y. Chen, P. Chen, X. Zhou, and Y. Lei, "Implicit multi-spectral transformer: A lightweight and effective visible to infrared image translation model," in Proc. Int. Joint Conf. Neural Netw. (IJCNN), 2024.
[9] J. Ho, A. Jain, and P. Abbeel, "Denoising diffusion probabilistic models," in Proc. Adv. Neural Inf. Process. Syst. (NeurIPS), vol. 33, 2020, pp. 6840-6851.
[10] O. Ronneberger, P. Fischer, and T. Brox, "U-Net: Convolutional networks for biomedical image segmentation," in Proc. Med. Image Comput. Comput.-Assisted Intervention (MICCAI), 2015, pp. 234-241.
[11] K. He, X. Zhang, S. Ren, and J. Sun, "Deep residual learning for image recognition," in Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR), 2016, pp. 770-778.
[12] L. Zhou, C. Zhang, and M. Wu, "D-LinkNet: LinkNet with pretrained encoder and dilated convolution for high resolution satellite imagery road extraction," in Proc. IEEE Conf. Comput. Vis. Pattern Recognit. Workshops (CVPRW), 2018, pp. 192-196.
[13] H. J. Lin, W. Y. Cheng, and D. Y. Chen, "Frequency-aware axial-ShiftedNet in generative adversarial networks for visible-to-infrared image translation," IEEE Access, vol. 12, pp. 148556-148569, 2024.
[14] A. Haar, "Zur Theorie der orthogonalen Funktionensysteme," Math. Ann., vol. 69, no. 3, pp. 331-371, 1910.
[15] J. Redmon, S. Divvala, R. Girshick, and A. Farhadi, "You only look once: Unified, real-time object detection," in Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR), 2016, pp. 779-788.
[16] D. Ma, S. Li, J. Su, Y. Xian, and T. Zhang, "Visible-to-infrared image translation for matching tasks," arXiv, 2024.
[17] FLIR Systems, "FLIR thermal dataset for algorithm training," FLIR Systems, Inc., Wilsonville, OR, USA, 2018. [Online]. Available: https://www.flir.com/oem/adas/adas-dataset-form/
[18] S. Hwang, J. Park, N. Kim, Y. Choi, and I. S. Kweon, "Multispectral pedestrian detection: Benchmark dataset and baseline," in Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR), 2015.
[19] J. Liu, X. Fan, Z. Huang, G. Wu, R. Liu, W. Zhong, and Z. Luo, "Target-aware dual adversarial learning and a multi-scenario multi-modality benchmark to fuse infrared and visible for object detection," in Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR), 2022, pp. 5792-5801.
[20] G. Wu, T. Zheng, Z. Wang, L. Wang, and Q. Tian, "RGB-infrared cross-modality person re-identification," in Proc. IEEE Int. Conf. Comput. Vis. (ICCV), 2017, pp. 5380-5389.