聚焦于数字建筑学中人工智能的核心驱动力——算法,系统介绍了目前建筑学业内主流的四种神经网络(ANN、CNN、GAN、RNN)的结构原理、运行机制、优势局限及其在建筑设计中的前沿应用。
一、 主流神经网络的定义与映射关系
在数字建筑学的应用中,这四种网络通过不同的数据结构处理,实现了不同的输入与输出映射:
- 人工神经网络(ANN):映射向量到向量,是几乎所有神经网络的起源。
- 卷积神经网络(CNN):结构映射图像到向量,是最常用的图像处理算法。
- 生成对抗网络(GAN):映射图像到图像,通常用于生成式设计。
- 循环神经网络(RNN):将有序向量映射到向量上,专门处理长度不确定的序列数据。
二、 卷积神经网络(CNN):图像处理与特征提取的利器
CNN 是近年来最受关注的人工神经网络结构之一,广泛应用于计算机图片识别、视频分析、自然语言处理等领域。
1. 解决传统图像处理的两大难题:
- 数据量过大、计算成本高:一张 $1000 \times 1000$ 像素的 RGB 图像包含达 300 万个参数。CNN 通过降维技术,将复杂的图像数据简化为少量数据进行提取与处理,极大地降低了能耗与计算时间。
- 数字化过程中难以保留特征:在传统算法中,物体在图像中的位置移动或翻转会产生完全不同的参数表达。CNN 模仿人类的视觉原理,不仅能逐层分级提取基础边缘到高级物体的特征,还能在图像翻转或位置变动时,有效识别出相似的图像特征。
2. 核心架构与运行机制:
- 卷积层(Convolutional Layer):利用较小的过滤器(Filter)和内核(Kernel)在图像上滑动进行卷积运算,计算 RGB 通道的 3D 矩阵,提取局部特征并生成特征图(Feature Map)。
- 池化层(Pooling Layer / 磁化层):对特征进行下采样(例如将 $20 \times 20$ 采样为 $2 \times 2$),大幅降维并减小运算量,同时有效避免过拟合(Overfitting)。
- 全连接层(Fully Connected Layer):作为分类器,将前面学到的分布式特征映射到样本标记空间,最终输出预测结果。
3. 5 大经典应用场景:
- 目标定位检测、目标分割(像素级分类)、骨骼识别与动作追踪、人脸识别、图像分类与检索。
三、 生成对抗网络(GAN):生成式设计的“博弈论”
2014年由 Ian Goodfellow 引入深度学习领域的 GAN,被誉为“20年来机器学习领域最酷的想法”。其核心动机在于实现自动化——从人工提取特征转向自动提取,从人工判断生成结果转向自动判别与优化。
1. 两个博弈的网络结构:
- 生成器(Generator):负责制造高质量的假数据(通常是图像),目标是骗过辨别器。
- 辨别器/判别器(Discriminator):负责判断输入图像的真伪,目标是找出生成器制造的假数据。
- 猫鼠游戏比喻:两者的博弈如同电影《猫鼠游戏》中高超造假者与 FBI 侦探的对抗,在相互博弈中共同成长。
2. 双阶段循环训练流程:
- 第一阶段:固定辨别器,训练生成器,直至生成器能产生逼真数据使辨别器的判别概率降到 50%(纯靠瞎拆)。
- 第二阶段:固定生成器,训练辨别器,提升其鉴别真伪的准确率。
- 通过反复循环这两个阶段,最终训练出极其强大的生成器,用于生成目标图像。
3. 建筑设计与图像转化的应用实践:
- 基本应用:草图变照片、照片变地图、白天变黑夜、文本生成图像以及 2D 图纸重建 3D 模型等。
- 前沿学术案例:
- UCL 和 AA 的学生通过扎哈·哈迪德设计的阿卜杜拉国王石油研究中心(KAPSARC)及慕尼黑市中心的一系列图片进行数据集训练,利用 GAN 算法创建了实时交互界面,辅助建筑师生成概念方案。
- 同济大学建筑与城市规划学院在本科大四课程中,引导学生通过对卫星图与古地图的学习,利用算法生成了具有放射性水波纹效果的总平面图。
四、 人工神经网络(ANN):万物之源与数据重构
ANN 是几乎所有神经网络的起源,它直接将数据视为单纯的向量和时数。
- 高效的设计生成路径:虽然 ANN 不像 CNN 和 GAN 那样能直接带来直观的可视化结果,但计算机本质上就是将数据存储为时数与矩阵。因此,使用适当的数据结构来转译、概括设计,并使用 ANN 来学习和生成,往往是一种比纯图像渲染更高效、更准确的数字设计方法。
五、 循环神经网络(RNN):序列数据与时间流的记忆
RNN 专门用于处理长度不确定的有序序列数据,最最初为语言处理而开发。
- 工作原理(引入历史记忆):不同于传统神经网络,RNN 的最大特征在于每次运行都会将前一次的输出结果带入到下一次的隐藏层中一起训练。输入序列中每一个位置的输出,都受到此前所有输入历史的影响。
- 应用领域:由于其对时间序列数据和前后文关系的强大处理能力,在建筑学中,常与 CNN 结合进行“看图说话”(给出一张设计图并自动生成文字描述),或用于时间序列预测、手写识别、语音识别和机器翻译等场景。