深度学习应用开发实践——基于MindSpore平台

978-7-115-69181-1
作者: 明朝燕金苍宏王军石龙翔
译者:
编辑: 邓昱洲
分类: 其他

图书目录:

详情

本书聚焦人工智能应用型人才培养的核心需求,以国产深度学习框架——华为昇思(MindSpore)为开发平台,通过案例引导与项目驱动相结合的教学模式,系统讲解深度学习技术在实际应用场景的落地实践。本书内容涵盖线性回归、卷积神经网络、循环神经网络及强化学习等典型算法和主流模型,共有10个实践案例贯穿其中,包括图像分类、医学影像分割、文本情感分析、游戏策略优化等。本书特别融入模型可视化、迁移学习、服务化部署等工程化技能,并提供完整的案例代码和实验数据供读者学习。 本书主要面向应用型高等学校的工科专业学生(需要具备基础编程能力与数学知识),同时适合希望快速掌握人工智能落地能力的开发者,以及开设“人工智能+X”交叉课程的教师参考。

图书摘要

版权信息

书名:深度学习应用开发实践:基于MindSpore平台

ISBN:978-7-115-69181-1

本书由人民邮电出版社发行数字版。版权所有,侵权必究。

您购买的人民邮电出版社电子书仅供您个人使用,未经授权,不得以任何方式复制和传播本书内容。

我们愿意相信读者具有这样的良知和觉悟,与我们共同保护知识产权。

如果购买者有侵权行为,我们可能对该用户实施包括但不限于关闭该帐号等维权措施,并可能追究法律责任。


版  权

编  著 明朝燕 金苍宏 王 军 石龙翔

责任编辑 邓昱洲

人民邮电出版社出版发行  北京市丰台区成寿寺路11号

邮编 100164  电子邮件 315@ptpress.com.cn

网址 http://www.ptpress.com.cn

读者服务热线:(010)81055410

反盗版热线:(010)81055315

内 容 提 要

本书聚焦人工智能应用型人才培养的核心需求,以国产深度学习框架——华为昇思(MindSpore)为开发平台,通过案例引导与项目驱动相结合的教学模式,系统讲解深度学习技术在实际应用场景的落地实践。本书内容涵盖线性回归、卷积神经网络、循环神经网络及强化学习等典型算法和主流模型,共有10个实践案例贯穿其中,包括图像分类、医学影像分割、文本情感分析、游戏策略优化等。本书特别融入模型可视化、迁移学习、服务化部署等工程化技能,并提供完整的案例代码和实验数据供读者学习。

本书主要面向应用型高等学校的工科专业学生(需要具备基础编程能力与数学知识),同时适合希望快速掌握人工智能落地能力的开发者,以及开设“人工智能+X”交叉课程的教师参考。

“新一代信息技术系列”专家委员会

主  任:吕卫锋 北京航空航天大学副校长

副 主 任:马殿富 北京航空航天大学计算机学院教授

     何钦铭 浙江大学计算机科学与技术学院教授

     何炎祥 武汉大学计算机学院教授

     彭红华 华为ICT战略与业务发展部总裁

     唐小光 华为中国战略与Marketing部部长

     孙 虎 华为服务Fellow、首席项目管理专家

     孙 刚 华为ICT人才伙伴发展部部长

编  委:(按姓氏音序排列)

     范 举 中国人民大学信息学院教授

     方 娟 北京工业大学计算机学院副院长

     郭 耀 北京大学计算机学院副院长

     刘耀林 华为ICT人才伙伴发展部校企合作总监

     苏统华 哈尔滨工业大学软件学院副院长

     孙海龙 北京航空航天大学软件学院教授

     王 菡 北京邮电大学叶培大创新创业学院副院长

     王景全 华为基础软件人才发展总监

     王 新 华为中国区产业发展与生态部总工

     魏 彪 华为ICT学院合作总监

     周 烜 华东师范大学数据科学与工程学院副院长

丛 书 序

当下,信息技术的浪潮正以惊人的速度重塑着全球社会经济的版图。云计算、大数据、人工智能、物联网等新一代信息技术不断涌现,推动产业结构经历深刻的变革。在这场技术革命中,基础软件扮演着至关重要的角色,它不仅是信息系统的基石,更是技术创新的源泉和信息安全的守护者。

回首数十年来我国基础软件的发展历程,国家在这一领域倾注了大量资源。得益于国家科技重大专项和政策的有力支持,我国的基础软件实现了迅猛发展,步入了快车道。国产软件阵营蔚为壮观,操作系统、数据库管理系统、中间件等核心领域硕果累累,不仅在国内市场占据了一席之地,更在多个关键领域跻身国际先进行列。随着开源生态的逐步繁荣,我国也积极响应,拥抱开源生态建设。我们目睹了openEuler、OpenHarmony等国产操作系统的蓬勃发展,见证了MindSpore人工智能框架的突破性创新,以及Ascend C编程语言的闪亮登场。在华为等科技企业和广大开发者的共同努力下,基础软件在开源生态蓬勃发展的推动下取得了更大的成就。这些成就是我国基础软件实力的有力证明,也是自主创新能力的生动展示。它们不仅彰显了我国在全球化技术竞争中的坚定立场,更体现了对技术自主权的坚守与对自主创新的决心。

在全球化的技术竞争中,自主创新是我们的必由之路,开源生态建设是关键一环。开源生态支持多元化的技术体系和发展路径,有助于形成多样化的产业生态系统,满足不同行业和领域的需求;推动了技术和接口的标准化,使得不同软件之间能够更容易地实现互操作和集成;促使资源共享,减少了重复开发和资源浪费,提高了资源的利用效率。因此,未来基础软件的发展离不开开源生态的建设。

当前,在核心技术、产业生态和国际标准制定上,我国的基础软件与国际先进水平仍有一定的差距。我们必须深化对基础软件的认识,加大研发投入,更加积极地拥抱开源生态建设,培育卓越人才,以确保在科技革命和产业变革中占据有利地位。当下,各大高校正在构建相关课程体系,强化理论与实践结合,建立先进的基础软件实验室,通过校企合作,推动学术与产业的融合,致力于培养具有国际视野的高水平基础软件人才。

由此,我们精心编写了这一丛书,以响应国家对基础软件国产化替代的战略需求,为信息技术行业的人才培养提供有力的知识支持。本丛书以国产基础软件为核心,全面覆盖操作系统、编程语言、人工智能等关键技术领域,深入剖析基础软件的发展历程、核心技术、应用案例及未来趋势,力图构建多维度、立体化的知识架构,为读者提供全方位的视角。

本丛书在内容布局上,注重系统性与实用性的结合,侧重于培养读者的实践能力和创新思维。我们不仅深入探讨基础软件的理论基础与技术原理,更通过丰富的实际案例与应用场景,展示华为等企业在该领域的最新成果与创新实践,引导读者将理论知识转化为解决实际问题的能力。本丛书的编写团队由国内一流院校的教师和业界资深专家组成,他们深厚的学术背景和丰富的实践经验,为丛书内容的权威性和实用性提供了坚实保障。

我们期望通过这套丛书,传播国产基础软件的先进理念与优秀成果,激发广大师生与从业人员的使命感,鼓励他们投身于我国基础软件国产化的创新征程。我们坚信,唯有汇聚全社会的智慧与力量,持续推动创新,才能实现我国基础软件的自主可控与高质量发展。让我们携手并进,共同推动新一代信息技术的繁荣发展,助力我国从信息技术大国迈向信息技术强国。

北京航空航天大学副校长 吕卫锋

丛 书 前 言

培养基础软件人才 助力软件行业根深叶茂

当下,人工智能创新风起云涌,大模型“百花齐放”,云计算步入“黄金时代”……我们看到,以人工智能、云计算、大数据等为代表的新一代信息技术加速突破应用,推动社会生产方式变革、创造人类生活新空间。基础软件作为新一代信息技术的底座,为信息产业和数字经济的发展提供了强有力的支撑,它不仅是各种应用软件运行的平台,还承载着数据处理、网络通信、系统安全等核心功能。一个强大、稳定、高效的基础软件体系,能够确保整个信息产业和数字经济的顺畅运行,为各种创新应用提供坚实的土壤。因此,基础软件技术也被称为“根技术”。

为构筑软件行业的根基,华为与全球伙伴一起,围绕鲲鹏、昇腾、欧拉、CANN、昇思等产品,构建数字基础设施生态,打造数字世界的算力底座。同时,华为秉持包容、公平、开放、团结和可持续的理念,与开发者共建世界级开源社区,加速软件创新和共享生态繁荣。

人才是高科技产业的关键资源。基础软件作为底层技术,通用性和专业性更强,因此需要更多对基础软件有深入研究、有自主创新能力的人才。

在ICT人才培养方面,华为已沉淀了30多年的丰富经验。华为将这些在ICT行业中长期工程实践积累而来的经验、技术、人才培养标准贡献出来,联合教育主管部门、高等学校、培训机构和合作伙伴等各方生态角色,通过建设人才联盟、融入人才标准、提升人才能力、传播人才价值,构建良性ICT人才生态,从而促进科技进步、产业繁荣,助推社会可持续发展。

为培养高校ICT人才,从2013年起,华为携手全球高校共建华为ICT学院。这一校企合作项目通过提供完善的课程体系,搭建线上学习和实验平台,培养师资力量,携手高校培养创新型和应用型人才;同时通过例行发布ICT人才白皮书,举办华为ICT大赛、华为ICT人才双选会等,营造人才成长的良好环境和通路,促进人才培养良性循环。

教材是知识传递、人才培养的重要载体,华为通过校企合作模式出版教材,助力高校人才培养模式改革,推动ICT人才快速成长。为培养基础软件人才,华为聚合技术专家、高校教师等,倾心打造华为ICT学院教材。本丛书聚焦华为基础软件,内容覆盖 OpenHarmony、openEuler、MindSpore、Ascend C,系统梳理和融合前沿基础软件技术;包含大量基于真实工作场景编写的行业实际案例,理实结合;将知识条理清晰、由浅入深地拆解分析,逻辑严谨;配套丰富的学习资源,包括源代码、实验手册、在线课程、测试题等,利于学习。本丛书既适合作为高等学校相关课程的教材,也适合作为参与相关技术方向华为认证考试的参考书,还适合计算机爱好者用以学习和探索基础软件的开发应用。

智能化的大潮正奔涌而来,未来智能世界充满机遇和挑战。希望广大读者在基础软件的知识海洋中遨游,完成知识积累,拓展实践能力,提升软件技能,为未来职场蓄力。华为也期待与你们携手,共同打造根深叶茂的基础软件基座和开源生态系统,为促进基础软件根技术生态发展、推动科技创新、促进数字经济高速增长贡献力量。

华为ICT战略与业务发展部总裁 彭红华

前  言

人工智能技术的爆炸式发展正在重构全球产业生态。随着国产深度学习框架华为昇思(MindSpore)在开源社区的崛起,构建自主、可控的人工智能人才培养体系已成为新工科建设的战略任务。本书依托国家级新工科项目“面向新工科的通专融合型计算机课程及教材建设”,致力于解决三重关键矛盾:一是技术快速迭代与教学资源更新滞后的矛盾,基于MindSpore 2.x新特性设计实训案例;二是理论深度与工程实践脱节的矛盾,通过实际应用场景项目实现“学中用、用中学”的闭环;三是技能培养与价值引领不协同的矛盾,将模型可解释性、数据隐私保护等伦理议题融入开发全流程。

本书采用四阶渐进式设计,共12章内容。第1章和第2章包含人工智能概述与MindSpore开发环境搭建,帮助读者建立技术全景认知并掌握国产框架开发环境构建能力。第3~5章从单变量线性回归案例开始,到多元线性回归案例,最后完成全连接神经网络手写数字识别系统开发,重点介绍图像分类场景的模型调优与可视化技巧。第6~10章聚焦深度网络实战,包括卷积神经网络图像识别问题、医学影像分割中的卷积核设计、迁移学习在小样本场景中的解决方案、循环神经网络文本情感分析的时序数据处理、强化学习DQN算法的工业适配。第11章和第12章突破单机训练局限,详解模型服务化部署的RESTful API开发与测试,以及基于MindSpore Lite的移动端模型压缩集成技术。

致谢

感谢国家出版基金项目的支持,以及华为昇思开源团队在技术实现层面的专业指导。感谢参与本书实验设计和测试的研究生王旭东、陈思安和叶伟挺。特别致谢浙大城市学院前院长吴明晖老师对本书的整体设计所做出的贡献。

第1章 人工智能概述

你还记得《流浪地球》中的超级计算机MOSS和《三体》中的智子吗?这些曾经只存在于科幻作品中的场景,正在悄然变成我们的日常生活。当你对着手机说“小艺小艺,帮我定个闹钟”,当你让文心一言写一首诗,当你和讯飞星火讨论中国历史——这一切都在告诉我们:有些科幻已成现实。

1.1 感受人工智能时代的到来

人工智能(Artificial Intelligence,AI)听起来好像很遥远,但它早已融入我们生活的方方面面。我们早上打开抖音看到的个性化内容,是AI在默默推送;我们中午点外卖后美团骑手的最优配送路线,是AI在运筹帷幄;我们晚上逛淘宝购物时看到的商品,依然是AI的推荐。下面让我们一起揭开AI的神秘面纱,看看这位“朋友”,如何让我们的生活变得更加丰富多彩。

1.1.1 人机博弈

2016年,AlphaGo(谷歌旗下DeepMind的围棋AI)以4∶1战胜了围棋世界冠军、职业九段棋手李世石。2017年,AlphaGo又以3∶0战胜了当时世界排名第一的中国棋手柯洁。

2017年10月18日,DeepMind团队公布了新版围棋AI,代号AlphaGo Zero。它和AlphaGo最大的区别在于,它采用从零开始的无监督学习模式,不需要任何人类经验,可以自学围棋。AlphaGo Zero仅用了3天时间,就以100∶0完胜了自己的前辈AlphaGo Lee(战胜了李世石的AI)。大约40天后,它又完胜了自己的另一个前辈AlphaGo Master。

2019年,开源围棋AI的里程碑作品KataGo问世,标志着围棋AI发展的新纪元。相较于AlphaGo系列,KataGo在训练效率上实现了40倍的飞跃,同时展现出更为卓越的实用性。该系统不仅能够灵活应对不同尺寸的棋盘以及多种规则的变体,还能够根据具体需求动态调整计算资源的分配,并为围棋选手提供精准的局面评估。

除了棋类游戏,AI在其他游戏领域同样表现出色。2017年8月,OpenAI与《Dota》世界冠军Dendi进行了一场对决。在比赛中,无论是位置控制、压制对手还是技能释放,AI的表现都堪称卓越,它甚至运用了各种假动作战术。最终,Dendi在短短10分钟内就遭遇了惨败。

2017年,腾讯AI Lab启动“绝悟”项目;2018年,“绝悟”在《王者荣耀》KPL秋季决赛期间首次亮相;2018年12月,它通过了顶尖业余水平测试。2019年8月2日,“绝悟”在吉隆坡举办的《王者荣耀》最高规格电竞赛事——世界冠军杯半决赛的特设环节中,在职业选手赛区联队的5v5水平测试中表现出色,成功获胜,升级至《王者荣耀》电竞职业水平。

1.1.2 宇宙探索

2017年12月,美国国家航空航天局(National Aeronautics and Space Administration,NASA)公布了使用开普勒望远镜获得的重磅发现:Kepler-90星系。在距离地球并不遥远的地方,有8颗行星围绕着一颗酷似太阳的恒星安静地旋转,证明了太阳系并不是宇宙中唯一的“太阳系”。

如果采用传统技术,无疑需要花费大量的时间和精力来处理开普勒望远镜收集的各种复杂数据。但在发现“缩小版”太阳系的过程中,AI的深度学习技术起到了重要作用。来自Google AI的工程师利用神经网络技术对开普勒望远镜收集的数据进行分析,通过卷积神经网络处理了140亿个数据点,有效协助了Kepler-90i行星的发现。

1.1.3 人机对话

在日常生活中,也有许多AI应用,如亚马逊的Alexa、谷歌的Google Assistant、苹果公司的Siri、微软的Cortana、阿里巴巴的天猫精灵、腾讯的腾讯听听、百度的小度在家、小米的小爱同学、喜马拉雅的小雅AI音箱等。它们都用了AI技术,比如语音识别、自然语言理解、翻译、推荐系统、语音合成等。

以Google Assistant为例,它可以帮助用户拨打电话,建立用户和商户之间良好的连接,并根据上下文语境和对话的细微差别自动适应情况,说出相应的回答,几乎可以达到以假乱真的效果。

浙江大学计算机学院赵洲团队利用自动语音识别(Automatic Speech Recognition,ASR)和自然语言处理(Natural Language Processing,NLP)技术自主研发了AI语音机器人“探意”,它能在中文电话场景下实现语音识别、语义理解和多轮对话。

1.1.4 计算机视觉

在图像识别与处理领域,AI技术已经深入日常生活的方方面面。从最基础的物体识别到复杂的场景理解,AI展现出越来越强大的视觉认知能力。

在实际应用中,Face++(旷视科技)和百度智能云AI开放平台提供的图像识别服务已经相当成熟,能够精确识别图像中的物体、人脸、文字等元素。这些技术催生了众多实用的应用程序:“形色”(睿琪软件)通过AI识别技术帮助用户轻松辨认植物;“爱作业”(大拿科技)让学生拍照即可完成作业批改;Google翻译的实时相机翻译功能,更是让跨语言交流变得前所未有地便捷。

在图像处理方面,AI技术展现出惊人的创造力。传统的图像处理如修复、增强、风格转换等任务,在AI的加持下变得更加智能和高效。比如,AI可以自动为黑白照片上色,修复破损的老照片,或将普通照片转换成凡·高、莫奈等艺术家的画风。

2022年至今,AI绘画领域迎来爆发性发展。Stable Diffusion的开源发布让AI绘画技术进入大众视野,用户只需要输入文本,就能生成精美的图像。Midjourney则以其独特的艺术风格和惊人的细节表现力著称,产出的作品常常具有超现实主义的美感。这些工具不仅服务于艺术创作,还被广泛应用于广告设计、游戏美术、产品展示等商业领域。

DALL·E 3的推出将文本到图像的生成能力推向新高度。它能够准确理解复杂的文本描述,并生成符合要求的高质量图像。例如,用户描述“一只戴着复古眼镜的猫咪正在咖啡馆里用笔记本计算机工作”,之后DALL·E 3就能创造出细节丰富、风格统一的图像,甚至能准确表现出场景的氛围和情感。

2024年年初,OpenAI发布的Sora视频生成模型更是掀起了新一轮技术革命。Sora能够根据文本描述生成长达一分钟的高质量视频,展现出令人惊叹的时空连续性和物理真实感。比如,它可以生成“一位老人在雪山上滑雪”的场景,不仅人物动作流畅自然,连雪花飘落、阳光反射等细节都处理得惟妙惟肖。

1.1.5 自然语言处理和大语言模型

2017年12月,今日头条人工智能实验室凭借“互联网信息摘要与机器写稿关键技术及应用”项目荣获吴文俊人工智能科学技术奖技术发明奖二等奖。在里约奥运会期间,xiaomingbot(新闻写作机器人)创作了超过200篇赛事报道,累计吸引了200万名用户阅读。xiaomingbot的撰写速度与电视直播同步,文章内容包括比赛时间、实时比分、运动员信息等关键新闻要素,并且能够自动插入插图。它不仅在网站上发布了各类新闻,还与传统新闻媒体建立了战略合作关系,为其提供优质内容,从而在一定程度上完成了新闻记者的部分工作。

“九歌”是由清华大学计算机科学与技术系孙茂松教授团队推出的一个计算机自动作诗系统。它可以根据用户输入的关键词,自动创作各类诗词,以科技与人文结合的方式,为中华传统文化的传承贡献了一份力量。根据用户输入的关键字,“九歌”生成藏头诗如图1.1所示。

图1.1 “九歌”生成藏头诗

阿里云团队曾基于AI技术推出智能足球解说系统,通过比赛视频即可追踪球员轨迹并进行动作分析,配合AI算法可实时合成解说语音。它可以识别出每一个运动员,获取其背景以及曾经的经历,比普通解说员的知识更加丰富。

近年来,大语言模型的发展突飞猛进,掀起了AI领域的新浪潮。2022年年底,ChatGPT发布,引发全球关注;2023年3月,GPT-4发布,将大语言模型的能力推向新高度。GPT-4不仅能处理文本,还具备图像理解能力。例如,它能看懂手绘草图并将其转换为实际网页代码,能解读图表数据并进行分析,甚至能识别图像中的幽默元素并作出恰当回应。

Anthropic开发的Claude系列模型则以其强大的推理能力著称。它能够处理复杂的数学问题,进行深入的文学分析,并在处理长文本方面表现出色。例如,Claude能够阅读一份几十页的法律文件,准确提取关键信息,并对具体条款进行解释和比较。

在国内,百度、阿里巴巴等科技巨头也推出了各具特色的大语言模型。百度的文心一言展现出优秀的中文理解能力和创作才能,能够创作诗歌、撰写文案,并深入理解中国传统文化内容。阿里巴巴的通义千问则在科技知识领域和多轮对话方面表现突出,能够协助研究人员进行文献综述,帮助开发者调试代码。

然而,大语言模型的发展也面临一些挑战,提升事实准确性、消除偏见、保护隐私等问题仍需要进一步解决。研究人员正在探索各种方法来提高模型的可靠性,如增加知识库验证、改进训练数据的筛选等。未来,随着技术的不断进步,大语言模型有望在更多领域发挥重要作用,成为增强人类认知和创造力的得力助手。

1.1.6 医疗人工智能

医疗人工智能的发展历程充分展现了这个领域既有挑战又充满希望的特点。从IBM Watson到今天的各类专业医疗人工智能系统,我们见证了医疗人工智能技术从概念验证到实际应用的演进过程。早期的IBM Watson代表了认知计算在医疗领域的首次大规模尝试。尽管后来它与美国得克萨斯大学MD安德森癌症中心的合作最终因各种原因而终止,但这个项目为后来的医疗人工智能发展提供了宝贵经验。它让人们认识到,医疗人工智能不能仅依靠强大的计算能力,还需要深入理解医疗实践的特殊性,以及如何将AI技术与现有医疗流程有机结合。

在影像诊断领域,AI系统取得了令人瞩目的成就。目前,AI系统在X光片、CT、核磁共振等医学影像解读方面的表现已经可以达到或超越人类医生的水平。例如,腾讯觅影在食管癌早期检测方面的准确率已突破90%,依图医疗的AI系统则在肺结节识别方面提供了可靠的辅助诊断支持。这些成果不仅提高了诊断效率,也为医生提供了重要的决策参考。采用深度学习方法,可以通过视网膜图像对某些疾病进行检测,比如是否有心血管疾病、糖尿病性视网膜病变、黄斑变性等。这是一种新型的非侵入式检测手段,也是一种无损检测技术,比起传统的抽血检测,对检测对象的损伤更小。此外,AI系统还可以通过图像分析,预测采用哪些药物对症治疗效果会更好。

在药物研发方面,国内制药公司已经开始大规模应用AI技术。比如,恒瑞医药利用AI平台筛选新型药物分子,将传统需要2~3年的早期药物发现过程缩短到6个月左右。2024年年初,他们借助AI技术开发的新型抗癌药物已进入临床试验阶段。

远程医疗也因为AI技术变得更加智能和便捷。阿里健康推出的智能问诊系统已经能够理解患者的口语化描述,准确转化为标准医学术语,并提供初步诊断建议。在偏远地区,这类系统正在助力基层医生提供更专业的诊疗服务。例如,在云南省的一些乡镇卫生院,当地医生可以通过AI系统获得省医院专家的远程会诊支持。

在慢性病管理方面,越来越多的医院开始使用AI系统进行患者随访和监测。以上海某三甲医院为例,该院使用的智能随访系统能够根据患者的血糖记录、饮食习惯和运动数据,自动调整管理方案,并在发现异常时及时提醒医生干预。实践证明,这种方式显著提高了糖尿病患者的血糖达标率。

1.1.7 智能交通

在智能交通领域,比较常见的AI应用包括车道路线检测、交通标志检测、交通灯检测、障碍物识别、行人检测及无人自动驾驶等。

以谷歌旗下Waymo的无人驾驶汽车为例,在2020年年初,Waymo已经在公共道路上行驶了超过2000万英里(1英里≈1.6千米)。它通过摄像头、传感器、雷达系统等设备检测实时的道路情况及标志,用计算机来确定这辆汽车该以怎样的速度在什么道路上行驶。截至2024年年初,Waymo的无人驾驶出租车服务已经在菲尼克斯、旧金山等多个城市实现了常态化运营。乘客只需要通过手机应用预约,就能体验完全无人驾驶的出行服务。据统计,Waymo车队的安全行驶里程已超过3000万英里。

百度Apollo计划在国内也取得了显著进展。2023年年底,百度已在广州、北京等城市获得完全无人驾驶测试牌照。百度的Apollo Go Robotaxi(无人驾驶出租车)服务已经在多个城市投入商业运营,日均订单可达上千单。特斯拉则采用了不同的技术路线,依赖摄像头和AI视觉算法,而不是昂贵的激光雷达实现无人驾驶。虽然这种方案成本较低,但目前仍处于辅助驾驶阶段,需要驾驶员随时准备接管车辆。

除了乘用车,智能交通技术在公共交通领域也有着广泛应用。深圳已经开通了多条智能公交线路,这些公交车能够自动靠站、精确停靠,提高了运营效率和安全性。北京、上海等城市的地铁系统也采用了AI技术优化列车运行间隔,提高运力。交通管理部门正在推广智能信号灯系统。例如,杭州市采用的“城市大脑”系统能够根据实时交通流量自动调节信号灯配时。据统计,这一系统使主要路口的通行效率提升了15%以上。

1.1.8 机器人

不同功能的机器人在多个领域应用广泛,比如家庭服务、工业生产、医疗服务、专业服务等。

达·芬奇手术机器人是医疗服务机器人的代表。它采用微创手术方式,能实施复杂的外科手术,还具备良好的止血功能。该机器人的内窥镜可放大手术区域,助力医生精准操作,提高了手术的准确度和精度。

波士顿动力公司(Boston Dynamics)诞生于麻省理工学院,凭借在特种机器人和人形机器人领域的突破创新逐渐成长为业内最具影响力的机器人公司之一,其代表作品为Atlas双足机器人和BigDog四足机器狗。2020年6月,波士顿动力公司的Spot四足机器狗开始正式销售。

除了国外的机器人产品,我国机器人产业也展现出蓬勃的创新活力,尤其在四足机器人领域,宇树科技(Unitree Robotics)成为全球瞩目的领跑者。该公司推出的Unitree Go1作为全球首款消费级四足机器人,搭载自研高性能关节电机,其扭矩密度高达30 Nm/kg,大幅提升了机器人的动态性能。通过独创的动态平衡算法,Unitree Go1可实现8 km/h的高速奔跑与20 cm高度的连续跳跃,而多模态感知系统(融合激光雷达、深度相机和惯性测量单元)赋予它在复杂地形中的自主导航能力。在应用层面,上海浦东机场已部署Unitree Go1进行24小时航站楼巡逻安防任务;清华大学等30所高校将其引入足式机器人控制算法教学;在甘肃地震救援中,宇树科技Unitree B1工业级四足机器人深入废墟执行灾后探测任务,展现了卓越的环境适应性。

医疗机器人领域同样迎来国产化突破。微创医疗的图迈®手术机器人通过5G远程操作系统,成功在浙江大学医学院附属邵逸夫医院完成首例跨省远程胆囊切除手术;柏惠维康的睿米®神经外科手术机器人则以0.1 mm的定位精度,年均辅助完成超过3000例帕金森患者的脑深部电刺激术,显著提升了手术安全边界。

工业机器人集群创新方面,新松协作机器人的七轴柔性机械臂在蔚来汽车工厂实现车门精密焊接,误差小于0.02 mm,该人机协作模式使产线效率提升了40%;极智嘉(Geek+)物流机器人在菜鸟物流嘉兴仓的“双十一”高峰期间,调度500台自主移动机器人达成每小时12万件的分拣效率峰值,重构了物流仓储的作业流程。

服务机器人则加速渗透日常生活场景。云迹科技的酒店服务机器人已覆盖全国90%的五星级酒店,累计完成超1.2亿次物品配送,其多机调度系统支持单酒店20台机器人协同运行;普渡科技的“欢乐送”送餐机器人在海底捞餐厅实现传菜路径动态规划,降噪电机技术将工作噪声控制在45 dB以下,有效平衡了效率与用户体验。

1.2 人工智能发展概述

1.2.1 人工智能起源

人工智能一词源于1956年8月美国达特茅斯学院举办的一次夏季研讨会。1955年8月,“人工智能”这一概念在一份关于召开国际人工智能会议的提案中被首次提出。这份提案由东道主约翰·麦卡锡(John McCarthy)、哈佛大学的马文·明斯基(Marvin Minsky)、IBM的纳撒尼尔·罗切斯特(Nathaniel Rochester)、信息论的创始人克劳德·香农(Claude Shannon)联合递交。一年之后,在达特茅斯召开了第一次人工智能大会。这次会议被普遍认为是开辟了人工智能研究领域的历史性事件。因此,一般认为1956年是人工智能元年。

1.2.2 人工智能与图灵测试

人工智能是计算机科学的一个分支,它试图通过计算机程序或技术来模拟、延伸和扩展人类的智能行为。人工智能涉及感知环境、获取知识,并运用这些知识实现最佳结果的理论、方法、技术和应用系统。这一定义阐释了人工智能学科的核心理念和研究范畴,即构建围绕智能行为的人工系统。

人工智能的发展历程中,一个重要的理论分类是弱人工智能和强人工智能。这种分类主要基于AI系统是否具备真正的思维能力和自我意识。

1.弱人工智能

弱人工智能指的是只能在特定领域发挥作用的AI系统,它们虽然表现出类似智能的特征,但并不具备真正的理解力和思维能力。目前人们所见到的几乎所有AI应用都属于这一类,比如文心一言可以写文章、智谱AI可以解答问题、商汤科技的计算机视觉AI可以识别图像,但它们都只是在各自的专业领域发挥作用。

尽管这些AI系统在特定任务上可能超越人类表现,但本质上仍是按照预设程序运行的工具,无法像人类一样实现跨领域的灵活思考和创新。

2.强人工智能

强人工智能,也被称为通用人工智能(Artificial General Intelligence,AGI),是指具有与人类相当或超越人类的智能水平,能够处理各种复杂问题,并具有自我意识的AI系统。它又可以分为两种类型:类人型AI,即模仿人类思维方式的系统;非类人型AI,即采用与人类完全不同的思维模式的系统。目前,强人工智能仍然停留在理论阶段,其实现面临着巨大的技术挑战和伦理争议。

从现实来看,虽然我们在弱人工智能领域取得了显著进展,如百度的自动驾驶技术、阿里云的智能客服系统等,但要实现真正的强人工智能还有很长的路要走。这不仅需要技术的突破,还需要我们对人类智能本质的深入理解。在这个过程中,如何确保AI发展的安全性和可控性,如何平衡技术进步与伦理约束,都是人们需要认真思考的问题。

3.图灵测试

1936年,哲学家阿尔弗雷德·艾耶尔(Alfred Ayer)提出了一个令人深思的心灵哲学问题:我们怎么知道其他人曾有同样的体验?在《语言、真理与逻辑》中,艾耶尔提出了有意识的人类及无意识的机器之间的区别。

1950年,英国科学家艾伦·麦席森·图灵(Alan Mathison Turing)提出了著名的图灵测试。图灵测试指出,如果一台机器与人类展开对话(通过电传设备)而不能被辨别出其机器身份,那么就可以认为这台机器具有智能。这一简化使得图灵能够令人信服地说明“思考的机器”是可能的。图灵测试是人工智能哲学方面第一个严肃的提案。图灵提出的图灵机模型为现代计算机的逻辑工作方式奠定了基础。

1.2.3 人工智能发展史

1.第一次人工智能浪潮(1956—1974年):推理与搜索时代

在第一次人工智能浪潮中,人工智能主要实现了求解迷宫问题、人机博弈、小游戏、自动定理证明等功能。

1966年,美国政府发布《语言与机器》报告,指出人工智能技术存在瓶颈,短时间内难以实现大规模突破。1969年,马文·明斯基针对风靡一时的神经网络,进一步指出了它在特定条件下的局限性,即不能解决异或问题。人们逐渐意识到,原来当时的计算机智能只能解决所谓的“玩具问题”(Toy Problem)。人工智能领域的研究资金逐渐减少,学术界对这一领域的兴趣也随之降低。因此,20世纪70年代也迎来了人工智能的第一次“寒冬”。

2.第二次人工智能浪潮(1980—1995年):知识工程时代

在第二次人工智能浪潮中,主要实现的是人机对话。与第一次人工智能浪潮中利用推理和搜索等简单规则不同,在第二次人工智能浪潮中,人工智能依赖“知识”的支持。

第二次人工智能浪潮引入了“专家系统”这一概念,它依赖某个专业领域的知识,并通过推理来模拟专家的决策过程。

MYCIN系统是一个典型案例,它由斯坦福大学于20世纪70年代初开发,主要用于帮助医生诊断和治疗血液感染患者,能够在面对严重感染患者时,给出感染菌诊断及抗生素给药推荐。Dendral系统则是另一个典型案例。Dendral系统由爱德华·费根鲍姆(Edward Feigenbaum)于20世纪60年代开发,它能够帮助化学家判断未知物质的分子结构。

20世纪80年代,日本提出了“第五代计算机”计划,但是在第二次人工智能浪潮消退的时候,许多目标仍未实现。

知识导入使计算机变得更聪明,但知识描述之复杂与困难超出了当初的预想,知识的输入是无穷无尽的。因此,在1995年左右,人工智能再次进入“寒冬”。

3.第三次人工智能浪潮(2006—2021年):深度学习与大数据时代

第三次人工智能浪潮始于2006年,杰弗里·辛顿(Geoffrey Hinton)发表论文《一种深度置信网络的快速学习算法》,标志着深度学习时代的到来。深度学习的兴起实际上是在2010年前后,这一发展是建立在数十年研究积累的基础之上的。

互联网的迅猛发展使大数据成为现实,为深度学习的实现提供了良好的数据基础。从算力的角度来讲,不光是中央处理器(Central Processing Unit,CPU),图形处理器(Graphics Processing Unit,GPU)也可以做到很好的并行处理,这使得深度学习的训练速度更快。此外,计算机集群技术也为人工智能的算力提供了物理基础。同时,算法本身也取得了突破。深度学习的数据、算力和算法三者的结合使机器可以自己从原始数据中学习,从而促使第三次人工智能浪潮的来临。国内高科技企业,比如阿里、百度、腾讯、华为、科大讯飞、今日头条、海康威视、京东、滴滴等都建立了人工智能研究团队。国内很多高校也开始开设“人工智能”专业,2018年有35所高校首次申报开设“人工智能”新专业,而2019年这一数据为180所,且规模还在不断扩大。

4.第四次人工智能浪潮(2022年至今):大语言模型时代

2022年11月,OpenAI发布了ChatGPT,引发了全球范围内的轰动。这款聊天机器人展示出了前所未有的语言理解和生成能力,不仅能够进行日常对话,还能写诗、编程、回答专业问题。ChatGPT的成功带动了整个行业的发展,微软、谷歌、百度等科技巨头纷纷推出自己的大语言模型产品。非专业人士第一次真切感受到了AI的力量,比如学生用它来帮助学习和写作业,程序员用它来协助编程,作家用它来激发创作灵感。

在实际应用中,大语言模型技术正在深刻改变各行各业的工作方式。医生可以用它来辅助诊断和查阅医学文献,律师可以用它来协助撰写法律文书,设计师可以用它来生成创意图像。不过,大语言模型的应用也出现了一些问题,比如学生过度依赖AI完成作业、AI生成虚假信息,以及AI冲击就业市场。因此,各国政府和国际组织开始重视AI监管,比如中国发布了《生成式人工智能服务管理暂行办法》,欧盟推出了《人工智能法案》,试图在发展AI的同时防范风险。

1.3 机器学习

1.3.1 人工智能、机器学习与深度学习

20世纪50年代中期,人工智能开始兴起。20世纪80年代,人工智能的一个分支——机器学习开始繁荣。2010年左右,机器学习的一个分支——深度学习得到了极大的发展,把人工智能推向了新的高潮。

1.3.2 什么是机器学习

作为人工智能的一个分支,机器学习是实现人工智能的一个核心技术,即以机器学习为手段解决人工智能中的问题。

机器学习通过“自动学习”的算法,让计算机从数据中自动发现潜在规律,然后利用这些规律对新样本进行预测。

以形式化语言描述机器学习,就是对于某类任务T和性能度量P,如果一个计算机程序在T上以P衡量的性能随着经验E而自我完善,那么就称这个计算机程序从经验E中学习。

人类学习的过程是什么样的呢?这里举一个简单的例子:第一天,妈妈拿来一个苹果告诉小宝宝这是苹果,那么小宝宝就会对苹果有所认知;第二天,妈妈拿来一个不同样子的苹果,告诉小宝宝这个还是苹果,那么小宝宝就会对苹果有新的认知;这样反复多次,小宝宝就对苹果形成了自己的认知,可以判断什么样的东西是苹果。小宝宝能根据自己的经验总结出一个规律,然后利用这个规律对未见过的物品进行判别,这就完成了学习的过程。

在机器学习的过程中,不仅需要提供大量的训练数据,而且需要提供正确的结果标签,比如这个是香蕉,那个是苹果。经过这样的训练,机器就会生成一个模型。当获得新的数据时,机器就会根据模型预测该物品的未知属性。

人类学习和机器学习的过程十分类似。人类是通过各种各样的经验归纳出规律,当面对新问题时,通过头脑运作产生相应的结果。而机器学习是通过数据进行训练,从而生成一个模型,当有新的数据输入时,它会利用这个训练好的模型进行推理,得到的结果就是预测出的未知属性。

1.3.3 机器学习典型求解问题类型

机器学习可以分为监督学习、无监督学习、半监督学习和强化学习。

1.监督学习

监督学习通过提供包含输入及对应正确输出(标签)的训练数据,使机器学习模型能够准确预测或分类新的输入。

监督学习需要大量的训练数据,这些数据不仅是输入的数据,还需要正确的数据标签。

根据预测结果的特点,即标签是连续的数据还是离散的数据,监督学习可以分为两大类应用:预测和分类。

图1.2所示为每分钟虫鸣数与温度之间的关系,这个规律可以用一条直线来近似表示。机器学习所做的事情,就是确定这条直线的截距和斜率。机器学习可以根据所建立的模型,用每分钟虫鸣数来预测对应的温度。预测问题常见的算法有线性回归、梯度提升、自适应提升、神经网络算法等。

图1.2 每分钟虫鸣数和温度的关系

分类问题主要针对的是离散的数据。图1.3所示的数据点代表一家工厂加工的螺丝钉,它有重量和长度,这些坐标数据(螺丝钉)被分为两类:一类是,代表合格品;另一类是,代表残次品。它们被一条虚线明显地分隔开来。对于一颗新的螺丝钉(以三角形表示),可以根据它在坐标系中的位置判断它是否合格,这就是一个二分类的应用。分类问题常见的算法有逻辑回归、决策树、K近邻算法(K-Nearest Neighbors,KNN)、随机森林(Random Forest,RF)、支持向量机(Support Vector Machine,SVM)、朴素贝叶斯和神经网络算法等。

图1.3 螺丝钉分类

2.无监督学习

无监督学习的目的是让模型自主学习数据的内在规律与结构,这些训练数据只有特征,没有标签。

无监督学习的一个典型应用场景是聚类,即实现所谓的“物以类聚,人以群分”的效果。另一个典型应用场景是关联规则抽取。例如,超市运营商通过分析超市销售数据发现,啤酒和纸尿裤同时被购买的概率比较大,从而调整了货物的摆放,在啤酒边的货架上放上了纸尿裤,在卖纸尿裤的货架附近放上了啤酒,提高了两者的销量。

3.半监督学习

介于监督学习和无监督学习之间的是半监督学习。

半监督学习的训练数据中,一部分有标签,另一部分没有标签,没有标签数据的数量常常远大于有标签数据的数量。

半监督学习的基本规律是:训练数据的分布不是完全随机的,通过结合有标签数据的局部特征以及大量无标签数据的整体分布情况,得到比较好的分类结果。

4.强化学习

强化学习旨在解决计算机从感知到决策控制的问题,从而实现通用人工智能。

强化学习是以目标为导向的。它的训练从一张类似白纸的状态开始,经由多个步骤实现某一维度上的目标最大化。在训练过程中,AI需要不断地去尝试,错误就惩罚,正确就奖励,由此训练得到的模型在各个状态环境中都能表现得很好。

强化学习虽然没有标签,但有一个延迟奖励与训练相关,通过学习过程中的激励函数获得某种从状态到行动的映射。

强化学习强调如何基于环境而行动,以取得最大化的预期利益,一般适用于游戏、下棋等需要连续决策的领域。常见的强化学习算法包括Q-learning、SARSA、Deep Q Network等。

1.4 深度学习

深度学习是机器学习的一个分支,它利用多层人工神经网络来模拟人脑神经元活动,实现对复杂数据的自主学习和特征提取。下面将介绍深度学习的相关概念、主要算法及发展历程。

1.4.1 神经元

1904年,生物学家了解了神经元的组成结构。神经元通常由细胞体和突起(树突、轴突)组成,如图1.4所示。一个神经元通过多个树突接收信息,通过一个轴突传送信息。

图1.4 神经元的组成

1943年,心理学家沃伦·麦卡洛克(Warren McCulloch)和数学家沃尔特·皮茨(Walter Pitts)提出了一个神经元模型。如图1.5所示,该模型左侧有许多输入(类似于神经元的树突),这些输入经过加权求和(类似于神经元的细胞体),并通过激活函数(类似于神经元的轴突),最后得到一个输出。

图1.5 神经元模型

这个结构看起来非常简单,其实现的计算功能可以用式(1.1)来表示。

  (1.1)

式中,表示输入数据的第个特征值;表示输入数据的数量;表示偏置项;表示第个输入节点到加权求和计算节点的权重;表示激活函数;表示输出的计算结果。

表面上看,这种简单的神经元结构似乎无法完成复杂的工作。但是就像大脑一样,当亿万个这样简单的神经元结构组合到一起的时候,就会展现出惊人的能力,能够处理非常复杂的任务。如今在各大领域大放异彩的深度神经网络,其原型结构就是这种简单的神经元。

人们在研究生物体的神经细胞时发现,只有当神经元的兴奋程度超过了某个阈值时,神经元才会被激发而输出神经脉冲。在自然界,生物神经元的输出和输入并非简单的线性关系,而是呈现一种非线性特性。因此,人工神经网络在设计时,引入了激活函数(Activation Function),用于对前面计算得到的结果进行非线性处理,从而提升网络的表现力。

常见的激活函数包括Sigmoid、Tanh和ReLU等。

Sigmoid也被称为S型函数,其定义与图形表示如图1.6所示。Sigmoid函数把所有的值映射到0~1,形成一条S型的曲线。通过图1.6可以看到,当时,它的值为0.5;当趋于无穷大时,它的值无限接近于1;当趋于负无穷大时,它的值无限接近于0。

图1.6 Sigmoid函数的定义与图形表示

Tanh是双曲正切函数,其定义与图形表示如图1.7所示。它的图形和Sigmoid函数的图形很相似,主要区别在于Tanh的值域是从-1到1。

图1.7 Tanh函数的定义与图形表示

ReLU又被称为修正线性单元函数,其定义与图形表示如图1.8所示。这个函数比较简单,若x≥0,它的值为x本身;若x<0,它的值为0。ReLU的效果通常比Sigmoid好,而且计算难度非常低。

图1.8 ReLU函数的定义与图形表示

1.4.2 神经网络

如果把多个单一的神经元组合在一起,把这些神经元的输出作为另一些神经元的输入,就构成了神经网络。如果把这些神经元看作一个整体,那么这个结构就具有了输入和输出,通常把接收数据输入的层称为输入层(Input Layer),把最后输出结果的层称为输出层(Output Layer),把神经元组成的中间层称为隐含层或者隐藏层(Hidden Layer)。图1.9所示是一个双隐藏层的神经网络,其输入层有4个神经元,隐藏层1有5个神经元,隐藏层2有3个神经元,输出层有2个神经元。

图1.9 双隐藏层的神经网络示意图

在实际应用中,需要根据具体问题设计相应的神经网络。通常来说,输入层和输出层的神经元数量是固定的,而隐藏层需要几层,每一层需要多少个神经元是可以自由调整的。以手写字符识别为例,它的输入是一张黑白的手写数字图像,大小是28像素×28像素,即共有784个像素点,把这些像素点的值组成一个长度为784的向量作为输入,那么输入层共需要784个神经元(每个神经元对应1个像素点的值),而最终得到的结果是一个10分类问题,即可能的结果是数字0到9中的某一个,所以输出层的神经元个数为10个(每个神经元对应1个分类问题)。

接下来看看神经网络是怎样完成计算的。

如图1.10所示,输入层有3个特征节点x1、x2、x3,此外还有一个偏置节点(通常取值恒为1);隐藏层有3个激活节点a1、a2、a3,此外也有一个偏置节点;输出层有两个节点y1、y2。这是一个全连接网络,即每个节点都与上一层的所有节点相连。其中,输入层的偏置节点连接到隐藏层的每一个节点,隐藏层的偏置节点连接到输出层的每一个节点。偏置节点自身没有输入(或输入恒为1),仅提供可学习的偏移项,用于增强网络的拟合能力。

图1.10 神经网络计算示意图

以隐藏层中的节点的计算为例。与、和都相连,但这3个输入节点对的作用并不一定相同,所以、和分别对应不同的权重。这个权重由与上一层节点的连接边确定,表示为。因此可以得到式(1.2)。

  (1.2)

类似地,可以计算出输出层节点的结果。

1.4.3 深度神经网络

神经网络算法的核心是计算、连接、评估、纠错和训练,而深度神经网络的“深度”就在于通过不断增加隐藏层数量和神经元数量,让神经网络变得又宽又深,让系统运行大量数据来训练它。“深度”一词一般就是要求隐藏层很多(5层、10层、几百层甚至几千层)。

1.4.4 卷积神经网络

卷积神经网络是深度学习中最重要的概念之一。20世纪60年代,戴维·休伯尔(David Hubel)和托斯坦·维泽尔(Torsten Wiesel)在研究猫脑皮层中用于局部敏感和方向选择的神经元时发现,其独特的网络结构可以有效降低神经网络的复杂性。1998年,杨立昆(Yann LeCun)提出了LeNet-5神经网络,标志着第一个采用卷积思想的神经网络面世。但是这个神经网络在当时并未受到业界关注,因为它的计算量比较大,而当时的计算能力有限,也没有使用GPU,效果反而没有其他机器学习方法好,比如支持向量机。

LeNet神经网络结构如图1.11所示,其中包含卷积层和池化层,这些概念在后文中会详细讲解。

图1.11 LeNet神经网络结构

卷积神经网络最大的特点就是卷积和池化。图1.11所示的输入是32×32,图中的C1、C3、C5都是卷积层,卷积层中的卷积核会在输入图像的二维平面上移动,逐步提取新的空间特征。此外,网络中还包含两个池化层S2和S4,池化操作通过缩小特征图的尺寸,不仅可以降低模型的过拟合风险,还可以强化图像中的显著特征。最后,卷积神经网络通过全连接层和高斯连接层完成分类任务。整个网络结构相对复杂。

随着技术的不断发展,卷积神经网络技术在计算机视觉领域取得突破性进展,并出现了许多改进的网络模型,如AlexNet、VGGNet、GoogLeNet和ResNet等。这些模型在多个领域表现出色,推动了深度学习的广泛应用。

1.4.5 深度学习的发展历程

1943年,数学上的神经元模型被提出,这是神经网络发展的起点。

1958年,感知机模型被提出,该模型也是首个可以学习的人工神经网络,推动了神经网络研究的第一次浪潮。其实它只是一种最简单的单层神经网络,结构比较单一。

1969年,人工智能领域的权威学者马文·明斯基用数学公式证明了只有单层神经网络的感知机无法对异或逻辑进行分类,并指出要想解决异或可分问题,需要把单层神经网络扩展到两层或者以上。然而那个年代的计算机算力有限,无法支撑这种运算量。只有单层神经网络的感知机,暴露了它的天然缺陷,使得神经网络研究的发展进入了第一次“寒冬”。

1986年,杰弗里·辛顿等人推广了反向传播(Backpropagation,BP)算法,有效解决了两层神经网络的算力问题,引发了神经网络研究的第二次浪潮。

1995年,支持向量机诞生。支持向量机弥补了神经网络需要调节参数的不足,并解决了神经网络中局部最优的问题,从而一举击败神经网络,成为当时人工智能领域的主流算法,使得神经网络的发展进入了第二次“寒冬”。

1998年,卷积神经网络诞生,也就是LeNet,这是第一个卷积神经网络,为之后的深度学习打下了基础。

2006年,杰弗里·辛顿等人首次提出深度学习。他们基于深度置信网络(Deep Belief Network,DBN)提出非监督贪心逐层训练算法,为解决深层结构相关的优化难题带来了希望。随后,多层自动编码器的提出进一步简化了深度神经网络的训练过程。正是因为DBN克服了深度神经网络训练时的缺点,才使得神经网络重新焕发了生机。此外,杨立昆等人提出的卷积神经网络是第一个真正多层结构的深度学习算法,它利用空间相对关系减少参数数目以提高训练性能。

2012年,卷积神经网络在图像识别领域中的惊人表现,引发了神经网络研究的又一次浪潮。在ImageNet大规模视觉识别挑战赛中,AlexNet以显著优势夺冠,其成绩比2011年的冠军成绩高出10个百分点,体现了卷积神经网络在图像识别领域的卓越性能。到了2015年,卷积神经网络对图像的识别精度已经超过了人眼的识别能力。

2016年,AlphaGo战胜了围棋世界冠军,又掀起了新一轮的深度学习高潮。

深度学习的发展历程与人工智能的发展历程类似,也经历了几起几落。目前的深度学习仍存在一些问题,比如面向任务单一、依赖大规模有标签数据、几乎是个黑箱模型、可解释性不强等。不过,无监督深度学习、迁移学习、深度强化学习和贝叶斯深度学习等创新算法越来越受到关注,有望突破深度学习的瓶颈。尽管深度学习具有较强的可推广性和应用性,但未来的人工智能需要有更多类似的技术。

1.5 深度学习框架

深度学习是机器学习领域最热门的技术之一,深度学习框架发展十分迅速,业界提出了多种深度学习框架,每种框架都有着不同的特性。人工智能与科学的深度融合正在推动科研范式的创新,给科研领域带来了新的发展机遇。同时,“AI for Science”项目的发展也对深度学习框架提出了更高的要求。

2023年,Omdia发布的《中国人工智能框架市场调研报告》从深度学习框架使用者的角度出发,研究了主流深度学习框架的特点和能力,揭示了主流深度学习框架厂商为中国人工智能开发者提供的技术支持和社区服务,探讨了开发者选择偏好,以及开发者对开源软件、深度学习框架、横向应用、底层硬件、开发者社区和产业生态等方面的看法。

图1.12所示的深度学习框架排行榜展示了开发者选出的最适合“AI for Science”项目的深度学习框架排行。大多数开发者反馈,国外主流的深度学习框架TensorFlow对“AI for Science”项目的支持能力最强,认为中国的深度学习框架昇思(MindSpore)对“AI for Science”的支持能力超过了PyTorch,并有赶超TensorFlow的趋势。开发者的反馈充分肯定了昇思(MindSpore)在“AI for Science”项目中做出的努力和贡献。下面,我们将对图1.12中排名前三的深度学习框架分别进行介绍(介绍不分排名)。

图1.12 开发者选出的最适合“AI for Science”项目的深度学习框架排行榜(数据来源:Omdia)

1.5.1 MindSpore

MindSpore是华为开发的开源深度学习框架,支持端、边、云的多场景部署,以便于AI开发者进行数据预处理和训练推理。多功能平台MindSpore提供了数据标注、分布式训练及自动微分等功能,旨在简化深度学习开发过程,适用于计算机视觉和自然语言处理等领域。MindSpore总体架构如图1.13所示。

图1.13 MindSpore总体架构

MindSpore是一个全场景深度学习框架,旨在实现易开发、高效执行、全场景统一部署三大目标。如图1.13所示,在多领域扩展方面,MindSpore提供大语言模型套件、领域套件和AI4S套件,为用户提供开箱即用的模型与功能接口,以便用户基于套件的预置模型进行研发使用与参考实现。在开发态友好方面,表达层(MindExpression)为用户提供AI模型开发、训练、推理的接口,支持用户用原生Python语法开发和调试神经网络,其特有的动静表达统一能力使开发者可以兼顾开发效率和执行性能。同时,该层在生产和部署阶段提供全场景统一的C++/Python接口。

在运行效率方面,数据处理(MindSpore Data)提供高性能的数据加载、数据增强等功能。计算图构建(MindGraph)提供多种构图机制,支持基于Python AST的计算图翻译构建,也支持基于Python字节码的计算图构建。编译优化(MindCompiler)是静态图模式的关键模块,以全场景统一中间表达(MindIR)为媒介,将前端函数整体编译成执行效率更高的底层语言,同时进行全局性能优化,包括自动微分、代数简化等硬件无关优化,以及图算融合、算子生成等硬件相关优化。动态图直调是动态图模式的关键模块,基于统一的Python表达层接口,匹配Python的解释执行模式,进行逐接口的解释执行,反向执行过程中会复用统一的自动微分功能。

MindSpore提供全场景部署和多样性硬件。在全场景部署方面,运行时(MindRT)按照上层编译优化的结果对接并调用底层硬件算子,同时通过统一的端—边—云分布式架构的运行时,支持包括联邦学习在内的端—边—云AI协同。同时,MindSpore还提供面向轻量化推理的离线转换工具与轻量化推理引擎(MindSpore Lite),以及调试调优工具、MindSpore Armour等,以便用户按需选用。

1.5.2 PyTorch

在讲解PyTorch之前,有必要了解Torch。Torch是一个非主流的深度学习框架,基于20世纪90年代诞生于巴西的Lua开发。

Facebook的人工智能研究院采用的框架就是Torch。Torch的灵活度更高,非常适合卷积神经网络。且因为它采用命令式编程,所以支持动态图模型。

多数深度学习框架支持静态图模型,也就是说,需要先把模型定义好,才能进行运行计算。而Torch可以像交互式的命令一样,边定义、边运行,即在运行的过程中去定义图模型,因此支持动态图模型。

2017年年初,Facebook在Torch的基础上,用Python重构并推出全新的机器学习工具包PyTorch。PyTorch是Torch的Python版,增加了很多新的特性。2018年4月,Facebook宣布将Caffe2正式并入PyTorch。

PyTorch目前被广泛应用于学术界和工业界,在学术界的应用优势更明显,使用深度学习模型的文章大部分是基于PyTorch实现的。此外,PyTorch库足够简单,可与NumPy、Scipy等无缝连接,而且GPU加速能力非常出色。基于Pytorch,可以动态地设计网络,这种动态图机制在调试方面非常方便。基于上述优点,Pytorch迅速成为学术界主流的深度学习框架。

1.5.3 TensorFlow

TensorFlow是一个端到端开源机器学习平台。它拥有一个全面而灵活的生态系统,其中包含各种工具、库和社区资源,可助力研究人员推动先进机器学习技术的发展,并能够使开发者轻松地构建和部署由机器学习提供支持的应用。

TensorFlow不仅在上层支持神经网络,还全面支持其他机器学习算法,比如K-Means、决策树、支持向量机等。同时,它还支持多种语言,例如Python、C++、Java等。此外,在硬件层面,TensorFlow还支持CPU、GPU、张量处理单元(Tensor Processing Unit,TPU)、移动平台等多种硬件和平台。

TensorFlow提供了一个名为TensorBoard的可视化工具,该工具可以基于运行的日志文件可视化模型训练和结果。例如,该工具可将计算图的精度、损失率展现出来,以便用户对模型进行调优。

此外,TensorFlow还提供了不同层次的接口。低层的接口灵活、容易控制,高层的接口容易使用。为了方便初学者使用,它还提供了高层接口Keras,该接口上层是支持分布式训练的Estimator,顶层则是预设好的模型库,允许用户直接拿来使用。

TensorFlow支持多种开发语言,除了Python、C++、Java等,还支持Go、R、Julia、C#、Swift、JS等。

TensorFlow.js可以直接利用JavaScript在网页上进行机器学习的训练和使用。

TensorFlow Lite可将在个人计算机或者服务器上训练好的TensorFlow模型转换为TensorFlow Lite格式,从而支持移动端部署,例如安卓、iOS、树莓派等平台,使得移动的人工智能变为现实。

练习与思考

1.生活中有哪些物品让你感觉人工智能进入了你的生活?

2.强人工智能和弱人工智能的主要区别是什么?

3.分析并总结人类学习过程和机器学习过程的异同点。

4.监督学习和无监督学习的主要区别是什么?

5.在网上查阅最新的深度学习框架排行榜,并比较各种框架的优缺点。

6.在网上查阅资料,进一步了解ImageNet大规模视觉识别挑战赛,简述最近一次比赛的冠军团队采用了什么技术?效果如何?

7.人工智能技术是否存在滥用问题?应该怎样进行负责任的人工智能应用?

相关图书

SDD实战:规范驱动开发之道
SDD实战:规范驱动开发之道
Agent Skills开发实战像搭积木一样构建智能体
Agent Skills开发实战像搭积木一样构建智能体
Harness工程实战:从零开始驾驭AI软件工程
Harness工程实战:从零开始驾驭AI软件工程
Codex快速入门:Harness工程落地
Codex快速入门:Harness工程落地
Agent设计模式 图解可复用智能体架构
Agent设计模式 图解可复用智能体架构
构建之法——现代软件工程(第四版)
构建之法——现代软件工程(第四版)

相关文章

相关课程