教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 高等教育 >

计算机组成原理(下) - 图文(11)

来源:网络收集 时间:2026-08-24
导读: 【解】(1)设总指令数为 m,并行指令数为 m(P) ,顺序指令数为m(S) ,则总执行时间T为 T=m(P)/nx+m(S)/x=mF/nx+m(1-F)/x 有效 MIPS表达式为 MIPS=m/T=m/(mF/nx)+(m(1-F)/x=m/(mF=nm-nmF)/nx=nx/n(1-F)=F (2)在上式中代

【解】(1)设总指令数为 m,并行指令数为 m(P) ,顺序指令数为m(S) ,则总执行时间T为

T=m(P)/nx+m(S)/x=mF/nx+m(1-F)/x 有效 MIPS表达式为

MIPS=m/T=m/(mF/nx)+(m(1-F)/x=m/(mF=nm-nmF)/nx=nx/n(1-F)=F (2)在上式中代入已知条件: 求得 F=o· 9o=90%。

8.某同构多核处理机由 C。到 Cm-1共 m个处理机核组成,采用总线共享 cache结构连接在同一条总线上。在某个给定的时间段里,任何一个处理机核使用总线的概率都是P。请分别求出总线空闲、只有一个核请求总线和多于一个核请求总线三种情况出现的概率。

【解】某一个处理机核提出总线请求的概率是.p ,故其不发出总线请求的概率是1 -P 。 因此,所有处理机核均不提出总线请求的概率是( 1-p)^m ,即总线空闲的概率为( 1 -P)^m 。 类似地,处理机核 C。提出总线请求的概率是 p,处理机核 C1到 Cm-1 ,均不发出总线请求的概率是(1—P)^m- 1 。 故处理机核 Co提出总线请求而处理机核 C1到 Cm-1均不发出总线请求的概率是 p ( 1 -P)^m-1 。 由于各个核使用总线的概率是相等的,所以只有一个核请求总线的概率为 m p(1-p)^m-1 。由于总线被使用的情况必定是总线空闲、只有一个核请求总线或多于一个核请求总线三种情况之一,故多于一个核请求总线的概率为1- (1 -P)^m-mP(1 -P)^m-1

9. 假设某同构多核处理机有 n个处理机核,各个核通过共享总线方式访问共享主存存取数据,且各个处理机核均配备私有的指令存储器空间 。 若平均每四条指令中有一条指令需要访问共享数据存储空间,且访存时在整个指令周期中都占用总线 。 ( 1 ) 若 n =32 ,该处理机比单核处理机运行速度快多少? (2 ) 若 n= 64 ,该处理机比单核处理机运行速度快多少?

【解】(1)由于32个核共享总线,故在32个指令执行时间内平均每个核将获得一次访问数据存储空间的机会,而每访问一次数据存储空间将可以执行4条指令。 故在32个指令执行时间内可执行32X4=128条指令。 .

而单核处理机在32个指令执行时间内可执行32条指令。故32核处理机与单核处理机相比,速度仅提高128/32=4倍。 (2) 由于64个核共享总线,故在64个指令执行时间内平均每个核将获得一次访问数据存储空间的机会,而每访问一次数据存储空间将可以执行4条指令。 故在64个指令执行时问内可执行64 X4=256条指令。

而单核处理机在64个指令执行时间内可执行64条指令。故64核处理机与单核处理机相比,速度仅提高256/64=4倍。

10. 如果一台 SIMD计算机和一台流水处理机具有相同的计算性能,对构成它们的主要部件分别有什么要求?

【解】一台具有 n个处理单元的 SIMD计算机与一台具有一条 n级流水线并且时钟周期为前者1/n的流水处理机的计算性能相当,两者均是每个时钟周期产生 n个计算结果 。

但是,SIMD计算机需要数量为流水处理机 n倍的硬件部件(即 n个处理单元) ,而流水处理机中流水线部件的时钟速率要求比 SIMD计算机快 n倍,同时还需要存储器的带宽也是 SIMD计算机的 n倍。

l1. 某程序完成标量运算,原来在英特尔至强处理机上运行 。 如果在该机中增加至强融核扩展卡并将该程序移至卡上运行,程序运行时间是否能大幅度缩短? 为什么? 【解】程序运行时问不会大幅度缩短。

因为英特尔集成众核架构适合 SIMD结构, 但在执行标量代码时每个核相对较慢 。

只有运行存在大量规则数据并行的应用程序时,英特尔集成众核才能达到最优性能。而标量运算程序在集成众核上运行并不会发挥硬件的并行优势。 l2. 多处理机系统和多计算机系统的差别是什么?

【解】多处理机系统和多计算机系统都属于多机系统,但多处理机系统和多计算机系统的差别是:

( 1 ) 多处理机是多台处理机组成的单机系统,多计算机是多台独立的计算机 。

(2) 多处理机中各处理机逻辑上受统一的操作系统控制,而多计算机的操作系统逻辑上是独立的。

(3) 多处理机问以单一数据、向量、数组和文件交互作用,多计算机经通道或者通信线路以数据流的方式进行交互 。

(4) 多处理机作业、任务、指令、数据各级并行,多计算机多个作业并行 。 13. Amdahl定律给出了加快某部件执行速度所获得的系统性能加速比 Sp的公式:

Sp=To/Tn=1/(1-Fe)+Fe/Se 式中, To为改进前整个任务的执行时间; Tn为改进后整个任务的执行时间;Fe为计算机执行某个任务的总时问中可被改进部分的时间所占的百分比; Se为可改进部分采用改进措施后比没有采用改进措施前性能提高的倍数 。 请问:

(1)参数 Fe、Se、(1-Fe)和 Sp的数值大小如何理解? (2) 假设系统某一部件的处理速度加快到原e的 9 倍,但该部件的原处理时间仅为整个运行时间的45 % ,问采用加快措施后能使整个系统的性能提高多少?

【解】(1) Fe小于1, Se大于1, (1-Fe)表示不可改进部分,总是小于1。 当Fe=0,即没有改进部分时,Sp=1.

当 Fe≠0,即有改进部分时,Sp>1。当Se→∞时,Sp= 1/(1-Fe)。 (2)根据题意,Fe=0.45,Se=9,代入公式得

Sp=1/(1-Fe)+Fe/Se=1/(1-0.45)+0.45/9≈1.56

14.假设使用1oo台多处理机系统获得加速比为8o,求原计算程序中串行部分所占的比例是多少?

【解】设加速比为 Sp ,可加速部分比例为 Fe,理论加速比为 Se。根据 Amdahl定律,有 Sp=1/(1-Fe)+Fe/Se

为简单化,假设程序只在两种模式下运行:①使用所有处理机的并行模式;②只用一个处理机的串行模式 。 假设并行模式下的理论加速比 Se即为多处理机的台数,加速部分的比例 Fe即并行部分所占的比例、,代入上式,有

80=1/(1-Fe)+Fe/100 求得并行比例 Fe=0. 9975=99. 75%,串行比例1-Fe=0. 25%。

15.在某细粒度多线程处理机中,如果一条指令访存时在 L1 cache中缺失,但在 L2

cache中命中,总共要消耗 n个周期。如果采用多线程隐藏 L1 cache的缺失,那么需要立 即运行多少个线程才能避免出现死周期?

【解】如果处理 L1 cache缺失需要消耗 n个周期,则至少需要立即运行 n个线程,占用

n个周期。 在 n个周期之后,被阻塞的线程能够获取 L2 cache中的访存数据并将继续运行。 16.某异构多核处理机由 Core0 、Core1、Core2、Core3四个核组成,四个核各自完成一次平方运算所需的时间分别为 T、T/2、T/3和 T。 现需计算一个256个整数的数组的每个整数的平方值,分别按以下两种方案分配计算任务:

方案1 :Core0计算32个整数,Core1计算128个整数,,Core2计算64个整数、Core3计算32个整数;

方案2:Core0计算48个整数,Core1计算128个整数,Core2计算80个整数、Core3执 行其他任务(不参与计算) 。 忽略访存延迟的影响 。

( 1 ) 求两种方案下完成任务所需的时间 。

(2 ) 若定义各个处理机核不空闲的时间总和与各个处理机核总执行时间总和之比为 处理机的利用率,求该处理机执行以上任务时的利用率 。

【解】( 1 ) 完成任务所需的时间为各个核运行时间的最大值 。 方案1完成任务所需的时问为

max(32X T, 128X …… 此处隐藏:3764字,全部文档内容请下载后查看。喜欢就下载吧 ……

计算机组成原理(下) - 图文(11).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/606509.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)