引言

在 STM32F4 系列(如 STM32F407)上,Cortex-M4 内核集成了可选的 L1-Cache(ART 加速器实际是 Flash 缓存,但 SRAM 区域默认无 Cache,除非使用外部 SDRAM 或开启 D-Cache)。然而,很多开发者在使用 DMA 时,会忽略 Cache 与 DMA 之间的数据一致性风险,尤其在双缓冲(Double Buffer)模式下,数据错乱、性能下降甚至系统崩溃的陷阱层出不穷。本文将从原理出发,剖析陷阱根源,并给出基于 CMSIS 的完整规避方案。

1. 原理:Cache 与 DMA 的交互

STM32F4 的 Cortex-M4 内核支持可选的 D-Cache(数据缓存)和 I-Cache(指令缓存),但默认在内部 SRAM 上不启用(因为 SRAM 访问延迟低)。当使用外部存储器(如 SDRAM)或开启 D-Cache 时,CPU 读写内存会先经过 Cache,而 DMA 是直接访问内存(外设到内存或内存到内存),不经过 Cache。

  • DMA 写入内存:DMA 将数据从外设搬运到内存,但 Cache 中可能存有旧数据(脏数据),CPU 读取时可能命中 Cache,得到旧值。
  • DMA 读取内存:CPU 先写数据到内存(可能只更新了 Cache),DMA 直接读取物理内存,可能读到未更新的数据。

因此,必须通过软件维护 Cache 的一致性:

  • Clean(清理):将 Cache 中修改的数据写回内存,使内存与 Cache 一致。
  • Invalidate(失效):使 Cache 行失效,下次读取时从内存重新加载。

2. 双缓冲设计的典型陷阱

双缓冲(Ping-Pong)模式是 DMA 常用的一种高效传输方式,两个缓冲区交替使用,一个用于 DMA 写入,另一个供 CPU 处理。但在 Cache 存在时,以下陷阱极易出现:

陷阱 1:伪共享(False Sharing)

当两个缓冲区在内存中相邻,且共享同一个 Cache Line(通常 32 字节)时,CPU 对 Buffer A 的修改会导致 Buffer B 所在的 Cache Line 被标记为脏,DMA 写入 Buffer B 时,Cache 中的脏数据可能被意外写回,覆盖 DMA 新数据。

规避:确保每个缓冲区按 Cache Line 大小对齐(如 32 字节),并隔离填充。

陷阱 2:脏数据覆盖(Dirty Data Overwrite)

CPU 处理完 Buffer A 后,修改了其中部分数据(写入 Cache),但未 Clean 就切换 DMA 到 Buffer A 写入新数据,DMA 直接写内存,而 Cache 中的脏数据在后续 Invalidate 时被丢弃,导致 CPU 的修改丢失。

规避:在 DMA 开始写入前,必须对目标缓冲区执行 Clean(若 CPU 有修改)或 Invalidate(若 CPU 只读)。

陷阱 3:缓冲切换竞态(Race Condition)

在双缓冲切换时,如果 CPU 在 DMA 还在写当前缓冲区时就切换指针,可能导致 DMA 写入一半的数据被 CPU 读取,造成数据撕裂。

规避:使用 DMA 传输完成中断,在中断中切换缓冲区,并确保切换操作与 Cache 维护顺序正确。

3. 配置步骤与代码实现

以下以 STM32F407 + 外部 SDRAM(启用 D-Cache)为例,演示双缓冲 DMA 的正确设计。

3.1 内存属性配置

在系统初始化时,将 SDRAM 区域配置为 Cacheable(可缓存)或 Non-cacheable。推荐将 DMA 缓冲区放在 Non-cacheable 区域,但若必须使用 Cacheable,则需手动维护。这里我们采用 Cacheable 并手动维护。

// 缓冲区定义,按 32 字节对齐
#define BUFFER_SIZE 1024
#define CACHE_LINE_SIZE 32
__attribute__((aligned(CACHE_LINE_SIZE))) uint8_t buffer_a[BUFFER_SIZE];
__attribute__((aligned(CACHE_LINE_SIZE))) uint8_t buffer_b[BUFFER_SIZE];

// 使能 D-Cache(在 SystemInit 后调用)
SCB_EnableDCache();

3.2 DMA 双缓冲配置

使用 STM32F4 的 DMA2 流 0,配置为双缓冲模式,从 ADC 或 UART 接收数据。

void DMA_Config(void) {
    // 使能 DMA2 时钟
    RCC_AHB1PeriphClockCmd(RCC_AHB1Periph_DMA2, ENABLE);
    
    DMA_InitTypeDef DMA_InitStruct;
    DMA_StructInit(&DMA_InitStruct);
    DMA_InitStruct.DMA_Channel = DMA_Channel_0;
    DMA_InitStruct.DMA_PeripheralBaseAddr = (uint32_t)&ADC1->DR;
    DMA_InitStruct.DMA_Memory0BaseAddr = (uint32_t)buffer_a;
    DMA_InitStruct.DMA_DIR = DMA_DIR_PeripheralToMemory;
    DMA_InitStruct.DMA_BufferSize = BUFFER_SIZE;
    DMA_InitStruct.DMA_PeripheralInc = DMA_PeripheralInc_Disable;
    DMA_InitStruct.DMA_MemoryInc = DMA_MemoryInc_Enable;
    DMA_InitStruct.DMA_PeripheralDataSize = DMA_PeripheralDataSize_HalfWord;
    DMA_InitStruct.DMA_MemoryDataSize = DMA_MemoryDataSize_HalfWord;
    DMA_InitStruct.DMA_Mode = DMA_Mode_Circular;
    DMA_InitStruct.DMA_Priority = DMA_Priority_High;
    DMA_InitStruct.DMA_FIFOMode = DMA_FIFOMode_Disable;
    DMA_InitStruct.DMA_MemoryBurst = DMA_MemoryBurst_Single;
    DMA_InitStruct.DMA_PeripheralBurst = DMA_PeripheralBurst_Single;
    DMA_Init(DMA2_Stream0, &DMA_InitStruct);
    
    // 配置双缓冲
    DMA_DoubleBufferModeConfig(DMA2_Stream0, (uint32_t)buffer_b, DMA_Memory_1);
    DMA_DoubleBufferModeCmd(DMA2_Stream0, ENABLE);
    
    // 使能传输完成中断
    DMA_ITConfig(DMA2_Stream0, DMA_IT_TC, ENABLE);
    
    // 使能 DMA 流
    DMA_Cmd(DMA2_Stream0, ENABLE);
}

3.3 Cache 维护操作

在 DMA 传输完成中断中,根据当前使用的缓冲区(通过 DMA_GetCurrentMemoryTarget 获取),执行 Invalidate 操作,使 CPU 能读到最新数据。注意:在 DMA 开始写入前,如果 CPU 曾修改过该缓冲区,需要先 Clean。

void DMA2_Stream0_IRQHandler(void) {
    if (DMA_GetITStatus(DMA2_Stream0, DMA_IT_TC)) {
        DMA_ClearITPendingBit(DMA2_Stream0, DMA_IT_TC);
        
        // 获取当前 DMA 正在使用的缓冲区(另一块是 CPU 可用的)
        uint32_t current_target = DMA_GetCurrentMemoryTarget(DMA2_Stream0);
        uint8_t *active_buf = (current_target == DMA_Memory_0) ? buffer_b : buffer_a;
        
        // 使 active_buf 的 Cache 失效,确保 CPU 读取时从内存加载最新 DMA 数据
        SCB_InvalidateDCache_by_Addr((uint32_t*)active_buf, BUFFER_SIZE);
        
        // 处理数据(例如打印或计算)
        ProcessBuffer(active_buf, BUFFER_SIZE);
        
        // 如果 CPU 修改了 active_buf,在下次 DMA 写入前需要 Clean
        // 但这里我们只读,所以无需 Clean。若需修改,则调用 SCB_CleanDCache_by_Addr。
    }
}

注意:SCB_InvalidateDCache_by_Addr 要求地址按 32 字节对齐,且长度最好为 32 的倍数,否则需手动处理边界。

3.4 完整示例:UART 接收双缓冲

以下是一个完整的 UART DMA 双缓冲接收示例,包含初始化、中断处理和主循环。

// 全局变量
volatile uint8_t data_ready = 0;
uint8_t *current_buf;

void UART_DMA_Init(void) {
    // 使能 GPIOA、USART1、DMA2 时钟
    RCC_AHB1PeriphClockCmd(RCC_AHB1Periph_GPIOA | RCC_AHB1Periph_DMA2, ENABLE);
    RCC_APB2PeriphClockCmd(RCC_APB2Periph_USART1, ENABLE);
    
    // GPIO 配置:TX=PA9, RX=PA10
    GPIO_InitTypeDef GPIO_InitStruct;
    GPIO_InitStruct.GPIO_Pin = GPIO_Pin_9 | GPIO_Pin_10;
    GPIO_InitStruct.GPIO_Mode = GPIO_Mode_AF;
    GPIO_InitStruct.GPIO_Speed = GPIO_Speed_50MHz;
    GPIO_InitStruct.GPIO_OType = GPIO_OType_PP;
    GPIO_InitStruct.GPIO_PuPd = GPIO_PuPd_UP;
    GPIO_Init(GPIOA, &GPIO_InitStruct);
    GPIO_PinAFConfig(GPIOA, GPIO_PinSource9, GPIO_AF_USART1);
    GPIO_PinAFConfig(GPIOA, GPIO_PinSource10, GPIO_AF_USART1);
    
    // USART1 配置:115200, 8N1
    USART_InitTypeDef USART_InitStruct;
    USART_InitStruct.USART_BaudRate = 115200;
    USART_InitStruct.USART_WordLength = USART_WordLength_8b;
    USART_InitStruct.USART_StopBits = USART_StopBits_1;
    USART_InitStruct.USART_Parity = USART_Parity_No;
    USART_InitStruct.USART_HardwareFlowControl = USART_HardwareFlowControl_None;
    USART_InitStruct.USART_Mode = USART_Mode_RX | USART_Mode_TX;
    USART_Init(USART1, &USART_InitStruct);
    
    // DMA 配置:流 2,通道 4(USART1_RX)
    DMA_InitTypeDef DMA_InitStruct;
    DMA_StructInit(&DMA_InitStruct);
    DMA_InitStruct.DMA_Channel = DMA_Channel_4;
    DMA_InitStruct.DMA_PeripheralBaseAddr = (uint32_t)&USART1->DR;
    DMA_InitStruct.DMA_Memory0BaseAddr = (uint32_t)buffer_a;
    DMA_InitStruct.DMA_DIR = DMA_DIR_PeripheralToMemory;
    DMA_InitStruct.DMA_BufferSize = BUFFER_SIZE;
    DMA_InitStruct.DMA_PeripheralInc = DMA_PeripheralInc_Disable;
    DMA_InitStruct.DMA_MemoryInc = DMA_MemoryInc_Enable;
    DMA_InitStruct.DMA_PeripheralDataSize = DMA_PeripheralDataSize_Byte;
    DMA_InitStruct.DMA_MemoryDataSize = DMA_MemoryDataSize_Byte;
    DMA_InitStruct.DMA_Mode = DMA_Mode_Circular;
    DMA_InitStruct.DMA_Priority = DMA_Priority_High;
    DMA_InitStruct.DMA_FIFOMode = DMA_FIFOMode_Disable;
    DMA_InitStruct.DMA_MemoryBurst = DMA_MemoryBurst_Single;
    DMA_InitStruct.DMA_PeripheralBurst = DMA_PeripheralBurst_Single;
    DMA_Init(DMA2_Stream2, &DMA_InitStruct);
    
    // 双缓冲配置
    DMA_DoubleBufferModeConfig(DMA2_Stream2, (uint32_t)buffer_b, DMA_Memory_1);
    DMA_DoubleBufferModeCmd(DMA2_Stream2, ENABLE);
    
    // 中断配置
    DMA_ITConfig(DMA2_Stream2, DMA_IT_TC, ENABLE);
    NVIC_InitTypeDef NVIC_InitStruct;
    NVIC_InitStruct.NVIC_IRQChannel = DMA2_Stream2_IRQn;
    NVIC_InitStruct.NVIC_IRQChannelPreemptionPriority = 0;
    NVIC_InitStruct.NVIC_IRQChannelSubPriority = 0;
    NVIC_InitStruct.NVIC_IRQChannelCmd = ENABLE;
    NVIC_Init(&NVIC_InitStruct);
    
    // 使能 DMA 和 USART
    DMA_Cmd(DMA2_Stream2, ENABLE);
    USART_DMACmd(USART1, USART_DMAReq_RX, ENABLE);
    USART_Cmd(USART1, ENABLE);
}

void DMA2_Stream2_IRQHandler(void) {
    if (DMA_GetITStatus(DMA2_Stream2, DMA_IT_TC)) {
        DMA_ClearITPendingBit(DMA2_Stream2, DMA_IT_TC);
        
        // 获取当前 DMA 使用的缓冲区(另一块是 CPU 可用的)
        uint32_t current_target = DMA_GetCurrentMemoryTarget(DMA2_Stream2);
        current_buf = (current_target == DMA_Memory_0) ? buffer_b : buffer_a;
        
        // Invalidate Cache,确保读取最新数据
        SCB_InvalidateDCache_by_Addr((uint32_t*)current_buf, BUFFER_SIZE);
        
        data_ready = 1;  // 通知主循环处理
    }
}

int main(void) {
    // 系统初始化(时钟、GPIO等)
    SystemInit();
    SCB_EnableDCache();  // 使能 D-Cache(假设外部 SDRAM 已初始化)
    
    UART_DMA_Init();
    
    while (1) {
        if (data_ready) {
            data_ready = 0;
            // 处理 current_buf 中的数据
            ProcessData(current_buf, BUFFER_SIZE);
            // 如果修改了数据,需要 Clean 后再允许 DMA 使用
            // SCB_CleanDCache_by_Addr((uint32_t*)current_buf, BUFFER_SIZE);
        }
    }
}

4. 注意事项与最佳实践

  • 缓冲区对齐:务必按 Cache Line 大小(STM32F4 为 32 字节)对齐,避免伪共享。可使用 __attribute__((aligned(32))) 或 CMSIS 的 ALIGN_32BYTES
  • Cache 操作范围SCB_InvalidateDCache_by_AddrSCB_CleanDCache_by_Addr 的地址必须 32 字节对齐,长度最好为 32 的倍数,否则需手动处理首尾未对齐部分。
  • 操作顺序:在 DMA 写入前,若 CPU 修改过缓冲区,必须 Clean;在 DMA 写入后,CPU 读取前,必须 Invalidate。顺序不可颠倒。
  • 中断优先级:DMA 中断优先级应高于可能访问缓冲区的其他中断,避免竞态。
  • 性能考量:频繁的 Cache 操作会降低性能,可考虑将 DMA 缓冲区放在 Non-cacheable 区域(如使用 MPU 配置),但需权衡访问速度。
  • 调试技巧:使用逻辑分析仪或断点观察缓冲区内容,确认数据一致性。

结语

STM32F4 的 DMA 双缓冲设计在启用 Cache 时,必须将一致性维护作为核心环节。通过理解 Cache 与 DMA 的交互机制,遵循对齐、Clean/Invalidate 的正确顺序,并妥善处理切换竞态,可以彻底规避数据错乱和性能陷阱。希望本文的剖析与代码示例能帮助你在实际项目中构建稳定高效的 DMA 系统。