diff --git a/src/conv_kernels.cu b/src/conv_kernels.cu index d244300..7bde8b0 100644 --- a/src/conv_kernels.cu +++ b/src/conv_kernels.cu @@ -202,6 +202,8 @@ void conv2d_variant3(const float* input, const float* kernel, float* output, // - Degree of overlap visible on the NSYS timeline (copies concurrent with kernels). // - Any change in kernel performance (avoid starving compute with too many small chunks). // +// NOTE: const float* input, const float* kernel are host pointers in this task +// // ============================================================================= diff --git a/src/main.cu b/src/main.cu index 0a4f6c1..97cbb54 100644 --- a/src/main.cu +++ b/src/main.cu @@ -157,7 +157,7 @@ int main(int argc, char** argv) { conv2d_variant3(device_input, device_kernel, device_output, batch_size, height, width, kernel_size, stream); } else if (impl_name == "variant4") { - conv2d_variant4(device_input, device_kernel, device_output, + conv2d_variant4(host_images.data(), host_kernel.data(), device_output, batch_size, height, width, kernel_size, stream); } else { std::fprintf(stderr, "Unknown implementation: %s\n", impl_name.c_str());