Aashutosh A V

My Research

I've co-authored 4 research papers across computer vision, generative AI, vision-language learning, and large-scale ML systems.

I have 1 U.S. patent filing from my work on NoSQL workload forecasting and resource-aware placement optimization for distributed database systems.

Papers

SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking

WACV 2027 (Core A), Under Review

Relation-aware VLM with disentangled encoders and EMA-based intra-modal knowledge distillation for compositional scene understanding on the SCLARO Dataset.

Analyzing and Optimizing NoSQL Workloads for Cosmos DB

PVLDB Vol. 19 / VLDB 2026 (Core A*)

Characterization of NoSQL workload dynamics, tail-error prediction, and replica placement optimization across 100,000+ Azure Cosmos DB nodes.

Narrating For You: Audio-visual Narrating Face Generation

WACV 2026 (Core A)

Multi-entangled latent space for synchronized audio-video talking face generation from text prompts, voice profiles, and a single static identity image.

Latent Flow Diffusion for Deepfake Video Generation

CVPR 2024 Workshop

Three-stage deepfake generation pipeline combining latent optical flow prediction, dual Vision Transformer encoding, and flow-conditioned diffusion.

Patents

Workload Distribution Based on Projected Error Counts

Error-projection scheme that preemptively redistributes NoSQL workloads using forecasted error counts, helping prevent QoS violations across distributed database clusters.

Application ID: 505804-US01
Filed: July 2025
Office: U.S. Patent and Trademark Office