SOTAVerified

Prompt Engineering

Prompt engineering is the process of designing and refining the prompts used to generate text from language models, such as GPT-3 or similar models. The goal of prompt engineering is to improve the quality and relevance of the generated text by carefully crafting the prompts to elicit the desired responses from the model.

Prompt engineering involves several steps, including selecting the appropriate model architecture and parameters, designing the prompt format and structure, selecting the appropriate task and training data, and fine-tuning the model using the selected prompt and data.

Prompt engineering is a crucial step in the development of language models, as it can greatly influence the quality and effectiveness of the model's responses. By carefully designing and refining the prompts used to generate text, researchers and developers can improve the accuracy and relevance of the model's output, making it more useful for a wide range of applications, including chatbots, language translation, content creation, and more.

Papers

Showing 351–400 of 1236 papers

TitleStatusHype
Safer Prompts: Reducing IP Risk in Visual Generative AI—0
Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition—0
Evaluating Contrastive Feedback for Effective User SimulationsCode0
PhytoSynth: Leveraging Multi-modal Generative Models for Crop Disease Data Generation with Novel Benchmarking and Prompt Engineering Approach—0
Towards Artificial Intelligence Research Assistant for Expert-Involved LearningCode0
Enhancing tutoring systems by leveraging tailored promptings and domain knowledge with Large Language Models—0
Ensuring Reproducibility in Generative AI Systems for General Use Cases: A Framework for Regression Testing and Open DatasetsCode0
Understanding LLM Scientific Reasoning through Promptings and Model's Explanation on the Answers—0
Black-Box Visual Prompt Engineering for Mitigating Object Hallucination in Large Vision Language Models—0
Why Compress What You Can Generate? When GPT-4o Generation Ushers in Image Compression Fields—0
A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning—0
SecRepoBench: Benchmarking LLMs for Secure Code Generation in Real-World Repositories—0
Beyond One-Size-Fits-All: Inversion Learning for Highly Effective NLG Evaluation Prompts—0
LLM-Enabled EV Charging Stations Recommendation—0
Improving Phishing Email Detection Performance of Small Large Language Models—0
Local Prompt Optimization—0
Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward ModelsCode0
Generative AI in Education: Student Skills and Lecturer Roles—0
A Review of 3D Object Detection with Vision-Language Models—0
MODP: Multi Objective Directional Prompting—0
Reflexive Prompt Engineering: A Framework for Responsible Prompt Engineering and Interaction Design—0
What's the Difference? Supporting Users in Identifying the Effects of Prompt and Model Changes Through Token PatternsCode0
PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines—0
Diverse Prompts: Illuminating the Prompt Space of Large Language Models with MAP-Elites—0
Do Prompt Patterns Affect Code Quality? A First Empirical Assessment of ChatGPT-Generated Code—0
Aspect-Based Summarization with Self-Aspect Retrieval Enhanced Generation—0
Post-Hurricane Debris Segmentation Using Fine-Tuned Foundational Vision Models—0
Can GPT tell us why these images are synthesized? Empowering Multimodal Large Language Models for Forensics—0
Using customized GPT to develop prompting proficiency in architectural AI-generated images—0
The Future of MLLM Prompting is Adaptive: A Comprehensive Experimental Evaluation of Prompt Engineering Methods for Robust Multimodal Performance—0
LLM-based AI Agent for Sizing of Analog and Mixed Signal Circuit—0
Zero-shot Autonomous Microscopy for Scalable and Intelligent Characterization of 2D Materials—0
Evaluating the Bias in LLMs for Surveying Opinion and Decision Making in Healthcare—0
Learning from Elders: Making an LLM-powered Chatbot for Retirement Communities more Accessible through User-centered Design—0
Revisiting Prompt Optimization with Large Reasoning Models-A Case Study on Event Extraction—0
GAAPO: Genetic Algorithmic Applied to Prompt Optimization—0
Sugar-Coated Poison: Benign Generation Unlocks LLM JailbreakingCode0
On the Effectiveness and Generalization of Race Representations for Debiasing High-Stakes Decisions—0
DDPT: Diffusion-Driven Prompt Tuning for Large Language Model Code Generation—0
Cognitive Debiasing Large Language Models for Decision-Making—0
Bridging LMS and Generative AI: Dynamic Course Content Integration (DCCI) for Connecting LLMs to Course Content -- The Ask ME Assistant—0
PF3Det: A Prompted Foundation Feature Assisted Visual LiDAR 3D Detector—0
CoTAL: Human-in-the-Loop Prompt Engineering, Chain-of-Thought Reasoning, and Active Learning for Generalizable Formative Assessment Scoring—0
LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models—0
GeoRAG: A Question-Answering Approach from a Geographical Perspective—0
Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models—0
Catastrophic Forgetting in LLMs: A Comparative Analysis Across Language Tasks—0
A Systematic Evaluation of LLM Strategies for Mental Health Text Analysis: Fine-tuning vs. Prompt Engineering vs. RAG—0
GRASP: Municipal Budget AI Chatbots for Enhancing Civic Engagement—0
Modeling Challenging Patient Interactions: LLMs for Medical Communication Training—0
Show:102550
← PrevPage 8 of 25Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean77.62—Unverified
2Customized EnsembleHarmonic mean75.49—Unverified
3MMRLHarmonic mean74.45—Unverified
4MMRL++Harmonic mean74.44—Unverified
5CoPromptHarmonic mean74.33—Unverified
6HPT++Harmonic mean74.24—Unverified
7HPTHarmonic mean74.17—Unverified
8ProMetaRHarmonic mean74.09—Unverified
9MetaPromptHarmonic mean74.02—Unverified
10DePTHarmonic mean74.02—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean97.77—Unverified
2HPT++Harmonic mean96.96—Unverified
3MMRL++Harmonic mean96.75—Unverified
4MMRLHarmonic mean96.68—Unverified
5HPTHarmonic mean96.65—Unverified
6CoPromptHarmonic mean96.55—Unverified
7MetaPromptHarmonic mean96.32—Unverified
8DePTHarmonic mean96.28—Unverified
9ProMetaRHarmonic mean96.16—Unverified
10RPOHarmonic mean96.03—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean77.94—Unverified
2MMRL++Harmonic mean74.46—Unverified
3HPT++Harmonic mean74.23—Unverified
4MMRLHarmonic mean73.82—Unverified
5CoPromptHarmonic mean72.79—Unverified
6ProMetaRHarmonic mean72.31—Unverified
7HPTHarmonic mean72.16—Unverified
8PromptSRCHarmonic mean71.75—Unverified
9DePTHarmonic mean71.09—Unverified
10RPOHarmonic mean68.61—Unverified
#ModelMetricClaimedVerifiedStatus
1MMRL++Harmonic mean91.94—Unverified
2PromptKDHarmonic mean89.14—Unverified
3HPT++Harmonic mean87.36—Unverified
4MMRLHarmonic mean87.21—Unverified
5CoPromptHarmonic mean85.84—Unverified
6ProMetaRHarmonic mean85.3—Unverified
7DePTHarmonic mean84.88—Unverified
8HPTHarmonic mean84.82—Unverified
9MetaPromptHarmonic mean83.38—Unverified
10MaPLeHarmonic mean82.35—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean45.17—Unverified
2MMRL++Harmonic mean42.24—Unverified
3HPT++Harmonic mean41.33—Unverified
4MMRLHarmonic mean41.15—Unverified
5DePTHarmonic mean40.73—Unverified
6HPTHarmonic mean40.28—Unverified
7ProMetaRHarmonic mean40.25—Unverified
8PromptSRCHarmonic mean40.15—Unverified
9CoPromptHarmonic mean39.76—Unverified
10MetaPromptHarmonic mean38.24—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean90.24—Unverified
2HPTHarmonic mean87.16—Unverified
3MMRL++Harmonic mean87.01—Unverified
4MMRLHarmonic mean86.78—Unverified
5ProMetaRHarmonic mean86.7—Unverified
6DePTHarmonic mean86.46—Unverified
7PromptSRCHarmonic mean85.95—Unverified
8HPT++Harmonic mean85.85—Unverified
9CoPromptHarmonic mean85.71—Unverified
10MetaPromptHarmonic mean84.52—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean97.15—Unverified
2HPT++Harmonic mean96.91—Unverified
3CoPromptHarmonic mean96.87—Unverified
4MMRLHarmonic mean96.74—Unverified
5HPTHarmonic mean96.71—Unverified
6MaPLeHarmonic mean96.58—Unverified
7MMRL++Harmonic mean96.51—Unverified
8ProMetaRHarmonic mean96.49—Unverified
9CoCoOpHarmonic mean96.43—Unverified
10DePTHarmonic mean96.37—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean83.13—Unverified
2MMRL++Harmonic mean78.18—Unverified
3MMRLHarmonic mean78.06—Unverified
4DePTHarmonic mean77.79—Unverified
5ProMetaRHarmonic mean76.72—Unverified
6PromptSRCHarmonic mean76.58—Unverified
7CoPromptHarmonic mean75.66—Unverified
8HPT++Harmonic mean75.59—Unverified
9HPTHarmonic mean75.57—Unverified
10MetaPromptHarmonic mean75.48—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean82.6—Unverified
2CoPromptHarmonic mean81.31—Unverified
3MMRL++Harmonic mean81.28—Unverified
4MMRLHarmonic mean81.2—Unverified
5HPT++Harmonic mean81.11—Unverified
6DePTHarmonic mean81.06—Unverified
7HPTHarmonic mean80.88—Unverified
8ProMetaRHarmonic mean80.82—Unverified
9MetaPromptHarmonic mean80.62—Unverified
10PromptSRCHarmonic mean80.52—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean86.1—Unverified
2MMRLHarmonic mean83.89—Unverified
3HPT++Harmonic mean83.81—Unverified
4MMRL++Harmonic mean83.81—Unverified
5ProMetaRHarmonic mean83.25—Unverified
6HPTHarmonic mean83.16—Unverified
7CoPromptHarmonic mean83.07—Unverified
8PromptSRCHarmonic mean82.74—Unverified
9DePTHarmonic mean82.46—Unverified
10MetaPromptHarmonic mean81.35—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean93.05—Unverified
2CoPromptHarmonic mean91.4—Unverified
3MaPLeHarmonic mean91.38—Unverified
4ProMetaRHarmonic mean91.34—Unverified
5MetaPromptHarmonic mean91.29—Unverified
6DePTHarmonic mean91.22—Unverified
7MMRL++Harmonic mean91.1—Unverified
8PromptSRCHarmonic mean91.1—Unverified
9HPT++Harmonic mean91.09—Unverified
10MMRLHarmonic mean91.03—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %51.6—Unverified
2MMRLTop-1 accuracy %51.2—Unverified
3HPT++Top-1 accuracy %51.18—Unverified
4MaPLeTop-1 accuracy %50.9—Unverified
5PromptSRCTop-1 accuracy %50.9—Unverified
6HPTTop-1 accuracy %50.85—Unverified
7CoCoOpTop-1 accuracy %50.63—Unverified
8CoPromptTop-1 accuracy %50.5—Unverified
9CLIPTop-1 accuracy %47.77—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %77.9—Unverified
2PromptSRCTop-1 accuracy %77.8—Unverified
3MMRLTop-1 accuracy %77.53—Unverified
4HPT++Top-1 accuracy %77.52—Unverified
5CoPromptTop-1 accuracy %77.51—Unverified
6HPTTop-1 accuracy %77.38—Unverified
7MaPLeTop-1 accuracy %76.98—Unverified
8CoCoOPTop-1 accuracy %76.18—Unverified
9CLIPTop-1 accuracy %73.96—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %49.8—Unverified
2PromptSRCTop-1 accuracy %49.55—Unverified
3CoPromptTop-1 accuracy %49.43—Unverified
4HPTTop-1 accuracy %49.36—Unverified
5HPT++Top-1 accuracy %49.28—Unverified
6MMRLTop-1 accuracy %49.17—Unverified
7MaPLeTop-1 accuracy %49.15—Unverified
8CoCoOpTop-1 accuracy %48.75—Unverified
9CLIPTop-1 accuracy %46.15—Unverified
#ModelMetricClaimedVerifiedStatus
1HPT++Top-1 accuracy %65.31—Unverified
2HPTTop-1 accuracy %65.25—Unverified
3MMRLTop-1 accuracy %64.47—Unverified
4PromptSRCTop-1 accuracy %64.35—Unverified
5CoCoOpTop-1 accuracy %64.07—Unverified
6MaPLeTop-1 accuracy %64.07—Unverified
7POMPTop-1 accuracy %63.8—Unverified
8CLIPTop-1 accuracy %60.83—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPAccuracy25.3—Unverified
2VPTAccuracy24.8—Unverified