SOTAVerified

Prompt Engineering

Prompt engineering is the process of designing and refining the prompts used to generate text from language models, such as GPT-3 or similar models. The goal of prompt engineering is to improve the quality and relevance of the generated text by carefully crafting the prompts to elicit the desired responses from the model.

Prompt engineering involves several steps, including selecting the appropriate model architecture and parameters, designing the prompt format and structure, selecting the appropriate task and training data, and fine-tuning the model using the selected prompt and data.

Prompt engineering is a crucial step in the development of language models, as it can greatly influence the quality and effectiveness of the model's responses. By carefully designing and refining the prompts used to generate text, researchers and developers can improve the accuracy and relevance of the model's output, making it more useful for a wide range of applications, including chatbots, language translation, content creation, and more.

Papers

Showing 326–350 of 1236 papers

TitleStatusHype
Enabling On-Device LLMs Personalization with Smartphone Sensing—0
Can Large Language Models Capture Public Opinion about Global Warming? An Empirical Assessment of Algorithmic Fidelity and Bias—0
A Review of Multi-Modal Large Language and Vision Models—0
A Review of 3D Object Detection with Vision-Language Models—0
Can GPT tell us why these images are synthesized? Empowering Multimodal Large Language Models for Forensics—0
Embedding Large Language Models into Extended Reality: Opportunities and Challenges for Inclusion, Engagement, and Privacy—0
Can GPT-4 Models Detect Misleading Visualizations?—0
Can Generated Images Serve as a Viable Modality for Text-Centric Multimodal Learning?—0
A Reliable Knowledge Processing Framework for Combustion Science using Foundation Models—0
AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents—0
From Legal Texts to Defeasible Deontic Logic via LLMs: A Study in Automated Semantic Analysis—0
Efficient Prompting Methods for Large Language Models: A Survey—0
Emotional Manipulation Through Prompt Engineering Amplifies Disinformation Generation in AI Large Language Models—0
Convergences and Divergences between Automatic Assessment and Human Evaluation: Insights from Comparing ChatGPT-Generated Translation and Neural Machine Translation—0
Can ChatGPT Overcome Behavioral Biases in the Financial Sector? Classify-and-Rethink: Multi-Step Zero-Shot Reasoning in the Gold Investment—0
Are Frontier Large Language Models Suitable for Q&A in Science Centres?—0
Can ChatGPT implement finite element models for geotechnical engineering applications?—0
A Communication Theory Perspective on Prompting Engineering Methods for Large Language Models—0
Can Artificial Intelligence Generate Quality Research Topics Reflecting Patient Concerns?—0
Can AI Read Between The Lines? Benchmarking LLMs On Financial Nuance—0
Arbitrary Data as Images: Fusion of Patient Data Across Modalities and Irregular Intervals with Vision Transformers—0
Can a GPT4-Powered AI Agent Be a Good Enough Performance Attribution Analyst?—0
CallNavi, A Challenge and Empirical Study on LLM Function Calling and Routing—0
A Prompt Refinement-based Large Language Model for Metro Passenger Flow Forecasting under Delay Conditions—0
A Framework for Ranking Content Providers Using Prompt Engineering and Self-Attention Network—0
Show:102550
← PrevPage 14 of 50Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean77.62—Unverified
2Customized EnsembleHarmonic mean75.49—Unverified
3MMRLHarmonic mean74.45—Unverified
4MMRL++Harmonic mean74.44—Unverified
5CoPromptHarmonic mean74.33—Unverified
6HPT++Harmonic mean74.24—Unverified
7HPTHarmonic mean74.17—Unverified
8ProMetaRHarmonic mean74.09—Unverified
9MetaPromptHarmonic mean74.02—Unverified
10DePTHarmonic mean74.02—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean97.77—Unverified
2HPT++Harmonic mean96.96—Unverified
3MMRL++Harmonic mean96.75—Unverified
4MMRLHarmonic mean96.68—Unverified
5HPTHarmonic mean96.65—Unverified
6CoPromptHarmonic mean96.55—Unverified
7MetaPromptHarmonic mean96.32—Unverified
8DePTHarmonic mean96.28—Unverified
9ProMetaRHarmonic mean96.16—Unverified
10RPOHarmonic mean96.03—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean77.94—Unverified
2MMRL++Harmonic mean74.46—Unverified
3HPT++Harmonic mean74.23—Unverified
4MMRLHarmonic mean73.82—Unverified
5CoPromptHarmonic mean72.79—Unverified
6ProMetaRHarmonic mean72.31—Unverified
7HPTHarmonic mean72.16—Unverified
8PromptSRCHarmonic mean71.75—Unverified
9DePTHarmonic mean71.09—Unverified
10RPOHarmonic mean68.61—Unverified
#ModelMetricClaimedVerifiedStatus
1MMRL++Harmonic mean91.94—Unverified
2PromptKDHarmonic mean89.14—Unverified
3HPT++Harmonic mean87.36—Unverified
4MMRLHarmonic mean87.21—Unverified
5CoPromptHarmonic mean85.84—Unverified
6ProMetaRHarmonic mean85.3—Unverified
7DePTHarmonic mean84.88—Unverified
8HPTHarmonic mean84.82—Unverified
9MetaPromptHarmonic mean83.38—Unverified
10MaPLeHarmonic mean82.35—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean45.17—Unverified
2MMRL++Harmonic mean42.24—Unverified
3HPT++Harmonic mean41.33—Unverified
4MMRLHarmonic mean41.15—Unverified
5DePTHarmonic mean40.73—Unverified
6HPTHarmonic mean40.28—Unverified
7ProMetaRHarmonic mean40.25—Unverified
8PromptSRCHarmonic mean40.15—Unverified
9CoPromptHarmonic mean39.76—Unverified
10MetaPromptHarmonic mean38.24—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean90.24—Unverified
2HPTHarmonic mean87.16—Unverified
3MMRL++Harmonic mean87.01—Unverified
4MMRLHarmonic mean86.78—Unverified
5ProMetaRHarmonic mean86.7—Unverified
6DePTHarmonic mean86.46—Unverified
7PromptSRCHarmonic mean85.95—Unverified
8HPT++Harmonic mean85.85—Unverified
9CoPromptHarmonic mean85.71—Unverified
10MetaPromptHarmonic mean84.52—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean97.15—Unverified
2HPT++Harmonic mean96.91—Unverified
3CoPromptHarmonic mean96.87—Unverified
4MMRLHarmonic mean96.74—Unverified
5HPTHarmonic mean96.71—Unverified
6MaPLeHarmonic mean96.58—Unverified
7MMRL++Harmonic mean96.51—Unverified
8ProMetaRHarmonic mean96.49—Unverified
9CoCoOpHarmonic mean96.43—Unverified
10DePTHarmonic mean96.37—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean83.13—Unverified
2MMRL++Harmonic mean78.18—Unverified
3MMRLHarmonic mean78.06—Unverified
4DePTHarmonic mean77.79—Unverified
5ProMetaRHarmonic mean76.72—Unverified
6PromptSRCHarmonic mean76.58—Unverified
7CoPromptHarmonic mean75.66—Unverified
8HPT++Harmonic mean75.59—Unverified
9HPTHarmonic mean75.57—Unverified
10MetaPromptHarmonic mean75.48—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean82.6—Unverified
2CoPromptHarmonic mean81.31—Unverified
3MMRL++Harmonic mean81.28—Unverified
4MMRLHarmonic mean81.2—Unverified
5HPT++Harmonic mean81.11—Unverified
6DePTHarmonic mean81.06—Unverified
7HPTHarmonic mean80.88—Unverified
8ProMetaRHarmonic mean80.82—Unverified
9MetaPromptHarmonic mean80.62—Unverified
10PromptSRCHarmonic mean80.52—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean86.1—Unverified
2MMRLHarmonic mean83.89—Unverified
3HPT++Harmonic mean83.81—Unverified
4MMRL++Harmonic mean83.81—Unverified
5ProMetaRHarmonic mean83.25—Unverified
6HPTHarmonic mean83.16—Unverified
7CoPromptHarmonic mean83.07—Unverified
8PromptSRCHarmonic mean82.74—Unverified
9DePTHarmonic mean82.46—Unverified
10MetaPromptHarmonic mean81.35—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean93.05—Unverified
2CoPromptHarmonic mean91.4—Unverified
3MaPLeHarmonic mean91.38—Unverified
4ProMetaRHarmonic mean91.34—Unverified
5MetaPromptHarmonic mean91.29—Unverified
6DePTHarmonic mean91.22—Unverified
7MMRL++Harmonic mean91.1—Unverified
8PromptSRCHarmonic mean91.1—Unverified
9HPT++Harmonic mean91.09—Unverified
10MMRLHarmonic mean91.03—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %51.6—Unverified
2MMRLTop-1 accuracy %51.2—Unverified
3HPT++Top-1 accuracy %51.18—Unverified
4MaPLeTop-1 accuracy %50.9—Unverified
5PromptSRCTop-1 accuracy %50.9—Unverified
6HPTTop-1 accuracy %50.85—Unverified
7CoCoOpTop-1 accuracy %50.63—Unverified
8CoPromptTop-1 accuracy %50.5—Unverified
9CLIPTop-1 accuracy %47.77—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %77.9—Unverified
2PromptSRCTop-1 accuracy %77.8—Unverified
3MMRLTop-1 accuracy %77.53—Unverified
4HPT++Top-1 accuracy %77.52—Unverified
5CoPromptTop-1 accuracy %77.51—Unverified
6HPTTop-1 accuracy %77.38—Unverified
7MaPLeTop-1 accuracy %76.98—Unverified
8CoCoOPTop-1 accuracy %76.18—Unverified
9CLIPTop-1 accuracy %73.96—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %49.8—Unverified
2PromptSRCTop-1 accuracy %49.55—Unverified
3CoPromptTop-1 accuracy %49.43—Unverified
4HPTTop-1 accuracy %49.36—Unverified
5HPT++Top-1 accuracy %49.28—Unverified
6MMRLTop-1 accuracy %49.17—Unverified
7MaPLeTop-1 accuracy %49.15—Unverified
8CoCoOpTop-1 accuracy %48.75—Unverified
9CLIPTop-1 accuracy %46.15—Unverified
#ModelMetricClaimedVerifiedStatus
1HPT++Top-1 accuracy %65.31—Unverified
2HPTTop-1 accuracy %65.25—Unverified
3MMRLTop-1 accuracy %64.47—Unverified
4PromptSRCTop-1 accuracy %64.35—Unverified
5CoCoOpTop-1 accuracy %64.07—Unverified
6MaPLeTop-1 accuracy %64.07—Unverified
7POMPTop-1 accuracy %63.8—Unverified
8CLIPTop-1 accuracy %60.83—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPAccuracy25.3—Unverified
2VPTAccuracy24.8—Unverified