SOTAVerified

Prompt Engineering

Prompt engineering is the process of designing and refining the prompts used to generate text from language models, such as GPT-3 or similar models. The goal of prompt engineering is to improve the quality and relevance of the generated text by carefully crafting the prompts to elicit the desired responses from the model.

Prompt engineering involves several steps, including selecting the appropriate model architecture and parameters, designing the prompt format and structure, selecting the appropriate task and training data, and fine-tuning the model using the selected prompt and data.

Prompt engineering is a crucial step in the development of language models, as it can greatly influence the quality and effectiveness of the model's responses. By carefully designing and refining the prompts used to generate text, researchers and developers can improve the accuracy and relevance of the model's output, making it more useful for a wide range of applications, including chatbots, language translation, content creation, and more.

Papers

Showing 601–650 of 1236 papers

TitleStatusHype
Retrieval-augmented generation in multilingual settingsCode3
Actionable Cyber Threat Intelligence using Knowledge Graphs and Large Language Models—0
Large Language Models for Power Scheduling: A User-Centric ApproachCode1
Paraphrase Types Elicit Prompt Engineering CapabilitiesCode0
On Discrete Prompt Optimization for Diffusion ModelsCode2
Harnessing LLMs for Automated Video Content Analysis: An Exploratory Workflow of Short Videos on Depression—0
LoPT: Low-Rank Prompt Tuning for Parameter Efficient Language Models—0
AssertionBench: A Benchmark to Evaluate Large-Language Models for Assertion GenerationCode1
FactFinders at CheckThat! 2024: Refining Check-worthy Statement Detection with LLMs through Data PruningCode0
Autonomous Prompt Engineering in Large Language Models—0
Towards LLM-Powered Ambient Sensor Based Multi-Person Human Activity Recognition—0
CTBench: A Comprehensive Benchmark for Evaluating Language Model Capabilities in Clinical Trial DesignCode0
Large Language Models in Student Assessment: Comparing ChatGPT and Human Graders—0
AnnotatedTables: A Large Tabular Dataset with Language Model Annotations—0
Feature-prompting GBMSeg: One-Shot Reference Guided Training-Free Prompt Engineering for Glomerular Basement Membrane SegmentationCode1
Teach Better or Show Smarter? On Instructions and Exemplars in Automatic Prompt Optimization—0
V-RECS, a Low-Cost LLM4VIS Recommender with Explanations, Captioning and SuggestionsCode0
VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought—0
SPL: A Socratic Playground for Learning Powered by Large Language Model—0
APEER: Automatic Prompt Engineering Enhances Large Language Model Reranking—0
IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning—0
Accelerating Complex Disease Treatment through Network Medicine and GenAI: A Case Study on Drug Repurposing for Breast Cancer—0
What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt EngineeringCode0
Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive PrinciplesCode1
A Personalised Learning Tool for Physics Undergraduate Students Built On a Large Language Model for Symbolic Regression—0
GAugLLM: Improving Graph Contrastive Learning for Text-Attributed Graphs with Large Language ModelsCode1
Grade Score: Quantifying LLM Performance in Option SelectionCode0
Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9—0
RePrompt: Planning by Automatic Prompt Engineering for Large Language Models Agents—0
Demonstration Notebook: Finding the Most Suited In-Context Learning Example from Interactions—0
Self-Reflection Outcome is Sensitive to Prompt ConstructionCode0
Efficient Prompting for LLM-based Generative Internet of Things—0
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language ModelsCode2
Chain-of-Scrutiny: Detecting Backdoor Attacks for Large Language ModelsCode0
A Large Language Model Pipeline for Breast Cancer Oncology—0
Can Prompt Modifiers Control Bias? A Comparative Analysis of Text-to-Image Generative Models—0
On the Worst Prompt Performance of Large Language ModelsCode1
Planning Like Human: A Dual-process Framework for Dialogue PlanningCode1
Creativity Has Left the Chat: The Price of Debiasing Language Models—0
Is On-Device AI Broken and Exploitable? Assessing the Trust and Ethics in Small Language Models—0
The Prompt Report: A Systematic Survey of Prompting TechniquesCode7
llmNER: (Zero|Few)-Shot Named Entity Recognition, Exploiting the Power of Large Language Models—0
Online Joint Fine-tuning of Multi-Agent FlowsCode1
LLplace: The 3D Indoor Scene Layout Generation and Editing via Large Language Model—0
POEM: Interactive Prompt Optimization for Enhancing Multimodal Reasoning of Large Language Models—0
PaCE: Parsimonious Concept Engineering for Large Language ModelsCode1
Attend and Enrich: Enhanced Visual Prompt for Zero-Shot Learning—0
HoneyGPT: Breaking the Trilemma in Terminal Honeypots with Large Language Model—0
VerilogReader: LLM-Aided Hardware Test GenerationCode1
Applying Fine-Tuned LLMs for Reducing Data Needs in Load Profile Analysis—0
Show:102550
← PrevPage 13 of 25Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean77.62—Unverified
2Customized EnsembleHarmonic mean75.49—Unverified
3MMRLHarmonic mean74.45—Unverified
4MMRL++Harmonic mean74.44—Unverified
5CoPromptHarmonic mean74.33—Unverified
6HPT++Harmonic mean74.24—Unverified
7HPTHarmonic mean74.17—Unverified
8ProMetaRHarmonic mean74.09—Unverified
9MetaPromptHarmonic mean74.02—Unverified
10DePTHarmonic mean74.02—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean97.77—Unverified
2HPT++Harmonic mean96.96—Unverified
3MMRL++Harmonic mean96.75—Unverified
4MMRLHarmonic mean96.68—Unverified
5HPTHarmonic mean96.65—Unverified
6CoPromptHarmonic mean96.55—Unverified
7MetaPromptHarmonic mean96.32—Unverified
8DePTHarmonic mean96.28—Unverified
9ProMetaRHarmonic mean96.16—Unverified
10RPOHarmonic mean96.03—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean77.94—Unverified
2MMRL++Harmonic mean74.46—Unverified
3HPT++Harmonic mean74.23—Unverified
4MMRLHarmonic mean73.82—Unverified
5CoPromptHarmonic mean72.79—Unverified
6ProMetaRHarmonic mean72.31—Unverified
7HPTHarmonic mean72.16—Unverified
8PromptSRCHarmonic mean71.75—Unverified
9DePTHarmonic mean71.09—Unverified
10RPOHarmonic mean68.61—Unverified
#ModelMetricClaimedVerifiedStatus
1MMRL++Harmonic mean91.94—Unverified
2PromptKDHarmonic mean89.14—Unverified
3HPT++Harmonic mean87.36—Unverified
4MMRLHarmonic mean87.21—Unverified
5CoPromptHarmonic mean85.84—Unverified
6ProMetaRHarmonic mean85.3—Unverified
7DePTHarmonic mean84.88—Unverified
8HPTHarmonic mean84.82—Unverified
9MetaPromptHarmonic mean83.38—Unverified
10MaPLeHarmonic mean82.35—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean45.17—Unverified
2MMRL++Harmonic mean42.24—Unverified
3HPT++Harmonic mean41.33—Unverified
4MMRLHarmonic mean41.15—Unverified
5DePTHarmonic mean40.73—Unverified
6HPTHarmonic mean40.28—Unverified
7ProMetaRHarmonic mean40.25—Unverified
8PromptSRCHarmonic mean40.15—Unverified
9CoPromptHarmonic mean39.76—Unverified
10MetaPromptHarmonic mean38.24—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean90.24—Unverified
2HPTHarmonic mean87.16—Unverified
3MMRL++Harmonic mean87.01—Unverified
4MMRLHarmonic mean86.78—Unverified
5ProMetaRHarmonic mean86.7—Unverified
6DePTHarmonic mean86.46—Unverified
7PromptSRCHarmonic mean85.95—Unverified
8HPT++Harmonic mean85.85—Unverified
9CoPromptHarmonic mean85.71—Unverified
10MetaPromptHarmonic mean84.52—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean97.15—Unverified
2HPT++Harmonic mean96.91—Unverified
3CoPromptHarmonic mean96.87—Unverified
4MMRLHarmonic mean96.74—Unverified
5HPTHarmonic mean96.71—Unverified
6MaPLeHarmonic mean96.58—Unverified
7MMRL++Harmonic mean96.51—Unverified
8ProMetaRHarmonic mean96.49—Unverified
9CoCoOpHarmonic mean96.43—Unverified
10DePTHarmonic mean96.37—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean83.13—Unverified
2MMRL++Harmonic mean78.18—Unverified
3MMRLHarmonic mean78.06—Unverified
4DePTHarmonic mean77.79—Unverified
5ProMetaRHarmonic mean76.72—Unverified
6PromptSRCHarmonic mean76.58—Unverified
7CoPromptHarmonic mean75.66—Unverified
8HPT++Harmonic mean75.59—Unverified
9HPTHarmonic mean75.57—Unverified
10MetaPromptHarmonic mean75.48—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean82.6—Unverified
2CoPromptHarmonic mean81.31—Unverified
3MMRL++Harmonic mean81.28—Unverified
4MMRLHarmonic mean81.2—Unverified
5HPT++Harmonic mean81.11—Unverified
6DePTHarmonic mean81.06—Unverified
7HPTHarmonic mean80.88—Unverified
8ProMetaRHarmonic mean80.82—Unverified
9MetaPromptHarmonic mean80.62—Unverified
10PromptSRCHarmonic mean80.52—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean86.1—Unverified
2MMRLHarmonic mean83.89—Unverified
3HPT++Harmonic mean83.81—Unverified
4MMRL++Harmonic mean83.81—Unverified
5ProMetaRHarmonic mean83.25—Unverified
6HPTHarmonic mean83.16—Unverified
7CoPromptHarmonic mean83.07—Unverified
8PromptSRCHarmonic mean82.74—Unverified
9DePTHarmonic mean82.46—Unverified
10MetaPromptHarmonic mean81.35—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean93.05—Unverified
2CoPromptHarmonic mean91.4—Unverified
3MaPLeHarmonic mean91.38—Unverified
4ProMetaRHarmonic mean91.34—Unverified
5MetaPromptHarmonic mean91.29—Unverified
6DePTHarmonic mean91.22—Unverified
7MMRL++Harmonic mean91.1—Unverified
8PromptSRCHarmonic mean91.1—Unverified
9HPT++Harmonic mean91.09—Unverified
10MMRLHarmonic mean91.03—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %51.6—Unverified
2MMRLTop-1 accuracy %51.2—Unverified
3HPT++Top-1 accuracy %51.18—Unverified
4MaPLeTop-1 accuracy %50.9—Unverified
5PromptSRCTop-1 accuracy %50.9—Unverified
6HPTTop-1 accuracy %50.85—Unverified
7CoCoOpTop-1 accuracy %50.63—Unverified
8CoPromptTop-1 accuracy %50.5—Unverified
9CLIPTop-1 accuracy %47.77—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %77.9—Unverified
2PromptSRCTop-1 accuracy %77.8—Unverified
3MMRLTop-1 accuracy %77.53—Unverified
4HPT++Top-1 accuracy %77.52—Unverified
5CoPromptTop-1 accuracy %77.51—Unverified
6HPTTop-1 accuracy %77.38—Unverified
7MaPLeTop-1 accuracy %76.98—Unverified
8CoCoOPTop-1 accuracy %76.18—Unverified
9CLIPTop-1 accuracy %73.96—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %49.8—Unverified
2PromptSRCTop-1 accuracy %49.55—Unverified
3CoPromptTop-1 accuracy %49.43—Unverified
4HPTTop-1 accuracy %49.36—Unverified
5HPT++Top-1 accuracy %49.28—Unverified
6MMRLTop-1 accuracy %49.17—Unverified
7MaPLeTop-1 accuracy %49.15—Unverified
8CoCoOpTop-1 accuracy %48.75—Unverified
9CLIPTop-1 accuracy %46.15—Unverified
#ModelMetricClaimedVerifiedStatus
1HPT++Top-1 accuracy %65.31—Unverified
2HPTTop-1 accuracy %65.25—Unverified
3MMRLTop-1 accuracy %64.47—Unverified
4PromptSRCTop-1 accuracy %64.35—Unverified
5CoCoOpTop-1 accuracy %64.07—Unverified
6MaPLeTop-1 accuracy %64.07—Unverified
7POMPTop-1 accuracy %63.8—Unverified
8CLIPTop-1 accuracy %60.83—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPAccuracy25.3—Unverified
2VPTAccuracy24.8—Unverified