SOTAVerified

Prompt Engineering

Prompt engineering is the process of designing and refining the prompts used to generate text from language models, such as GPT-3 or similar models. The goal of prompt engineering is to improve the quality and relevance of the generated text by carefully crafting the prompts to elicit the desired responses from the model.

Prompt engineering involves several steps, including selecting the appropriate model architecture and parameters, designing the prompt format and structure, selecting the appropriate task and training data, and fine-tuning the model using the selected prompt and data.

Prompt engineering is a crucial step in the development of language models, as it can greatly influence the quality and effectiveness of the model's responses. By carefully designing and refining the prompts used to generate text, researchers and developers can improve the accuracy and relevance of the model's output, making it more useful for a wide range of applications, including chatbots, language translation, content creation, and more.

Papers

Showing 401–450 of 1236 papers

TitleStatusHype
Ask, and it shall be given: On the Turing completeness of promptingCode0
Evaluating the Ability of Large Language Models to Generate Verifiable Specifications in VeriFast—0
Defining and Evaluating Physical Safety for Large Language Models—0
Explainable cognitive decline detection in free dialogues with a Machine Learning approach based on pre-trained Large Language Models—0
An Exploration of Higher Education Course Evaluation by Large Language Models—0
Ontology Population using LLMs—0
Schema Augmentation for Zero-Shot Domain Adaptation in Dialogue State Tracking—0
Large Language Models for Patient Comments Multi-Label Classification—0
Leveraging Large Language Models for Code Translation and Software Development in Scientific ComputingCode0
A Comparison of Prompt Engineering Techniques for Task Planning and Execution in Service RoboticsCode0
Automatic programming via large language models with population self-evolution for dynamic job shop scheduling problem—0
SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt TypesCode1
From Cool Demos to Production-Ready FMware: Core Challenges and a Technology Roadmap—0
Combining Domain-Specific Models and LLMs for Automated Disease Phenotyping from Survey Data—0
Rethinking Data Synthesis: A Teacher Model Training Recipe with Interpretation—0
Generative AI in Health Economics and Outcomes Research: A Taxonomy of Key Definitions and Emerging Applications, an ISPOR Working Group Report—0
Provable optimal transport with transformers: The essence of depth and prompt engineeringCode0
Introducing MAPO: Momentum-Aided Gradient Descent Prompt Optimization—0
Intelligent Understanding of Large Language Models in Traditional Chinese Medicine Based on Prompt Engineering Framework—0
Investigating the Role of Prompting and External Tools in Hallucination Rates of Large Language Models—0
Inference time LLM alignment in single and multidomain preference spectrum—0
Demystifying Large Language Models for Medicine: A PrimerCode1
Benchmarking Foundation Models on Exceptional Cases: Dataset Creation and ValidationCode0
Lightweight Neural App Control—0
DNAHLM -- DNA sequence and Human Language mixed large language ModelCode0
GeoCode-GPT: A Large Language Model for Geospatial Code Generation Tasks—0
Generative Design of Functional Metal Complexes Utilizing the Internal Knowledge of Large Language Models—0
PromptHive: Bringing Subject Matter Experts Back to the Forefront with Collaborative Prompt Engineering for Educational Content Creation—0
Comparative Study of Multilingual Idioms and Similes in Large Language ModelsCode0
Causality for Large Language ModelsCode1
A Prompt Refinement-based Large Language Model for Metro Passenger Flow Forecasting under Delay Conditions—0
A Prompt Engineering Approach and a Knowledge Graph based Framework for Tackling Legal Implications of Large Language Model Answers—0
ChartifyText: Automated Chart Generation from Data-Involved Texts via LLM—0
CELI: Controller-Embedded Language Model Interactions—0
Do LLMs "know" internally when they follow instructions?Code1
Rationale Behind Essay Scores: Enhancing S-LLM's Multi-Trait Essay Scoring with Rationale Generated by LLMs—0
CLIP-VAD: Exploiting Vision-Language Models for Voice Activity Detection—0
SouLLMate: An Application Enhancing Diverse Mental Health Support with Adaptive LLMs, Prompt Engineering, and RAG Techniques—0
SAMReg: SAM-enabled Image Registration with ROI-based Correspondence—0
MCQG-SRefine: Multiple Choice Question Generation and Evaluation with Iterative Self-Critique, Correction, and Comparison FeedbackCode0
PromptExp: Multi-granularity Prompt Explanation of Large Language Models—0
Self-Pluralising Culture Alignment for Large Language ModelsCode0
Comprehending Knowledge Graphs with Large Language Models for Recommender Systems—0
Multi-round jailbreak attack on large language models—0
Athena: Retrieval-augmented Legal Judgment Prediction with Large Language Models—0
Performance in a dialectal profiling task of LLMs for varieties of Brazilian Portuguese—0
A Systematic Review on Prompt Engineering in Large Language Models for K-12 STEM Education—0
Large Language Models Are Active Critics in NLG Evaluation—0
StraGo: Harnessing Strategic Guidance for Prompt Optimization—0
AMPO: Automatic Multi-Branched Prompt Optimization—0
Show:102550
← PrevPage 9 of 25Next →

Benchmark Results

#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean77.62—Unverified
2Customized EnsembleHarmonic mean75.49—Unverified
3MMRLHarmonic mean74.45—Unverified
4MMRL++Harmonic mean74.44—Unverified
5CoPromptHarmonic mean74.33—Unverified
6HPT++Harmonic mean74.24—Unverified
7HPTHarmonic mean74.17—Unverified
8ProMetaRHarmonic mean74.09—Unverified
9MetaPromptHarmonic mean74.02—Unverified
10DePTHarmonic mean74.02—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean97.77—Unverified
2HPT++Harmonic mean96.96—Unverified
3MMRL++Harmonic mean96.75—Unverified
4MMRLHarmonic mean96.68—Unverified
5HPTHarmonic mean96.65—Unverified
6CoPromptHarmonic mean96.55—Unverified
7MetaPromptHarmonic mean96.32—Unverified
8DePTHarmonic mean96.28—Unverified
9ProMetaRHarmonic mean96.16—Unverified
10RPOHarmonic mean96.03—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean77.94—Unverified
2MMRL++Harmonic mean74.46—Unverified
3HPT++Harmonic mean74.23—Unverified
4MMRLHarmonic mean73.82—Unverified
5CoPromptHarmonic mean72.79—Unverified
6ProMetaRHarmonic mean72.31—Unverified
7HPTHarmonic mean72.16—Unverified
8PromptSRCHarmonic mean71.75—Unverified
9DePTHarmonic mean71.09—Unverified
10RPOHarmonic mean68.61—Unverified
#ModelMetricClaimedVerifiedStatus
1MMRL++Harmonic mean91.94—Unverified
2PromptKDHarmonic mean89.14—Unverified
3HPT++Harmonic mean87.36—Unverified
4MMRLHarmonic mean87.21—Unverified
5CoPromptHarmonic mean85.84—Unverified
6ProMetaRHarmonic mean85.3—Unverified
7DePTHarmonic mean84.88—Unverified
8HPTHarmonic mean84.82—Unverified
9MetaPromptHarmonic mean83.38—Unverified
10MaPLeHarmonic mean82.35—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean45.17—Unverified
2MMRL++Harmonic mean42.24—Unverified
3HPT++Harmonic mean41.33—Unverified
4MMRLHarmonic mean41.15—Unverified
5DePTHarmonic mean40.73—Unverified
6HPTHarmonic mean40.28—Unverified
7ProMetaRHarmonic mean40.25—Unverified
8PromptSRCHarmonic mean40.15—Unverified
9CoPromptHarmonic mean39.76—Unverified
10MetaPromptHarmonic mean38.24—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean90.24—Unverified
2HPTHarmonic mean87.16—Unverified
3MMRL++Harmonic mean87.01—Unverified
4MMRLHarmonic mean86.78—Unverified
5ProMetaRHarmonic mean86.7—Unverified
6DePTHarmonic mean86.46—Unverified
7PromptSRCHarmonic mean85.95—Unverified
8HPT++Harmonic mean85.85—Unverified
9CoPromptHarmonic mean85.71—Unverified
10MetaPromptHarmonic mean84.52—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean97.15—Unverified
2HPT++Harmonic mean96.91—Unverified
3CoPromptHarmonic mean96.87—Unverified
4MMRLHarmonic mean96.74—Unverified
5HPTHarmonic mean96.71—Unverified
6MaPLeHarmonic mean96.58—Unverified
7MMRL++Harmonic mean96.51—Unverified
8ProMetaRHarmonic mean96.49—Unverified
9CoCoOpHarmonic mean96.43—Unverified
10DePTHarmonic mean96.37—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean83.13—Unverified
2MMRL++Harmonic mean78.18—Unverified
3MMRLHarmonic mean78.06—Unverified
4DePTHarmonic mean77.79—Unverified
5ProMetaRHarmonic mean76.72—Unverified
6PromptSRCHarmonic mean76.58—Unverified
7CoPromptHarmonic mean75.66—Unverified
8HPT++Harmonic mean75.59—Unverified
9HPTHarmonic mean75.57—Unverified
10MetaPromptHarmonic mean75.48—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean82.6—Unverified
2CoPromptHarmonic mean81.31—Unverified
3MMRL++Harmonic mean81.28—Unverified
4MMRLHarmonic mean81.2—Unverified
5HPT++Harmonic mean81.11—Unverified
6DePTHarmonic mean81.06—Unverified
7HPTHarmonic mean80.88—Unverified
8ProMetaRHarmonic mean80.82—Unverified
9MetaPromptHarmonic mean80.62—Unverified
10PromptSRCHarmonic mean80.52—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean86.1—Unverified
2MMRLHarmonic mean83.89—Unverified
3HPT++Harmonic mean83.81—Unverified
4MMRL++Harmonic mean83.81—Unverified
5ProMetaRHarmonic mean83.25—Unverified
6HPTHarmonic mean83.16—Unverified
7CoPromptHarmonic mean83.07—Unverified
8PromptSRCHarmonic mean82.74—Unverified
9DePTHarmonic mean82.46—Unverified
10MetaPromptHarmonic mean81.35—Unverified
#ModelMetricClaimedVerifiedStatus
1PromptKDHarmonic mean93.05—Unverified
2CoPromptHarmonic mean91.4—Unverified
3MaPLeHarmonic mean91.38—Unverified
4ProMetaRHarmonic mean91.34—Unverified
5MetaPromptHarmonic mean91.29—Unverified
6DePTHarmonic mean91.22—Unverified
7MMRL++Harmonic mean91.1—Unverified
8PromptSRCHarmonic mean91.1—Unverified
9HPT++Harmonic mean91.09—Unverified
10MMRLHarmonic mean91.03—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %51.6—Unverified
2MMRLTop-1 accuracy %51.2—Unverified
3HPT++Top-1 accuracy %51.18—Unverified
4MaPLeTop-1 accuracy %50.9—Unverified
5PromptSRCTop-1 accuracy %50.9—Unverified
6HPTTop-1 accuracy %50.85—Unverified
7CoCoOpTop-1 accuracy %50.63—Unverified
8CoPromptTop-1 accuracy %50.5—Unverified
9CLIPTop-1 accuracy %47.77—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %77.9—Unverified
2PromptSRCTop-1 accuracy %77.8—Unverified
3MMRLTop-1 accuracy %77.53—Unverified
4HPT++Top-1 accuracy %77.52—Unverified
5CoPromptTop-1 accuracy %77.51—Unverified
6HPTTop-1 accuracy %77.38—Unverified
7MaPLeTop-1 accuracy %76.98—Unverified
8CoCoOPTop-1 accuracy %76.18—Unverified
9CLIPTop-1 accuracy %73.96—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPTop-1 accuracy %49.8—Unverified
2PromptSRCTop-1 accuracy %49.55—Unverified
3CoPromptTop-1 accuracy %49.43—Unverified
4HPTTop-1 accuracy %49.36—Unverified
5HPT++Top-1 accuracy %49.28—Unverified
6MMRLTop-1 accuracy %49.17—Unverified
7MaPLeTop-1 accuracy %49.15—Unverified
8CoCoOpTop-1 accuracy %48.75—Unverified
9CLIPTop-1 accuracy %46.15—Unverified
#ModelMetricClaimedVerifiedStatus
1HPT++Top-1 accuracy %65.31—Unverified
2HPTTop-1 accuracy %65.25—Unverified
3MMRLTop-1 accuracy %64.47—Unverified
4PromptSRCTop-1 accuracy %64.35—Unverified
5CoCoOpTop-1 accuracy %64.07—Unverified
6MaPLeTop-1 accuracy %64.07—Unverified
7POMPTop-1 accuracy %63.8—Unverified
8CLIPTop-1 accuracy %60.83—Unverified
#ModelMetricClaimedVerifiedStatus
1POMPAccuracy25.3—Unverified
2VPTAccuracy24.8—Unverified